Skip to content

About

YOLOv8 based project that aims to correctly detect most important polish traffic signs.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Latest commit

 

History

2 Commits

Folders and files

Repository files navigation

Wykorzystanie YOLOv8 do problemu detekcji obrazów, znaki drogowe

Projekt edukacyjny - obejmuje wykorzystanie modelu YOLOv8 do detekcji obrazów z kamery w szczególnym kontekście asystenta wspomagającego kierowcę drogowego. Celem nadrzędnym było sprawdzenie działania bazowego algorytmu, a następnie analiza procesu dotrenowania (fine-tuningu) na połączonym zbiorze danych.

Zbiór danych i założenia badawcze

Do wytrenowania modelu wykorzystano połączony zbiór danych, bazujący na dwóch niezależnych źródłach:

  • Self Driving Cars (Roboflow Universe) - zbiór charakteryzujący się znaczną wariancją optyczną, zawierający przykłady rozmaitych znaków drogowych rejestrowanych z perspektywy centralnej kamery samochodowej.
  • Polish Traffic Signs Dataset (Kaggle) - skąd wyekstrahowano dwie dodatkowe klasy: znak A-7 (Ustąp pierwszeństwa) oraz znak D-1 (Droga z pierwszeństwem). Zdjęcia tych specyficznych klas to wyłącznie skrajnie przybliżone wycinki (wypełniające kadr blisko w 100%). Umożliwiło to eksperymentalną ewaluację wpływu zmiany skali na możliwości detekcyjne układu splotowego.

Środowisko i proces trenowania

Trening zrealizowano przy użyciu biblioteki PyTorch na akceleratorze graficznym NVIDIA Tesla T4 w środowisku Google Colab. Inicjalizacja procesu uczenia bazowała na transferze pre-trenowanych wag z modelu YOLOv8n.

Zastosowano mechanizm wczesnego zatrzymania. Wprowadzenie parametru patience=50 spowodowało wymuszenie zakończenia procesu wstecznej propagacji chwilę przed osiągnięciem 200. epoki, w związku ze stagnacją w optymalizacji błędu walidacyjnego.

Ewaluacja modelu i metryki

Tabela wygenerowana po zakończeniu procesu ewaluacji wskazuje na bardzo dobre metryki na zbiorze testowym, szczególnie dla bliskich klas A-7 oraz D-1, gdzie precyzja osiąga wartości bliskie jedności.

Metryki ewaluacyjne

Znormalizowana macierz pomyłek (Confusion Matrix) ukazuje wysoką dokładność klasyfikacyjną, z obserwowalnymi jednak zjawiskami typu False Positive w przypadku błędnej interpretacji tła oraz pominięciami dla obiektów stosunkowo małych w kadrze, jak sygnalizatory świetlne w oddali.

Macierz pomyłek

Wnioski z badań: Zjawisko wariancji skali

Zasadniczą częścią badania było zestawienie wyników walidacji z faktyczną zdolnością wnioskowania sieci (inferencji) na nowych, dynamicznych sekwencjach wideo pochodzących z wideorejestratorów drogowych. Eksperyment pozwolił wyciągnąć empiryczne wnioski w kontekście zagadnienia wariancji skali (Scale Variance).

Zgodnie z weryfikacją, sieć neuronowa trenowana w oparciu o wyekstrahowane i wysoce przybliżone znaki (np. A-7), poprawnie je rozpoznaje z momentem pełnego zbliżenia i wypełnienia matrycy w wizji lokalnej:

Znak sklasyfikowany poprawnie z bliska

Niemniej jednak, poddając analizie ten sam znak zarejestrowany kilka sekund wcześniej - ze znacznej odległości, z widocznym kontekstem drogowym - sieć nie przydziela żadnej etykiety. Oznacza to brak mechanizmu abstrakcji i zdolności wyodrębnienia tego obiektu z oddali, ze względu na ograniczenia zaaplikowane we wprowadzonym podzbiorze uczącym.

Znak niewidoczny z daleka dla modelu

Zniekształcenia obiektu a zdolności architektoniczne

Równolegle zaobserwowano silne właściwości modelu w zakresie generalizacji samej struktury zidentyfikowanego elementu. W przypadku częściowego obcięcia krawędzi bądź braku pełnego okręgu informacyjnego, model z dużą pewnością estymuje pożądaną klasę, nie uzależniając się rygorystycznie od pełnego zachowania konturów figury geometrycznej w kadrze:

Poprawna identyfikacja mimo obcięcia znaku

Podsumowanie

Przeprowadzony eksperyment dowiódł, że parametry klasyfikacji nie przekładają się bezpośrednio na kompetencje rozpoznania i głębokiej detekcji w systemach decyzyjnych. Wysokie wskaźniki precyzji w badaniu walidacyjnym nie gwarantują pożądanej skuteczności działania asystenta wspomagającego w czasie rzeczywistym. Jak udowodniono na przykładzie detekcji z różnych dystansów obiektywu, użyteczność sieci zdeterminowana jest fizyczną reprezentatywnością danych, gdzie w naszym kontekście strukturyzowanie odległości i tła jest nieocenione na etapie etykietowania obrazu.

About

YOLOv8 based project that aims to correctly detect most important polish traffic signs.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages