Projekt edukacyjny - obejmuje wykorzystanie modelu YOLOv8 do detekcji obrazów z kamery w szczególnym kontekście asystenta wspomagającego kierowcę drogowego. Celem nadrzędnym było sprawdzenie działania bazowego algorytmu, a następnie analiza procesu dotrenowania (fine-tuningu) na połączonym zbiorze danych.
Do wytrenowania modelu wykorzystano połączony zbiór danych, bazujący na dwóch niezależnych źródłach:
- Self Driving Cars (Roboflow Universe) - zbiór charakteryzujący się znaczną wariancją optyczną, zawierający przykłady rozmaitych znaków drogowych rejestrowanych z perspektywy centralnej kamery samochodowej.
- Polish Traffic Signs Dataset (Kaggle) - skąd wyekstrahowano dwie dodatkowe klasy: znak A-7 (Ustąp pierwszeństwa) oraz znak D-1 (Droga z pierwszeństwem). Zdjęcia tych specyficznych klas to wyłącznie skrajnie przybliżone wycinki (wypełniające kadr blisko w 100%). Umożliwiło to eksperymentalną ewaluację wpływu zmiany skali na możliwości detekcyjne układu splotowego.
Trening zrealizowano przy użyciu biblioteki PyTorch na akceleratorze graficznym NVIDIA Tesla T4 w środowisku Google Colab. Inicjalizacja procesu uczenia bazowała na transferze pre-trenowanych wag z modelu YOLOv8n.
Zastosowano mechanizm wczesnego zatrzymania. Wprowadzenie parametru patience=50 spowodowało wymuszenie zakończenia procesu wstecznej propagacji chwilę przed osiągnięciem 200. epoki, w związku ze stagnacją w optymalizacji błędu walidacyjnego.
Tabela wygenerowana po zakończeniu procesu ewaluacji wskazuje na bardzo dobre metryki na zbiorze testowym, szczególnie dla bliskich klas A-7 oraz D-1, gdzie precyzja osiąga wartości bliskie jedności.
Znormalizowana macierz pomyłek (Confusion Matrix) ukazuje wysoką dokładność klasyfikacyjną, z obserwowalnymi jednak zjawiskami typu False Positive w przypadku błędnej interpretacji tła oraz pominięciami dla obiektów stosunkowo małych w kadrze, jak sygnalizatory świetlne w oddali.
Zasadniczą częścią badania było zestawienie wyników walidacji z faktyczną zdolnością wnioskowania sieci (inferencji) na nowych, dynamicznych sekwencjach wideo pochodzących z wideorejestratorów drogowych. Eksperyment pozwolił wyciągnąć empiryczne wnioski w kontekście zagadnienia wariancji skali (Scale Variance).
Zgodnie z weryfikacją, sieć neuronowa trenowana w oparciu o wyekstrahowane i wysoce przybliżone znaki (np. A-7), poprawnie je rozpoznaje z momentem pełnego zbliżenia i wypełnienia matrycy w wizji lokalnej:
Niemniej jednak, poddając analizie ten sam znak zarejestrowany kilka sekund wcześniej - ze znacznej odległości, z widocznym kontekstem drogowym - sieć nie przydziela żadnej etykiety. Oznacza to brak mechanizmu abstrakcji i zdolności wyodrębnienia tego obiektu z oddali, ze względu na ograniczenia zaaplikowane we wprowadzonym podzbiorze uczącym.
Równolegle zaobserwowano silne właściwości modelu w zakresie generalizacji samej struktury zidentyfikowanego elementu. W przypadku częściowego obcięcia krawędzi bądź braku pełnego okręgu informacyjnego, model z dużą pewnością estymuje pożądaną klasę, nie uzależniając się rygorystycznie od pełnego zachowania konturów figury geometrycznej w kadrze:
Przeprowadzony eksperyment dowiódł, że parametry klasyfikacji nie przekładają się bezpośrednio na kompetencje rozpoznania i głębokiej detekcji w systemach decyzyjnych. Wysokie wskaźniki precyzji w badaniu walidacyjnym nie gwarantują pożądanej skuteczności działania asystenta wspomagającego w czasie rzeczywistym. Jak udowodniono na przykładzie detekcji z różnych dystansów obiektywu, użyteczność sieci zdeterminowana jest fizyczną reprezentatywnością danych, gdzie w naszym kontekście strukturyzowanie odległości i tła jest nieocenione na etapie etykietowania obrazu.




