INITIALIZING NEURAL CORE INICJALIZACJA RDZENIA NEURONOWEGO

overcl
RACING
cked

Techniczne Case Study

Od Soft Actor-Critic do Destylacji Teacher–Student

Pełny inżynierski zapis tego, jak zbudowaliśmy sieć-kierowcę do TORCS — od eksploracyjnego uczenia ze wzmocnieniem po analitycznego teachera strojonego Optuną i zdestylowanego do sieci 429 KB.

Przeczytaj pełny raport (PDF, 14 stron)

01 Streszczenie

Dokumentujemy pełny proces budowy sieciowego agenta-kierowcy dla toru Corkscrew (Laguna Seca, 3602 m) w TORCS, komunikującego się protokołem SCR z częstotliwością 50 Hz. Projekt przeszedł przez pięć etapów — od eksploracyjnych baseline'ów Soft Actor-Critic, przez curriculum z sieciami stabilizowanymi LayerNorm (co ujawniło dywergencję krytyka), po stos residual-RL, którego pięciowarstwową kaskadę awarii zdiagnozowaliśmy i naprawiliśmy.

Ostateczny pipeline optymalizuje analitycznego teachera o 54 parametrach rozproszonym przeszukiwaniem Optuna (~15 000 prób) i destyluje go do sieci MLP o 109 tys. parametrów przez klonowanie behawioralne i DAgger. Oddana sieć (bc_v6.pth, 429 KB) uzyskała 92,04 s na okrążeniu ze startu zatrzymanego w warunkach zgłoszeniowych. Residualna polityka Soft Actor-Critic na tej samej zamrożonej sieci osiąga to samo ~92 s, więc wynik stoi zarówno na imitacji, jak i na uczeniu ze wzmocnieniem.

02 Pipeline

🏎️ Analityczny teacher 54 strojone parametry
🎛️ Przeszukiwanie Optuna ~15 000 prób headless
📋 Klonowanie behawioralne 500k przejść, szum anty-copycat
🔁 DAgger 5 iteracji, etykiety teachera
🧠 bc_v6.pth MLP 109k param · 429 KB

03 Kluczowe wyniki

Powtórka okrążenia — telemetria

0 km/h 0 m
250 125 0
0 m szykana Corkscrew 3600 m
Controller evolution
Ewolucja kontrolera: najlepsze okrążenie ze startu zatrzymanego w każdej generacji, kończąc na zdestylowanej sieci zgłoszeniowej.
Top speed unlock
Sufit 174 km/h był artefaktem harmonogramu zmiany biegów; rozprzęgnięcie celów prędkości na prostych i w zakrętach odblokowało 244,5 km/h.
S2 divergence
Udokumentowany wynik negatywny: krytyk S2 zdywergował o sześć rzędów wielkości, naprawiony przez γ=0,99, obcinanie nagród i LayerNorm.
Lap speed profile
Profil prędkości zarejestrowanego okrążenia (telemetria): głębokie minima to szykana Corkscrew i ostatnia nawrotka.

04 Progresja czasów okrążeń

Agent Najlepsze okr. [s]
From-scratch SAC (S1) ~105–115
DAgger NN (S3) 106.96
Teacher v3 (2,210 trials) 118.81
Teacher v5 (gear + decoupling) 91.24
Teacher v6 (racing line) ≈88.8
Oddana sieć bc_v6.pth (imitacja) 92.04
Residual SAC na tej samej bazie (RL) ≈92

Oddana sieć jest oceniana w surowszej fizyce (paliwo + uszkodzenia); przeszukiwanie teachera działało z ich wyłączeniem dla przepustowości.

Pełny dokument obejmuje sformułowanie MDP, wszystkie równania, funkcję nagrody, post-mortem pięciu bugów residual oraz kompletną bibliografię.

Otwórz PDF