INITIALIZING NEURAL CORE INICJALIZACJA RDZENIA NEURONOWEGO
Techniczne Case Study
Pełny inżynierski zapis tego, jak zbudowaliśmy sieć-kierowcę do TORCS — od eksploracyjnego uczenia ze wzmocnieniem po analitycznego teachera strojonego Optuną i zdestylowanego do sieci 429 KB.
Przeczytaj pełny raport (PDF, 14 stron)Dokumentujemy pełny proces budowy sieciowego agenta-kierowcy dla toru Corkscrew (Laguna Seca, 3602 m) w TORCS, komunikującego się protokołem SCR z częstotliwością 50 Hz. Projekt przeszedł przez pięć etapów — od eksploracyjnych baseline'ów Soft Actor-Critic, przez curriculum z sieciami stabilizowanymi LayerNorm (co ujawniło dywergencję krytyka), po stos residual-RL, którego pięciowarstwową kaskadę awarii zdiagnozowaliśmy i naprawiliśmy.
Ostateczny pipeline optymalizuje analitycznego teachera o 54 parametrach rozproszonym przeszukiwaniem Optuna (~15 000 prób) i destyluje go do sieci MLP o 109 tys. parametrów przez klonowanie behawioralne i DAgger. Oddana sieć (bc_v6.pth, 429 KB) uzyskała 92,04 s na okrążeniu ze startu zatrzymanego w warunkach zgłoszeniowych. Residualna polityka Soft Actor-Critic na tej samej zamrożonej sieci osiąga to samo ~92 s, więc wynik stoi zarówno na imitacji, jak i na uczeniu ze wzmocnieniem.
| Agent | Najlepsze okr. [s] |
|---|---|
| From-scratch SAC (S1) | ~105–115 |
| DAgger NN (S3) | 106.96 |
| Teacher v3 (2,210 trials) | 118.81 |
| Teacher v5 (gear + decoupling) | 91.24 |
| Teacher v6 (racing line) | ≈88.8 |
| Oddana sieć bc_v6.pth (imitacja) | 92.04 |
| Residual SAC na tej samej bazie (RL) | ≈92 |
Oddana sieć jest oceniana w surowszej fizyce (paliwo + uszkodzenia); przeszukiwanie teachera działało z ich wyłączeniem dla przepustowości.
Pełny dokument obejmuje sformułowanie MDP, wszystkie równania, funkcję nagrody, post-mortem pięciu bugów residual oraz kompletną bibliografię.
Otwórz PDF