Un inginer american a încredințat mai multor modele de IA controlul unei mașini reale, iar performanțele lor la volan au fost sub așteptări.
Un inginer american a decis să le ofere ChatGPT, Claude și Grok controlul deplin asupra unei mașini reale, pentru a vedea dacă modelele actuale de IA se pot descurca într-adevăr singure la volan.
Experimentul a pus patru sisteme de IA la volanul virtual, inclusiv două versiuni diferite de ChatGPT. Toate au întâmpinat probleme, deși un model s-a descurcat clar mai bine decât celelalte.
Inginerul a conectat sistemele de IA direct la comenzile de direcție, accelerație și frânare ale mașinii și a efectuat testul într-o parcare goală. Deoarece aceste modele de IA nu au fost concepute pentru a interpreta mediul înconjurător sau pentru a lua decizii de frânare într-o fracțiune de secundă, el a construit un sistem care transforma datele senzorilor camerelor în context vizual pentru fiecare solicitare.
Sistemele de IA răspundeau apoi prin comenzi text care specificau unghiul de bracare, poziția accelerației și forța de frânare.
Cea mai mare problemă a fost timpul de răspuns. IA lua adesea decizii prea târziu pentru a corecta eficient traiectoria mașinii. De exemplu, în momentul în care era solicitată o corecție a direcției de 15 grade, mașina deviase deja semnificativ de la traseu.
Sistemele au avut dificultăți și cu percepția spațială. Fără o înțelegere tridimensională reală a mediului înconjurător, le era greu să estimeze distanțele până la obstacole.
Uneori, modelele de IA produceau chiar comenzi contradictorii. Într-un caz, un sistem a cerut 100 % din puterea motorului, ordonând simultan frânarea maximă.
Potrivit inginerului, cel mai recent model GPT-6 Astra a avut cele mai bune rezultate per ansamblu, deși timpul său de răspuns a rămas o limitare majoră.
Grok răspundea mult mai repede, dar deciziile sale nu erau suficient de precise sau de sigure. Claude s-a comportat mai degrabă ca ChatGPT, demonstrând o capacitate ridicată de a identifica potențialele pericole, dar reacționând prea prudent.
În cele din urmă, inginerul a desemnat ChatGPT-6 Astra drept câștigător, în ciuda unui eșec inițial. La a doua încercare, sistemul a parcurs traseul în 5 minute și 22 de secunde, după ce a învățat din greșelile anterioare.
Claude Fable 5.1 a parcurs 45 % din traseu, în timp ce Grok 4.6 s-a oprit la 11 %. GPT-5.6 Sol a reușit să parcurgă doar 6 % din traseu.