Een Amerikaanse ingenieur gaf meerdere AI-modellen de controle over een echte auto, maar hun rijprestaties bleven achter bij de verwachtingen.
Een Amerikaanse ingenieur besloot ChatGPT, Claude en Grok de volledige controle over een echte auto te geven om te zien of de huidige AI-modellen daadwerkelijk zelfstandig kunnen rijden.
Bij het experiment namen vier AI-systemen plaats achter het virtuele stuur, waaronder twee verschillende versies van ChatGPT. Ze liepen allemaal tegen problemen aan, al presteerde één model duidelijk beter dan de andere.
De ingenieur koppelde de AI-systemen rechtstreeks aan de stuur-, gas- en rembediening van de auto en voerde de test uit op een leeg parkeerterrein. Omdat deze AI-modellen niet zijn ontworpen om hun omgeving te interpreteren of in een fractie van een seconde rembeslissingen te nemen, bouwde hij een systeem dat gegevens van de camerasensoren voor elke prompt omzette in visuele context.
De AI-systemen reageerden vervolgens met tekstcommando’s die de stuurhoek, de stand van het gaspedaal en de remkracht aangaven.
Het grootste probleem was de reactietijd. De AI nam vaak te laat beslissingen om de koers van de auto effectief te corrigeren. Tegen de tijd dat bijvoorbeeld een stuurcorrectie van 15 graden werd gevraagd, was de auto al aanzienlijk van zijn koers afgeweken.
De systemen hadden ook moeite met ruimtelijk inzicht. Zonder een echt driedimensionaal begrip van hun omgeving konden ze de afstanden tot obstakels moeilijk inschatten.
Soms produceerden de AI-modellen zelfs tegenstrijdige commando’s. In één geval vroeg een systeem om 100 procent motorvermogen, terwijl het tegelijkertijd opdracht gaf om vol te remmen.
Volgens de ingenieur presteerde het nieuwste GPT-6 Astra-model over het geheel genomen het beste, al bleef de reactietijd een belangrijke beperking.
Grok reageerde veel sneller, maar zijn beslissingen waren niet nauwkeurig of veilig genoeg. Claude presteerde meer zoals ChatGPT: het kon potentiële gevaren goed herkennen, maar reageerde te voorzichtig.
De ingenieur wees ChatGPT-6 Astra uiteindelijk aan als winnaar, ondanks een mislukte eerste poging. Bij de tweede poging legde het systeem de route af in 5 minuten en 22 seconden, nadat het van zijn eerdere fouten had geleerd.
Claude Fable 5.1 legde 45 procent van de route af, terwijl Grok 4.6 bij 11 procent stopte. GPT-5.6 Sol wist slechts 6 procent van het parcours af te leggen.