Egy amerikai mérnök több MI-modellre bízta egy valódi autó irányítását, vezetési teljesítményük azonban elmaradt a várakozásoktól.
Egy amerikai mérnök úgy döntött, hogy teljes irányítást ad a ChatGPT-nek, a Claude-nak és a Groknak egy valódi autó felett, hogy kiderítse, képesek-e a mai MI-modellek valóban önállóan vezetni.
A kísérletben négy MI-rendszer ült a virtuális volán mögé, köztük a ChatGPT két különböző változata. Mindegyik problémákba ütközött, bár az egyik modell egyértelműen jobban teljesített a többinél.
A mérnök közvetlenül összekapcsolta az MI-rendszereket az autó kormány-, gáz- és fékvezérlésével, a tesztet pedig egy üres parkolóban végezte el. Mivel ezeket az MI-modelleket nem a környezetük értelmezésére vagy a másodperc törtrésze alatt meghozandó fékezési döntésekre tervezték, olyan rendszert épített, amely a kamerák érzékelőinek adatait minden egyes utasításhoz vizuális kontextussá alakította.
Az MI-rendszerek ezután szöveges parancsokkal válaszoltak, amelyek meghatározták a kormányzási szöget, a gázpedál állását és a fékerőt.
A legnagyobb problémát a válaszidő jelentette. Az MI gyakran túl későn hozott döntést ahhoz, hogy hatékonyan korrigálja az autó haladási irányát. Például mire megérkezett a 15 fokos kormánykorrekcióra vonatkozó parancs, az autó már jelentősen letért a kívánt nyomvonalról.
A rendszerek a térbeli tájékozódással is küszködtek. Környezetük valódi háromdimenziós megértése nélkül nehezen tudták felmérni az akadályok távolságát.
Az MI-modellek időnként még egymásnak ellentmondó parancsokat is kiadtak. Egy esetben az egyik rendszer 100 százalékos motorteljesítményt kért, miközben egyidejűleg teljes fékezést rendelt el.
A mérnök szerint összességében a legújabb GPT-6 Astra modell teljesített a legjobban, bár a válaszideje továbbra is jelentős korlátot jelentett.
A Grok sokkal gyorsabban válaszolt, döntései azonban nem voltak elég pontosak vagy biztonságosak. A Claude inkább a ChatGPT-hez hasonlóan teljesített: jól felismerte a lehetséges veszélyeket, de túl óvatosan reagált.
A mérnök végül a ChatGPT-6 Astrát hirdette ki győztesnek a kezdeti kudarc ellenére. A rendszer a korábbi hibáiból tanulva a második próbálkozásra 5 perc 22 másodperc alatt teljesítette az útvonalat.
A Claude Fable 5.1 az útvonal 45 százalékát teljesítette, míg a Grok 4.6 11 százaléknál állt meg. A GPT-5.6 Sol a pálya mindössze 6 százalékát tudta megtenni.