Amerykański inżynier przekazał kilku modelom AI kontrolę nad prawdziwym samochodem, ale ich umiejętności prowadzenia nie spełniły oczekiwań.
Amerykański inżynier postanowił oddać ChatGPT, Claude i Grok pełną kontrolę nad prawdziwym samochodem, aby sprawdzić, czy dzisiejsze modele AI rzeczywiście potrafią samodzielnie prowadzić auto.
W eksperymencie za wirtualną kierownicą zasiadły cztery systemy AI, w tym dwie różne wersje ChatGPT. Wszystkie napotkały problemy, choć jeden model wyraźnie poradził sobie lepiej od pozostałych.
Inżynier podłączył systemy AI bezpośrednio do układów sterowania kierownicą, gazem i hamulcami samochodu, a test przeprowadził na pustym parkingu. Ponieważ te modele AI nie zostały zaprojektowane do interpretowania otoczenia ani podejmowania decyzji o hamowaniu w ułamkach sekund, zbudował system przekształcający dane z czujników kamer w kontekst wizualny dla każdego zapytania.
Systemy AI odpowiadały następnie poleceniami tekstowymi określającymi kąt skrętu, położenie pedału gazu i siłę hamowania.
Największym problemem był czas reakcji. AI często podejmowała decyzje zbyt późno, by skutecznie skorygować tor jazdy samochodu. Na przykład w chwili wydania polecenia korekty skrętu o 15 stopni auto było już znacznie poza właściwym torem.
Systemy miały również problemy z orientacją przestrzenną. Bez rzeczywistego, trójwymiarowego rozumienia otoczenia trudno było im oceniać odległości od przeszkód.
Czasami modele AI wydawały nawet sprzeczne polecenia. W jednym przypadku system zażądał 100 procent mocy silnika, jednocześnie nakazując hamowanie z maksymalną siłą.
Według inżyniera najnowszy model GPT-6 Astra uzyskał najlepszy wynik ogólny, choć jego czas reakcji nadal stanowił poważne ograniczenie.
Grok odpowiadał znacznie szybciej, ale jego decyzje nie były wystarczająco precyzyjne ani bezpieczne. Claude działał bardziej podobnie do ChatGPT: dobrze rozpoznawał potencjalne zagrożenia, lecz reagował zbyt ostrożnie.
Ostatecznie inżynier ogłosił zwycięzcą ChatGPT-6 Astra pomimo początkowego niepowodzenia. Przy drugiej próbie system pokonał trasę w 5 minut i 22 sekundy, wyciągnąwszy wnioski z wcześniejszych błędów.
Claude Fable 5.1 pokonał 45 procent trasy, a Grok 4.6 zatrzymał się na poziomie 11 procent. GPT-5.6 Sol zdołał przejechać zaledwie 6 procent trasy.