Американський інженер передав кільком моделям ШІ керування справжнім автомобілем, і їхні навички водіння не виправдали очікувань.
Американський інженер вирішив передати ChatGPT, Claude та Grok повний контроль над справжнім автомобілем, щоб перевірити, чи здатні сучасні моделі ШІ справді самостійно впоратися з водінням.
Під час експерименту за віртуальним кермом опинилися чотири системи ШІ, зокрема дві різні версії ChatGPT. Усі вони зіткнулися з проблемами, хоча одна модель явно показала себе краще за інші.
Інженер безпосередньо підключив системи ШІ до керування кермом, акселератором і гальмами автомобіля та провів випробування на порожній парковці. Оскільки ці моделі ШІ не призначені для інтерпретації навколишнього оточення або ухвалення миттєвих рішень щодо гальмування, він створив систему, яка перетворювала дані з датчиків камер на візуальний контекст для кожного запиту.
Після цього системи ШІ відповідали текстовими командами, вказуючи кут повороту керма, положення акселератора та гальмівне зусилля.
Найбільшою проблемою став час відгуку. ШІ часто ухвалював рішення надто пізно, щоб ефективно скоригувати траєкторію автомобіля. Наприклад, на момент надходження команди повернути кермо на 15 градусів автомобіль уже суттєво відхилявся від курсу.
Системи також мали труднощі з просторовим сприйняттям. Без повноцінного тривимірного розуміння навколишнього оточення їм було складно оцінювати відстані до перешкод.
Часом моделі ШІ навіть видавали суперечливі команди. В одному випадку система вимагала 100 відсотків потужності двигуна, одночасно наказуючи гальмувати з максимальним зусиллям.
За словами інженера, найновіша модель GPT-6 Astra загалом показала найкращий результат, хоча час її відгуку залишався суттєвим обмеженням.
Grok відповідав значно швидше, але його рішення були недостатньо точними та безпечними. Claude працював радше як ChatGPT: добре виявляв потенційні небезпеки, але реагував надто обережно.
Зрештою інженер назвав переможцем ChatGPT-6 Astra, попри початкову невдачу. З другої спроби система пройшла маршрут за 5 хвилин і 22 секунди, врахувавши свої попередні помилки.
Claude Fable 5.1 подолав 45 відсотків маршруту, тоді як Grok 4.6 зупинився на позначці 11 відсотків. GPT-5.6 Sol вдалося пройти лише 6 відсотків дистанції.