Американский инженер передал нескольким моделям ИИ управление настоящим автомобилем, и их навыки вождения не оправдали ожиданий.
Американский инженер решил передать ChatGPT, Claude и Grok полный контроль над настоящим автомобилем, чтобы проверить, способны ли современные модели ИИ действительно самостоятельно справляться с вождением.
В ходе эксперимента за виртуальным рулём оказались четыре системы ИИ, включая две разные версии ChatGPT. Все они столкнулись с проблемами, хотя одна модель явно показала себя лучше остальных.
Инженер напрямую подключил системы ИИ к управлению рулём, акселератором и тормозами автомобиля и провёл испытание на пустой парковке. Поскольку эти модели ИИ не предназначены для интерпретации окружающей обстановки или принятия мгновенных решений о торможении, он создал систему, которая преобразовывала данные с датчиков камер в визуальный контекст для каждого запроса.
Затем системы ИИ отвечали текстовыми командами, указывая угол поворота руля, положение акселератора и тормозное усилие.
Главной проблемой стало время отклика. ИИ часто принимал решения слишком поздно, чтобы эффективно скорректировать траекторию автомобиля. Например, к моменту поступления команды повернуть руль на 15 градусов автомобиль уже значительно отклонялся от курса.
Системы также испытывали трудности с пространственным восприятием. Не имея полноценного трёхмерного понимания окружающей обстановки, они с трудом оценивали расстояния до препятствий.
Порой модели ИИ даже выдавали противоречивые команды. В одном случае система потребовала 100 процентов мощности двигателя, одновременно приказав тормозить с максимальным усилием.
По словам инженера, новейшая модель GPT-6 Astra показала лучший результат в целом, хотя время её отклика оставалось серьёзным ограничением.
Grok отвечал гораздо быстрее, но его решения были недостаточно точными и безопасными. Claude работал скорее как ChatGPT: хорошо выявлял потенциальные опасности, но реагировал слишком осторожно.
В итоге инженер назвал победителем ChatGPT-6 Astra, несмотря на первоначальную неудачу. Со второй попытки система прошла маршрут за 5 минут и 22 секунды, учтя свои прежние ошибки.
Claude Fable 5.1 преодолел 45 процентов маршрута, а Grok 4.6 остановился на отметке 11 процентов. GPT-5.6 Sol удалось пройти лишь 6 процентов дистанции.