미국의 한 엔지니어가 여러 AI 모델에 실제 자동차의 제어를 맡겼지만, 주행 성능은 기대에 미치지 못했다.
미국의 한 엔지니어가 오늘날의 AI 모델이 정말로 스스로 운전할 수 있는지 확인하기 위해 ChatGPT, Claude, Grok에 실제 자동차의 모든 제어를 맡기기로 했다.
이 실험에서는 서로 다른 두 가지 버전의 ChatGPT를 포함한 네 개의 AI 시스템이 가상으로 운전대를 잡았다. 모든 시스템이 문제에 부딪혔지만, 한 모델은 다른 모델보다 확실히 뛰어난 성능을 보였다.
엔지니어는 AI 시스템을 자동차의 조향, 가속 및 제동 제어 장치에 직접 연결하고 비어 있는 주차장에서 시험을 진행했다. 이 AI 모델들은 주변 환경을 해석하거나 순식간에 제동 여부를 판단하도록 설계되지 않았기 때문에, 그는 카메라 센서 데이터를 각 프롬프트에 사용할 시각적 맥락 정보로 변환하는 시스템을 구축했다.
그러면 AI 시스템은 조향각, 스로틀 개도, 제동력을 지정하는 텍스트 명령으로 응답했다.
가장 큰 문제는 응답 시간이었다. AI는 차량의 주행 경로를 효과적으로 바로잡기에는 너무 늦게 판단하는 경우가 많았다. 예를 들어, 조향을 15도 조정하라는 명령이 나왔을 때는 자동차가 이미 경로에서 크게 벗어난 상태였다.
시스템들은 공간 인식에도 어려움을 겪었다. 주변 환경을 제대로 입체적으로 이해하지 못해 장애물까지의 거리를 판단하기가 어려웠다.
때로는 AI 모델이 서로 모순되는 명령을 내리기도 했다. 한 사례에서는 엔진 출력을 100%로 요구하면서 동시에 최대 제동을 지시했다.
엔지니어에 따르면 최신 GPT-6 Astra 모델이 전반적으로 가장 뛰어난 성능을 보였지만, 응답 시간은 여전히 큰 제약으로 남았다.
Grok은 훨씬 빠르게 응답했지만, 판단의 정확성과 안전성이 충분하지 않았다. Claude는 ChatGPT와 더 비슷한 성능을 보였으며, 잠재적 위험을 식별하는 능력은 뛰어났지만 지나치게 조심스럽게 반응했다.
엔지니어는 첫 시도의 실패에도 불구하고 최종적으로 ChatGPT-6 Astra를 승자로 선정했다. 이 시스템은 이전의 실수에서 학습한 뒤 두 번째 시도에서 5분 22초 만에 경로를 완주했다.
Claude Fable 5.1은 경로의 45%를 주행했고, Grok 4.6은 11% 지점에서 멈췄다. GPT-5.6 Sol은 코스의 단 6%만 주행하는 데 그쳤다.