米国のエンジニアが複数のAIモデルに実車の操作を任せたところ、その運転性能は期待を下回った。
米国のエンジニアが、現在のAIモデルが本当に自力で運転できるのかを確かめるため、ChatGPT、Claude、Grokに実車の操作を全面的に任せることにした。
この実験では、ChatGPTの異なる2つのバージョンを含む4つのAIシステムが、仮想的にハンドルを握った。すべてのシステムが問題に直面したものの、1つのモデルは他を明確に上回る性能を示した。
エンジニアはAIシステムを車両のステアリング、アクセル、ブレーキの制御系に直接接続し、無人の駐車場でテストを実施した。これらのAIモデルは周囲の状況を解釈したり、瞬時にブレーキ操作を判断したりするようには設計されていないため、カメラセンサーのデータを各プロンプト向けの視覚的な状況情報に変換するシステムを構築した。
AIシステムはその情報に対し、操舵角、アクセル開度、制動力を指定するテキスト形式の指示を返した。
最大の問題は応答時間だった。AIの判断は、車の進路を効果的に修正するには遅すぎることが多かった。例えば、15度の操舵修正が指示された時点で、車はすでに本来の進路から大きく逸脱していた。
各システムは空間認識にも苦戦した。周囲の環境を真に三次元で理解できないため、障害物までの距離を判断することが難しかった。
AIモデルは時に、矛盾する指示さえ出した。ある例では、システムがエンジン出力を100%にするよう要求すると同時に、最大限のブレーキをかけるよう指示した。
エンジニアによると、最新のGPT-6 Astraモデルが総合的に最も優れた性能を示したが、応答時間は依然として大きな制約だった。
Grokの応答ははるかに速かったものの、その判断は正確性と安全性が十分ではなかった。Claudeの挙動はChatGPTに近く、潜在的な危険を特定する能力は高かったが、反応が慎重すぎた。
エンジニアは最終的に、初回の失敗にもかかわらずChatGPT-6 Astraを勝者に選んだ。このシステムは前回の失敗から学び、2回目の挑戦では5分22秒でルートを走破した。
Claude Fable 5.1はルートの45%を走行した一方、Grok 4.6は11%の地点で停止した。GPT-5.6 Solが走行できたのはコースのわずか6%だった。