Un ingénieur américain a confié les commandes d’une vraie voiture à plusieurs modèles d’IA, mais leurs performances de conduite n’ont pas été à la hauteur des attentes.
Un ingénieur américain a décidé de donner à ChatGPT, Claude et Grok le contrôle total d’une vraie voiture pour déterminer si les modèles d’IA actuels étaient réellement capables de conduire seuls.
L’expérience a placé quatre systèmes d’IA derrière le volant virtuel, dont deux versions différentes de ChatGPT. Tous ont rencontré des problèmes, même si un modèle s’est clairement mieux débrouillé que les autres.
L’ingénieur a connecté les systèmes d’IA directement aux commandes de direction, d’accélération et de freinage de la voiture, puis a réalisé le test sur un parking vide. Ces modèles d’IA n’étant pas conçus pour interpréter leur environnement ni prendre des décisions de freinage en une fraction de seconde, il a mis au point un système transformant les données des capteurs des caméras en contexte visuel pour chaque requête.
Les systèmes d’IA répondaient ensuite par des commandes textuelles précisant l’angle de braquage, la position de l’accélérateur et la force de freinage.
Le principal problème était le temps de réponse. L’IA prenait souvent ses décisions trop tard pour corriger efficacement la trajectoire de la voiture. Par exemple, lorsqu’une correction de braquage de 15 degrés était demandée, la voiture s’était déjà nettement écartée de sa trajectoire.
Les systèmes avaient également du mal à appréhender l’espace. Sans véritable compréhension tridimensionnelle de leur environnement, ils peinaient à évaluer les distances jusqu’aux obstacles.
Les modèles d’IA produisaient parfois même des commandes contradictoires. Dans un cas, un système a demandé 100 % de la puissance du moteur tout en ordonnant simultanément un freinage maximal.
Selon l’ingénieur, le tout dernier modèle GPT-6 Astra a obtenu les meilleurs résultats globaux, même si son temps de réponse restait une limite majeure.
Grok répondait beaucoup plus vite, mais ses décisions n’étaient pas assez précises ni sûres. Claude s’est comporté davantage comme ChatGPT, montrant une grande capacité à identifier les dangers potentiels, mais réagissant avec une prudence excessive.
L’ingénieur a finalement désigné ChatGPT-6 Astra comme vainqueur, malgré un échec initial. Lors de sa deuxième tentative, le système a terminé le parcours en 5 minutes et 22 secondes après avoir tiré les leçons de ses erreurs précédentes.
Claude Fable 5.1 a parcouru 45 % du trajet, tandis que Grok 4.6 s’est arrêté à 11 %. GPT-5.6 Sol n’a réussi à parcourir que 6 % du circuit.