Un ingeniero estadounidense cedió a varios modelos de IA el control de un coche real, y su desempeño al volante no estuvo a la altura de las expectativas.
Un ingeniero estadounidense decidió dar a ChatGPT, Claude y Grok el control total de un coche real para comprobar si los modelos actuales de IA realmente podían conducir por sí solos.
El experimento puso a cuatro sistemas de IA al volante virtual, incluidas dos versiones diferentes de ChatGPT. Todos encontraron problemas, aunque un modelo obtuvo resultados claramente mejores que los demás.
El ingeniero conectó los sistemas de IA directamente a los controles de dirección, acelerador y frenos del coche y realizó la prueba en un aparcamiento vacío. Como estos modelos de IA no fueron diseñados para interpretar su entorno ni tomar decisiones de frenado en fracciones de segundo, creó un sistema que convertía los datos de los sensores de las cámaras en contexto visual para cada petición.
Los sistemas de IA respondían entonces con órdenes de texto que especificaban el ángulo de dirección, la posición del acelerador y la fuerza de frenado.
El mayor problema fue el tiempo de respuesta. La IA solía tomar decisiones demasiado tarde para corregir eficazmente la trayectoria del coche. Por ejemplo, cuando se solicitaba una corrección de la dirección de 15 grados, el coche ya se había desviado considerablemente del rumbo.
Los sistemas también tenían dificultades con la percepción espacial. Sin una verdadera comprensión tridimensional de su entorno, les costaba calcular las distancias a los obstáculos.
En ocasiones, los modelos de IA incluso generaban órdenes contradictorias. En un caso, un sistema pidió el 100 por ciento de la potencia del motor mientras ordenaba simultáneamente frenar al máximo.
Según el ingeniero, el último modelo GPT-6 Astra obtuvo el mejor resultado global, aunque su tiempo de respuesta seguía siendo una limitación importante.
Grok respondía mucho más rápido, pero sus decisiones no eran lo bastante precisas ni seguras. Claude se comportaba de forma más parecida a ChatGPT: mostraba una gran capacidad para identificar posibles peligros, pero reaccionaba con demasiada cautela.
Finalmente, el ingeniero declaró ganador a ChatGPT-6 Astra pese a un fracaso inicial. En su segundo intento, el sistema completó la ruta en 5 minutos y 22 segundos tras aprender de sus errores anteriores.
Claude Fable 5.1 completó el 45 por ciento de la ruta, mientras que Grok 4.6 se detuvo en el 11 por ciento. GPT-5.6 Sol solo logró recorrer el 6 por ciento del trazado.