Um engenheiro americano entregou a vários modelos de IA o controlo de um carro real, mas o desempenho ao volante ficou aquém das expectativas.
Um engenheiro americano decidiu dar ao ChatGPT, ao Claude e ao Grok o controlo total de um carro real para verificar se os modelos atuais de IA conseguiriam realmente conduzir sozinhos.
A experiência colocou quatro sistemas de IA ao volante virtual, incluindo duas versões diferentes do ChatGPT. Todos tiveram problemas, embora um dos modelos tenha apresentado um desempenho claramente superior ao dos restantes.
O engenheiro ligou os sistemas de IA diretamente aos comandos de direção, aceleração e travagem do carro e realizou o teste num parque de estacionamento vazio. Como estes modelos de IA não foram concebidos para interpretar o ambiente à sua volta ou tomar decisões de travagem numa fração de segundo, criou um sistema que convertia os dados dos sensores das câmaras em contexto visual para cada pedido.
Os sistemas de IA respondiam então com comandos de texto que especificavam o ângulo de direção, a posição do acelerador e a força de travagem.
O maior problema foi o tempo de resposta. A IA tomava frequentemente decisões demasiado tarde para corrigir eficazmente a trajetória do carro. Por exemplo, quando era solicitada uma correção de direção de 15 graus, o carro já se tinha desviado significativamente do percurso.
Os sistemas também tiveram dificuldades com a perceção espacial. Sem uma verdadeira compreensão tridimensional do ambiente à sua volta, tinham dificuldade em avaliar as distâncias até aos obstáculos.
Por vezes, os modelos de IA chegaram a produzir comandos contraditórios. Num dos casos, um sistema pediu 100 por cento da potência do motor enquanto ordenava simultaneamente uma travagem máxima.
Segundo o engenheiro, o mais recente modelo GPT-6 Astra teve o melhor desempenho global, embora o seu tempo de resposta continuasse a ser uma limitação importante.
O Grok respondia muito mais depressa, mas as suas decisões não eram suficientemente precisas nem seguras. O Claude teve um desempenho mais próximo do ChatGPT, demonstrando uma forte capacidade para identificar potenciais perigos, mas reagindo com demasiada cautela.
O engenheiro acabou por declarar o ChatGPT-6 Astra vencedor, apesar de um fracasso inicial. Na segunda tentativa, o sistema completou o percurso em 5 minutos e 22 segundos, depois de aprender com os erros anteriores.
O Claude Fable 5.1 completou 45 por cento do percurso, enquanto o Grok 4.6 parou nos 11 por cento. O GPT-5.6 Sol conseguiu completar apenas 6 por cento do trajeto.