Ein amerikanischer Ingenieur überließ mehreren KI-Modellen die Kontrolle über ein echtes Auto. Ihre Fahrleistungen blieben hinter den Erwartungen zurück.
Ein amerikanischer Ingenieur beschloss, ChatGPT, Claude und Grok die vollständige Kontrolle über ein echtes Auto zu geben, um herauszufinden, ob heutige KI-Modelle tatsächlich selbstständig fahren können.
Bei dem Experiment saßen vier KI-Systeme am virtuellen Steuer, darunter zwei unterschiedliche Versionen von ChatGPT. Alle stießen auf Probleme, obwohl ein Modell deutlich besser abschnitt als die anderen.
Der Ingenieur verband die KI-Systeme direkt mit der Lenkung, der Gassteuerung und den Bremsen des Autos und führte den Test auf einem leeren Parkplatz durch. Da diese KI-Modelle nicht dafür ausgelegt sind, ihre Umgebung zu interpretieren oder in Sekundenbruchteilen Bremsentscheidungen zu treffen, entwickelte er ein System, das Kamerasensordaten für jede Eingabe in visuellen Kontext umwandelte.
Die KI-Systeme antworteten daraufhin mit Textbefehlen, die Lenkwinkel, Gaspedalstellung und Bremskraft vorgaben.
Das größte Problem war die Reaktionszeit. Die KI traf Entscheidungen oft zu spät, um die Fahrtrichtung des Autos wirksam zu korrigieren. Beispielsweise war das Auto bereits deutlich vom Kurs abgekommen, als eine Lenkkorrektur um 15 Grad angefordert wurde.
Die Systeme hatten auch Schwierigkeiten mit der räumlichen Wahrnehmung. Ohne ein echtes dreidimensionales Verständnis ihrer Umgebung konnten sie Entfernungen zu Hindernissen nur schwer einschätzen.
Mitunter gaben die KI-Modelle sogar widersprüchliche Befehle aus. In einem Fall forderte ein System 100 Prozent Motorleistung und ordnete gleichzeitig eine Vollbremsung an.
Dem Ingenieur zufolge schnitt das neueste Modell GPT-6 Astra insgesamt am besten ab, obwohl seine Reaktionszeit weiterhin eine wesentliche Einschränkung darstellte.
Grok reagierte wesentlich schneller, doch seine Entscheidungen waren nicht präzise und sicher genug. Claude verhielt sich eher wie ChatGPT: Es erkannte potenzielle Gefahren sehr gut, reagierte jedoch zu vorsichtig.
Schließlich erklärte der Ingenieur ChatGPT-6 Astra trotz eines anfänglichen Fehlschlags zum Sieger. Beim zweiten Versuch absolvierte das System die Strecke in 5 Minuten und 22 Sekunden, nachdem es aus seinen vorherigen Fehlern gelernt hatte.
Claude Fable 5.1 bewältigte 45 Prozent der Strecke, während Grok 4.6 bei 11 Prozent stehen blieb. GPT-5.6 Sol schaffte lediglich 6 Prozent des Parcours.