Ένας Αμερικανός μηχανικός παρέδωσε τον έλεγχο ενός πραγματικού αυτοκινήτου σε διάφορα μοντέλα AI, όμως οι οδηγικές τους επιδόσεις δεν ανταποκρίθηκαν στις προσδοκίες.
Ένας Αμερικανός μηχανικός αποφάσισε να δώσει στα ChatGPT, Claude και Grok τον πλήρη έλεγχο ενός πραγματικού αυτοκινήτου, για να διαπιστώσει αν τα σημερινά μοντέλα AI μπορούν πράγματι να οδηγήσουν μόνα τους.
Το πείραμα έβαλε τέσσερα συστήματα AI πίσω από το εικονικό τιμόνι, μεταξύ των οποίων δύο διαφορετικές εκδόσεις του ChatGPT. Όλα αντιμετώπισαν προβλήματα, αν και ένα μοντέλο είχε σαφώς καλύτερες επιδόσεις από τα υπόλοιπα.
Ο μηχανικός συνέδεσε τα συστήματα AI απευθείας με τα χειριστήρια διεύθυνσης, γκαζιού και πέδησης του αυτοκινήτου και πραγματοποίησε τη δοκιμή σε έναν άδειο χώρο στάθμευσης. Επειδή αυτά τα μοντέλα AI δεν είχαν σχεδιαστεί για να ερμηνεύουν το περιβάλλον τους ή να λαμβάνουν αποφάσεις πέδησης σε κλάσματα του δευτερολέπτου, κατασκεύασε ένα σύστημα που μετέτρεπε τα δεδομένα των αισθητήρων της κάμερας σε οπτικές πληροφορίες για κάθε προτροπή.
Τα συστήματα AI απαντούσαν στη συνέχεια με εντολές κειμένου που καθόριζαν τη γωνία διεύθυνσης, τη θέση του γκαζιού και τη δύναμη πέδησης.
Το μεγαλύτερο πρόβλημα ήταν ο χρόνος απόκρισης. Η AI συχνά έπαιρνε αποφάσεις πολύ αργά για να διορθώσει αποτελεσματικά την πορεία του αυτοκινήτου. Για παράδειγμα, όταν ζητήθηκε μια διόρθωση της γωνίας διεύθυνσης κατά 15 μοίρες, το αυτοκίνητο είχε ήδη αποκλίνει σημαντικά από την πορεία του.
Τα συστήματα δυσκολεύτηκαν επίσης με την αντίληψη του χώρου. Χωρίς πραγματική τρισδιάστατη κατανόηση του περιβάλλοντός τους, δυσκολεύονταν να εκτιμήσουν τις αποστάσεις από τα εμπόδια.
Μερικές φορές, τα μοντέλα AI έδιναν ακόμη και αντιφατικές εντολές. Σε ένα παράδειγμα, ένα σύστημα ζητούσε το 100% της ισχύος του κινητήρα, ενώ ταυτόχρονα έδινε εντολή για πλήρη πέδηση.
Σύμφωνα με τον μηχανικό, το νεότερο μοντέλο GPT-6 Astra είχε τις καλύτερες συνολικές επιδόσεις, αν και ο χρόνος απόκρισής του παρέμενε σημαντικός περιορισμός.
Το Grok ανταποκρινόταν πολύ ταχύτερα, αλλά οι αποφάσεις του δεν ήταν αρκετά ακριβείς ή ασφαλείς. Το Claude είχε επιδόσεις πιο κοντά σε εκείνες του ChatGPT, επιδεικνύοντας ισχυρή ικανότητα εντοπισμού πιθανών κινδύνων, αλλά αντιδρώντας υπερβολικά προσεκτικά.
Ο μηχανικός τελικά ανακήρυξε νικητή το ChatGPT-6 Astra, παρά την αρχική αποτυχία του. Στη δεύτερη προσπάθειά του, το σύστημα ολοκλήρωσε τη διαδρομή σε 5 λεπτά και 22 δευτερόλεπτα, έχοντας μάθει από τα προηγούμενα λάθη του.
Το Claude Fable 5.1 ολοκλήρωσε το 45% της διαδρομής, ενώ το Grok 4.6 σταμάτησε στο 11%. Το GPT-5.6 Sol κατάφερε να ολοκληρώσει μόλις το 6% της διαδρομής.