Seorang jurutera Amerika menyerahkan kawalan sebuah kereta sebenar kepada beberapa model AI, namun prestasi pemanduan mereka tidak memenuhi jangkaan.
Seorang jurutera Amerika memutuskan untuk memberikan ChatGPT, Claude dan Grok kawalan penuh sebuah kereta sebenar bagi melihat sama ada model AI masa kini benar-benar mampu memandu sendiri.
Eksperimen itu meletakkan empat sistem AI di belakang stereng secara maya, termasuk dua versi ChatGPT yang berbeza. Kesemuanya menghadapi masalah, walaupun satu model jelas menunjukkan prestasi lebih baik berbanding yang lain.
Jurutera itu menyambungkan sistem AI secara langsung kepada kawalan stereng, pendikit dan brek kereta, lalu menjalankan ujian di kawasan parkir yang kosong. Oleh sebab model AI ini tidak direka untuk mentafsir persekitarannya atau membuat keputusan membrek dalam sekelip mata, beliau membina sistem yang menukarkan data sensor kamera kepada konteks visual bagi setiap prom.
Sistem AI kemudian memberikan respons dalam bentuk arahan teks yang menetapkan sudut stereng, kedudukan pendikit dan daya brek.
Masalah terbesar ialah masa respons. AI sering membuat keputusan terlalu lewat untuk membetulkan laluan kereta dengan berkesan. Sebagai contoh, ketika pelarasan stereng sebanyak 15 darjah diminta, kereta sudah pun menyimpang jauh daripada laluan.
Sistem itu juga menghadapi kesukaran dari segi kesedaran ruang. Tanpa pemahaman tiga dimensi yang sebenar tentang persekitarannya, sistem tersebut sukar menganggarkan jarak ke halangan.
Ada kalanya model AI malah menghasilkan arahan yang bercanggah. Dalam satu contoh, sebuah sistem meminta kuasa enjin 100 peratus sambil mengarahkan brek maksimum pada masa yang sama.
Menurut jurutera itu, model GPT-6 Astra yang terkini menunjukkan prestasi keseluruhan terbaik, walaupun masa responsnya masih menjadi kekangan utama.
Grok memberikan respons jauh lebih pantas, tetapi keputusannya tidak cukup tepat atau selamat. Prestasi Claude lebih menyerupai ChatGPT, dengan keupayaan yang baik untuk mengenal pasti potensi bahaya, tetapi tindak balasnya terlalu berhati-hati.
Jurutera itu akhirnya menamakan ChatGPT-6 Astra sebagai pemenang walaupun gagal pada percubaan pertama. Pada percubaan kedua, sistem tersebut melengkapkan laluan dalam masa 5 minit 22 saat selepas belajar daripada kesilapan sebelumnya.
Claude Fable 5.1 melengkapkan 45 peratus laluan, manakala Grok 4.6 berhenti pada tahap 11 peratus. GPT-5.6 Sol hanya berjaya melengkapkan 6 peratus laluan.