วิศวกรชาวอเมริกันมอบการควบคุมรถจริงให้โมเดล AI หลายตัว แต่ผลการขับขี่กลับต่ำกว่าที่คาดหวัง
วิศวกรชาวอเมริกันคนหนึ่งตัดสินใจให้ ChatGPT, Claude และ Grok ควบคุมรถจริงอย่างเต็มรูปแบบ เพื่อดูว่าโมเดล AI ในปัจจุบันสามารถขับรถด้วยตัวเองได้จริงหรือไม่
การทดลองนี้ให้ระบบ AI สี่ระบบเข้ามาจับพวงมาลัยเสมือน รวมถึง ChatGPT สองเวอร์ชันที่แตกต่างกัน ทุกระบบพบปัญหา แม้จะมีโมเดลหนึ่งทำได้ดีกว่าระบบอื่นอย่างชัดเจน
วิศวกรเชื่อมต่อระบบ AI เข้ากับชุดควบคุมพวงมาลัย คันเร่ง และเบรกของรถโดยตรง แล้วทดสอบในลานจอดรถที่ว่างเปล่า เนื่องจากโมเดล AI เหล่านี้ไม่ได้ออกแบบมาเพื่อตีความสภาพแวดล้อมรอบตัวหรือตัดสินใจเบรกในเสี้ยววินาที เขาจึงสร้างระบบที่แปลงข้อมูลจากเซนเซอร์กล้องให้เป็นบริบททางภาพสำหรับแต่ละพรอมต์
จากนั้นระบบ AI ตอบกลับเป็นคำสั่งข้อความที่ระบุมุมพวงมาลัย ตำแหน่งคันเร่ง และแรงเบรก
ปัญหาใหญ่ที่สุดคือเวลาตอบสนอง AI มักตัดสินใจช้าเกินไปจนไม่สามารถแก้ไขทิศทางรถได้อย่างมีประสิทธิภาพ ตัวอย่างเช่น กว่าจะมีคำสั่งให้ปรับพวงมาลัย 15 องศา รถก็เบี่ยงออกจากเส้นทางไปมากแล้ว
ระบบเหล่านี้ยังมีปัญหาในการรับรู้ตำแหน่งและระยะห่างของสิ่งต่าง ๆ เมื่อไม่มีความเข้าใจสภาพแวดล้อมแบบสามมิติอย่างแท้จริง จึงประเมินระยะห่างจากสิ่งกีดขวางได้ยาก
บางครั้งโมเดล AI ถึงกับออกคำสั่งที่ขัดแย้งกันเอง ในกรณีหนึ่ง ระบบสั่งให้ใช้กำลังเครื่องยนต์ 100 เปอร์เซ็นต์ พร้อมกับสั่งให้เบรกเต็มแรงในเวลาเดียวกัน
วิศวกรระบุว่าโมเดล GPT-6 Astra รุ่นล่าสุดทำผลงานโดยรวมได้ดีที่สุด แม้เวลาตอบสนองจะยังคงเป็นข้อจำกัดสำคัญ
Grok ตอบสนองได้เร็วกว่ามาก แต่การตัดสินใจยังไม่แม่นยำหรือปลอดภัยเพียงพอ ส่วน Claude ทำผลงานคล้าย ChatGPT มากกว่า โดยแสดงความสามารถในการระบุอันตรายที่อาจเกิดขึ้นได้ดี แต่ตอบสนองอย่างระมัดระวังเกินไป
ท้ายที่สุดวิศวกรประกาศให้ ChatGPT-6 Astra เป็นผู้ชนะ แม้จะล้มเหลวในครั้งแรก ในการลองครั้งที่สอง ระบบขับจบเส้นทางได้ในเวลา 5 นาที 22 วินาที หลังจากเรียนรู้จากความผิดพลาดก่อนหน้านี้
Claude Fable 5.1 ขับได้ 45 เปอร์เซ็นต์ของเส้นทาง ขณะที่ Grok 4.6 หยุดที่ 11 เปอร์เซ็นต์ ส่วน GPT-5.6 Sol ขับได้เพียง 6 เปอร์เซ็นต์ของเส้นทางทดสอบ