Τρεις μηχανικοί τεχνητής νοημοσύνης από τη startup Axiom —οι Aditya Ramabadran, Simon Mahns και Tobias Gessler— αποφάσισαν να δοκιμάσουν τα όρια της τεχνολογίας με έναν ασυνήθιστο τρόπο: χρησιμοποιώντας γλωσσικά μοντέλα για να οδηγήσουν ένα αυτοκίνητο σε ένα In-N-Out Burger.

Καθισμένοι σε μια Toyota Corolla του 2024 κοντά σε ένα εστιατόριο της Bay Area, συνέδεσαν το μοντέλο GPT-6 Astra της OpenAI με το σύστημα διεύθυνσης του αυτοκινήτου και κάμερες τοποθετημένες στο παρμπρίζ. Παρά το γεγονός ότι το μοντέλο έχει σχεδιαστεί για τη δημιουργία κειμένου και κώδικα, κατάφερε να οδηγήσει αργά το όχημα μέχρι το παράθυρο παραγγελίας.

Αναδυόμενες Ικανότητες στον Φυσικό Κόσμο

Το πείραμα αυτό διαφέρει από τα παραδοσιακά αυτόνομα οχήματα, τα οποία χρησιμοποιούν εξειδικευμένους αλγόριθμους. Εδώ, η ικανότητα οδήγησης φαίνεται να είναι μια «αναδυόμενη ικανότητα» που προκύπτει από την εκπαίδευση των μοντέλων σε τρισδιάστατη λογική και πολυτροπικά δεδομένα (εικόνες και βίντεο). Οι μηχανικοί παρατήρησαν ότι το μοντέλο μπορούσε να προσαρμόζεται σε σφάλματα σε πραγματικό χρόνο, μαθαίνοντας από το πλαίσιο (in-context learning).

Ωστόσο, η δοκιμασία αποκάλυψε και σημαντικούς περιορισμούς. Σε ένα νέο σημείο αναφοράς (benchmark) που δημιούργησε η ομάδα, με την ονομασία DrivingBench, τα αποτελέσματα ήταν απογοητευτικά για τα περισσότερα μοντέλα:

  • Το GPT-6 Astra ολοκλήρωσε τη διαδρομή, αν και πολύ αργά.
  • Το Claude Fable 5.1 ολοκλήρωσε μόλις το 45% της διαδρομής.
  • Το Grok της SpaceXAI έφτασε μόνο στο 11%.

Το Σύνορο της Φυσικής Λογικής

Η ικανότητα των μοντέλων να κατανοούν τον φυσικό κόσμο παραμένει ένα από τα τελευταία εμπόδια για την Τεχνητή Γενική Νοημοσύνη (AGI). Εταιρείες όπως η Elorian AI και η Scale AI αναπτύσσουν νέα εργαλεία, όπως το «Humanity’s Sixth Sense», για να μετρήσουν πόσο διαισθητικά κατανοούν τα μοντέλα μια σκηνή, παρόμοια με έναν άνθρωπο. Όπως επισημαίνουν οι ειδικοί, η επίλυση της φυσικής λογικής είναι απαραίτητη για την ανάπτυξη ρομπότ που θα μπορούν να λειτουργήσουν σε οικιακά περιβάλλοντα.