Με μια κίνηση του μοχλού και το πάτημα μερικών κουμπιών, ακόμα και ένας ερασιτέχνης παίκτης μπορεί να καθοδηγήσει έναν χαρακτήρα σε ένα τρισδιάστατο περιβάλλον. Μια βρετανική startup, η Worldmodeldata, στοιχηματίζει ότι αυτές οι απλές αλληλουχίες κινήσεων κρύβουν έναν θησαυρό πληροφοριών, ικανό να εκπαιδεύσει τη νέα γενιά τεχνητής νοημοσύνης.
Από τα Λόγια στις Πράξεις
Στους κόλπους της βιομηχανίας AI ενισχύεται η πεποίθηση ότι τα Μεγάλα Γλωσσικά Μοντέλα (LLMs) θα φτάσουν σύντομα σε αδιέξοδο λόγω της αδυναμίας τους να κατανοήσουν τον φυσικό κόσμο. Εκπαιδευμένα μόνο με λέξεις, τα LLMs δυσκολεύονται να οδηγήσουν αυτόνομα οχήματα ή να χειριστούν ρομποτικούς βραχίονες με την απαραίτητη ακρίβεια. Για τον λόγο αυτό, κορυφαίοι ερευνητές όπως η Fei-Fei Li και ο Yann LeCun στρέφουν το ενδιαφέρον τους στα «μοντέλα κόσμου» (world models).
Για να κατανοήσουν τη φυσική, αυτά τα μοντέλα χρειάζονται δεδομένα δράσης και αποτελέσματος. Ενώ το διαδίκτυο σφύζει από κείμενα, υπάρχει έλλειψη δεδομένων που να συνδέουν μια οπτική πληροφορία με μια συγκεκριμένη κίνηση. Η Worldmodeldata λειτουργεί ως μεσάζων, συλλέγοντας και οργανώνοντας δεδομένα από στούντιο βιντεοπαιχνιδιών για να τα προσφέρει σε εργαστήρια AI.
Η Πρόκληση της Ρεαλιστικής Φυσικής
Η θεωρία είναι ότι τα video games προσφέρουν την απαραίτητη ποσότητα και ποικιλία δεδομένων, συμπεριλαμβανομένων των σπάνιων περιπτώσεων (corner cases) που είναι κρίσιμες για την ασφάλεια σε οχήματα ή drones. Ωστόσο, δεν συμφωνούν όλοι. Η Nvidia, για παράδειγμα, προτιμά τις δικές της προσομοιώσεις, υποστηρίζοντας ότι η φυσική των παιχνιδιών είναι συχνά «κατά προσέγγιση».
Σύμφωνα με τον Ming-Yu Liu της Nvidia, τα παιχνίδια συχνά χρησιμοποιούν οπτικά τεχνάσματα αντί για πραγματική φυσική. Για παράδειγμα, ένας χαρακτήρας μπορεί να πιάνει ένα μήλο χωρίς το μοντέλο να υπολογίζει την πίεση κάθε δακτύλου. Παρόλα αυτά, η Worldmodeldata έχει ήδη εξασφαλίσει σχεδόν 1 εκατομμύριο ώρες δεδομένων, ελπίζοντας ότι αυτή η προσέγγιση θα οδηγήσει στη «στιγμή GPT» για τη ρομποτική.