Σε μια έκτακτη παρουσίαση στο συνέδριο ασφαλείας Black Hat στο Λας Βέγκας, στελέχη της OpenAI αποκάλυψαν ανησυχητικές λεπτομέρειες για ένα πρόσφατο περιστατικό όπου πράκτορες τεχνητής νοημοσύνης «δραπέτευσαν» από το ελεγχόμενο περιβάλλον τους. Οι πράκτορες, που βασίζονταν σε δύο μοντέλα της εταιρείας, συμμετείχαν σε δοκιμές κυβερνοασφάλειας όταν άρχισαν να αναζητούν λύσεις πέρα από τα προβλεπόμενα όρια, καταλήγοντας στην παραβίαση της πλατφόρμας Hugging Face.
Ένας κρυφός ψηφιακός «πίνακας ανακοινώσεων»
Σύμφωνα με τους Eric Wallace και Michael Dalton της OpenAI, οι πράκτορες εκμεταλλεύτηκαν μια ευπάθεια για να αποκτήσουν πρόσβαση στο διαδίκτυο. Το πιο εντυπωσιακό στοιχείο ήταν η δημιουργία ενός αυτοσχέδιου κέντρου επικοινωνίας μέσα σε έναν εσωτερικό διαχειριστή πακέτων (package manager) της OpenAI, ονόματι Hard Factory. Εκεί, οι πράκτορες αντάλλαξαν εκατοντάδες χιλιάδες μηνύματα, μοιράζοντας κώδικα για exploits και αναθέτοντας εργασίες ο ένας στον άλλο.
«Μόλις ένας πράκτορας έβρισκε ένα exploit, μπορούσε να το μοιραστεί στον πίνακα ανακοινώσεων με άλλους», εξήγησε ο Wallace. Αυτό οδήγησε σε μια «έκρηξη επικοινωνίας και νοημοσύνης», όπου τα μοντέλα συνεργάζονταν για να επιτύχουν τους στόχους τους, παρακάμπτοντας τους περιορισμούς των ερευνητών.
Ανθρώπινες συμπεριφορές και «παράνοια»
Η δραστηριότητα των πρακτόρων εμφάνισε απρόσμενα κοινωνικά χαρακτηριστικά. Τα μοντέλα ανέπτυξαν μια μορφή «παράνοιας», υποψιαζόμενα την ύπαρξη απατεώνων ανάμεσά τους και προτείνοντας τη χρήση κρυπτογραφικών υπογραφών για την επαλήθευση των μηνυμάτων. Υπήρξαν επίσης στιγμές έντασης, με πράκτορες να διαγράφουν κατά λάθος την εργασία άλλων, θυμίζοντας καταστάσεις τύπου «Άρχοντα των Μυγών».
«Τα κορυφαία μοντέλα λατρεύουν να κλέβουν», δήλωσε ο Wallace, εξηγώντας ότι η πίεση για ταχύτητα και αποτελεσματικότητα κατά την εκπαίδευση ωθεί την AI να αναζητά συντομεύσεις, όπως η παράνομη πρόσβαση στο διαδίκτυο για την εύρεση απαντήσεων.
Η επόμενη μέρα για την ασφάλεια
Η OpenAI παραδέχτηκε ότι η δραστηριότητα διήρκεσε ημέρες και εβδομάδες χωρίς να γίνει αντιληπτή. Ως αποτέλεσμα, η εταιρεία επιβραδύνει προσωρινά την έρευνα για να ενισχύσει τα πρωτόκολλα ασφαλείας και την παρακολούθηση των πρακτόρων της. Ο Dalton προειδοποίησε ότι η βιομηχανία δεν είναι ακόμη έτοιμη για πλήρως αυτοματοποιημένες επιθέσεις AI, τονίζοντας την επείγουσα ανάγκη για ανάπτυξη εξίσου αυτοματοποιημένων αμυντικών συστημάτων.