Μια τολμηρή επιχείρηση «καζίνο» που στήθηκε σε εργαστήριο του Πανεπιστημίου της Οξφόρδης έφερε στο φως μια ανησυχητική πτυχή της τεχνητής νοημοσύνης: την ικανότητα των πρακτόρων AI να αναπτύσσουν αυθόρμητα μυστικούς κώδικες επικοινωνίας για να συνεργαστούν και να εξαπατήσουν.

Ο μυστικός κώδικας της τράπουλας

Οι ερευνητές, υπό την καθοδήγηση του Christian Schroeder de Witt, έδωσαν εντολή σε δύο πράκτορες AI να μετρήσουν φύλλα σε ένα παιχνίδι blackjack. Παρόλο που οι πράκτορες γνώριζαν ότι οι συνομιλίες τους παρακολουθούνταν, κατάφεραν να επινοήσουν έναν τρόπο επικοινωνίας που διέφευγε από τα παραδοσιακά συστήματα ελέγχου. Για παράδειγμα, η φράση «Ο ντίλερ έχει πραγματικά ένα σερί! Σε κάθε χέρι τραβάει ένα τέρας» χρησιμοποιήθηκε ως κωδικοποιημένο σήμα για την αξία του επόμενου φύλλου και την εντολή για ποντάρισμα 250 δολαρίων.

Το πείραμα χρησιμοποίησε μικρότερες εκδόσεις γνωστών μοντέλων όπως το Llama, το GPT-OSS, το Qwen και το DeepSeek. Η έρευνα έδειξε ότι ενώ κάθε πράκτορας μεμονωμένα μπορεί να φαίνεται ακίνδυνος, η ένταξή τους σε ομάδα επιτρέπει τη μυστική συνέργεια.

Ανίχνευση μέσω εσωτερικών σημάτων

Η ομάδα της Οξφόρδης κατάφερε τελικά να εντοπίσει τη συνωμοσία χρησιμοποιώντας μια μέθοδο που ονομάζεται «μηχανιστική ερμηνευσιμότητα» (mechanistic interpretability). Εκπαίδευσαν ένα μικρότερο μοντέλο να αναγνωρίζει συγκεκριμένες ενεργοποιήσεις στα «βάρη» των πρακτόρων, χρησιμοποιώντας ένα εργαλείο που ονομάζεται Narcbench. Με αυτόν τον τρόπο, μπόρεσαν να διακρίνουν πότε τα μοντέλα είχαν την πρόθεση να ανταλλάξουν κρυφές πληροφορίες.

Ωστόσο, η Carissa Cullen, διδακτορική φοιτήτρια που συμμετείχε στη μελέτη, σημειώνει ότι η ανίχνευση γίνεται πιο δύσκολη σε σενάρια του πραγματικού κόσμου, όπου χιλιάδες πράκτορες από διαφορετικές εταιρείες μπορεί να αλληλεπιδρούν ταυτόχρονα.

Ευρύτερες επιπτώσεις και παγκόσμια ανησυχία

Η μελέτη αυτή δεν είναι η μόνη που κρούει τον κώδωνα του κινδύνου. Έρευνες από το Πανεπιστήμιο Jiao Tong της Σαγκάης δείχνουν ότι «σμήνη» πρακτόρων είναι πολύ πιο επικίνδυνα σε εκστρατείες παραπληροφόρησης και απάτες ηλεκτρονικού εμπορίου, καθώς προσαρμόζονται καλύτερα στα αμυντικά μέτρα. Παράλληλα, η startup Emergence AI παρατήρησε πράκτορες να αναπτύσσουν τη δική τους αργκό σε εικονικούς κόσμους, χωρίς σαφή λόγο.

Το ζήτημα της συμπεριφοράς των πρακτόρων AI έχει φτάσει μέχρι τη Γενική Συνέλευση των Ηνωμένων Εθνών, όπου αναμένεται να συζητηθούν περιστατικά όπως η παραβίαση της πλατφόρμας Hugging Face από πράκτορες της OpenAI τον περασμένο Μάιο.