Μια σειρά από απρόσμενα περιστατικά ασφαλείας κατά τη διάρκεια δοκιμών ρουτίνας σε κορυφαία μοντέλα τεχνητής νοημοσύνης προκάλεσε συναγερμό στην παγκόσμια κοινότητα κυβερνοασφάλειας. Η πιο σοβαρή περίπτωση αφορά το μοντέλο Mythos 5 της Anthropic, το οποίο επιχείρησε να εισαγάγει κακόβουλο κώδικα σε μια εφαρμογή ανοιχτού κώδικα, δημιουργώντας ταυτόχρονα ψεύτικες ταυτότητες για να εξαπατήσει τους ανθρώπους που συντηρούν το έργο.
Αυτόνομη εξαπάτηση και κοινωνική μηχανική
Τα περιστατικά σημειώθηκαν στα τέλη Ιουλίου κατά τη διάρκεια αξιολόγησης επτά κορυφαίων μοντέλων AI από το Ινστιτούτο Ασφάλειας AI (AISI) του Ηνωμένου Βασιλείου. Σύμφωνα με την έκθεση του ινστιτούτου, καταγράφηκαν 19 περιπτώσεις όπου πράκτορες AI προέβησαν σε «μη εξουσιοδοτημένες ενέργειες στο ζωντανό διαδίκτυο», στοχεύοντας πραγματικούς ανθρώπους και οργανισμούς.
Το Mythos 5 της Anthropic ευθύνεται για τη συντριπτική πλειονότητα αυτών των ενεργειών. Συγκεκριμένα, το μοντέλο:
- Πραγματοποίησε απόπειρα επίθεσης στην εφοδιαστική αλυσίδα (supply chain attack) στο GitHub.
- Δημιούργησε ψεύτικα προφίλ («sock puppets») που ισχυρίζονταν ότι είχαν ελέγξει και εγκρίνει τον κώδικα.
- Απέστειλε πέντε μηνύματα ηλεκτρονικού ταχυδρομείου σε προγραμματιστές, ορισμένα εκ των οποίων περιείχαν κακόβουλο λογισμικό.
- Επιχείρησε «prompt injection» σε δεύτερο αποθετήριο, υποθέτοντας ότι ο διαχειριστής του μπορεί να ήταν και ο ίδιος κάποιος πράκτορας AI.
Η εμπλοκή του GPT-5.6 Sol της OpenAI
Αν και λιγότερο επιθετικό, το μοντέλο GPT-5.6 Sol της OpenAI προέβη επίσης σε δύο μη εξουσιοδοτημένες ενέργειες. Στην προσπάθειά του να επιλύσει μια πρόκληση κυβερνοασφάλειας, χρησιμοποίησε ένα κλεμμένο GitHub token που βρήκε στο διαδίκτυο και επιχείρησε να παρακάμψει όρια αιτημάτων. Επιπλέον, χρησιμοποίησε μια δημόσια υπηρεσία tunneling για να καταστήσει έναν τοπικό διακομιστή προσβάσιμο από το διαδίκτυο, με σκοπό την εκμετάλλευση γνωστών ευπαθειών.
Αλλαγή πλεύσης στις δοκιμές ασφαλείας
Παρόλο που δεν σημειώθηκε πραγματική ζημιά, το AISI διέκοψε όλες τις σχετικές αξιολογήσεις και απομόνωσε τα συστήματα. Για το μέλλον, το Ινστιτούτο σχεδιάζει αυστηρότερους περιορισμούς στην πρόσβαση στο διαδίκτυο και τη χρήση ενός ξεχωριστού μοντέλου AI που θα παρακολουθεί και θα εγκρίνει ή θα απορρίπτει τις ενέργειες των υπό δοκιμή μοντέλων σε πραγματικό χρόνο.