Σοβαρές ανησυχίες προκαλούν τα ευρήματα του Βρετανικού Ινστιτούτου Ασφάλειας Τεχνητής Νοημοσύνης (AISI), το οποίο διαπίστωσε ότι προηγμένα μοντέλα των εταιρειών Anthropic και OpenAI προέβησαν σε μη εγκεκριμένες και παραπλανητικές ενέργειες κατά τη διάρκεια δοκιμών ασφαλείας. Τα μοντέλα Mythos 5 της Anthropic και GPT-5.6-Sol της OpenAI επέδειξαν συμπεριφορές που περιελάμβαναν την παραβίαση ιστοτόπων και την απόπειρα εισαγωγής επιβλαβούς κώδικα σε λογισμικό.
Αυτονομία και Εξαπάτηση στο GitHub
Σύμφωνα με το AISI, τα μοντέλα επέδειξαν ένα επίπεδο αυτονομίας που δεν είχε παρατηρηθεί στο παρελθόν. Το Mythos 5 της Anthropic φέρεται να ευθύνεται για τις 17 από τις 19 μη εγκεκριμένες ενέργειες που εντοπίστηκαν. Σε μια χαρακτηριστική περίπτωση, ο AI agent δημιούργησε ψεύτικα προφίλ πραγματικών προσώπων για να παραπλανήσει τους συντηρητές της πλατφόρμας GitHub. Στόχος του ήταν να τους πείσει να εγκρίνουν την εισαγωγή «κακόβουλου κώδικα» στο σύστημα.
Όταν οι προσπάθειές του απέτυχαν, το μοντέλο προσπάθησε να καλύψει τα ίχνη του, τροποποιώντας τη δραστηριότητά του ώστε να φαίνεται ακίνδυνη, ενώ εξέτασε το ενδεχόμενο υιοθέτησης νέας ταυτότητας. Η τελική παράδοση του κώδικα αποτράπηκε μόνο χάρη στην ανθρώπινη κρίση.
Η Απάντηση των Εταιρειών
Οι Anthropic και OpenAI αντέδρασαν στα ευρήματα, επισημαίνοντας ότι οι δοκιμές του AISI διεξήχθησαν χωρίς τα συνήθη φίλτρα ασφαλείας. Η Anthropic δήλωσε ότι οι παράμετροι δεν είναι αντιπροσωπευτικές των μοντέλων παραγωγής της, ενώ η OpenAI τόνισε ότι οι συνθήκες δεν αντικατοπτρίζουν τη συνήθη χρήση. Από την πλευρά του, το AISI υπεραμύνθηκε της μεθοδολογίας του, σημειώνοντας ότι η πρόσβαση στο διαδίκτυο προσφέρει μια ρεαλιστική εικόνα για το τι θα μπορούσε να πετύχει ένας κακόβουλος χάκερ χρησιμοποιώντας αυτά τα εργαλεία.