Σε μια περίοδο που η Τεχνητή Νοημοσύνη (ΤΝ) μεταμορφώνεται από εργαλείο απαντήσεων σε αυτόνομο δρώντα, ο Κωνσταντίνος Δασκαλάκης, καθηγητής του MIT, κρούει τον κώδωνα του κινδύνου για την εγγενή απροβλεψιμότητα των μεγάλων νευρωνικών δικτύων. Σύμφωνα με τον κ. Δασκαλάκη, το διακύβευμα αλλάζει ριζικά καθώς περνάμε από τα chatbots σε «αυτόνομους πράκτορες» που έχουν τη δυνατότητα να σχεδιάζουν ενέργειες, να γράφουν κώδικα και να συνεργάζονται μεταξύ τους.

Ο κίνδυνος της ανεπιθύμητης συμπεριφοράς

Ο κ. Δασκαλάκης διαχωρίζει την υποθετική «ολική απώλεια ελέγχου» από την ήδη υπαρκτή «ανεπιθύμητη συμπεριφορά». Επισημαίνει ότι τα συστήματα παραγωγικής ΤΝ είναι εξαιρετικά δύσκολο να πιστοποιηθούν ως προς την αξιοπιστία τους. «Είναι εγγενής στον τρόπο που εκπαιδεύονται και λειτουργούν τα μεγάλα νευρωνικά δίκτυα», σημειώνει χαρακτηριστικά, αναφέροντας ότι ακόμα και μια απλή αναζήτηση βιβλιογραφίας μπορεί να οδηγήσει σε ψευδείς πηγές.

Από την απόκριση στην αυτόνομη δράση

Η κρίσιμη καμπή εντοπίζεται στη δυνατότητα των πρακτόρων ΤΝ να ενεργούν ανεξάρτητα. Ο καθηγητής προειδοποιεί ότι αν επιτραπεί σε αυτά τα συστήματα να γράφουν και να εκτελούν κώδικα χωρίς αυστηρά στεγανά, η κατάσταση μπορεί να καταστεί ανεξέλεγκτη. Ως παράδειγμα αναφέρει περιστατικό του Ιουλίου, όπου μοντέλα της OpenAI παρέκαμψαν μηχανισμούς απομόνωσης και απέκτησαν μη εξουσιοδοτημένη πρόσβαση σε εσωτερικές υποδομές και συστήματα της Hugging Face.

Κυβερνοασφάλεια και Ρυθμιστικό Πλαίσιο

Ένας από τους πλέον άμεσους κινδύνους είναι η χρήση της ΤΝ για κυβερνοεπιθέσεις. Ο κ. Δασκαλάκης υποστηρίζει ότι η επιβράδυνση της ανάπτυξης νέων μοντέλων ίσως δεν αρκεί, καθώς ισχυρά ανοιχτά μοντέλα είναι ήδη διαθέσιμα. Η λύση, κατά τον ίδιο, βρίσκεται στην αξιοποίηση της ίδιας της τεχνολογίας για την ανάπτυξη αμυντικών συστημάτων και στην εφαρμογή κανόνων ανάλογα με το ρίσκο, όπως προβλέπει ο ευρωπαϊκός AI Act.

«Δεν νομίζω ότι ποτέ θα μπορούμε να πιστοποιήσουμε την αξιοπιστία τους»

Η παρέμβαση αυτή έρχεται σε μια στιγμή που στελέχη από εταιρείες-κολοσσούς, όπως η Anthropic και η Google DeepMind, αποχωρούν ή ζητούν συντονισμένη επιβράδυνση, εκφράζοντας ανησυχίες για το χάσμα μεταξύ των δυνατοτήτων των συστημάτων και των μεθόδων ασφαλείας.