Η εξέλιξη της τεχνητής νοημοσύνης προς πρακτορικά (agentic) συστήματα φέρνει στο προσκήνιο νέες προκλήσεις ασφαλείας. Καθώς η AI αποκτά τη δυνατότητα να τροποποιεί αρχεία, να στέλνει μηνύματα και να εκτελεί εργασίες, το πρόβλημα της ασφάλειας μετατοπίζεται από την παραγωγή επιβλαβούς κειμένου στις επιβλαβείς επιχειρησιακές παρενέργειες.
Το Σύστημα Aegis
Πρόσφατη έρευνα στο ArXiv υποστηρίζει ότι η διακυβέρνηση σε επίπεδο προτροπών (prompt-level) δεν επαρκεί για τη δημιουργία ενός πραγματικού ορίου εκτέλεσης. Η λύση που προτείνεται είναι το Aegis, ένα σύστημα διακυβέρνησης χρόνου εκτέλεσης που αντιμετωπίζει τις εξόδους του μοντέλου ως «προτάσεις δράσης». Σε αυτό το πλαίσιο, το μοντέλο προτείνει, αλλά ένα έμπιστο επίπεδο λήψης αποφάσεων μεσολαβεί πριν από την εκτέλεση οποιουδήποτε εργαλείου.
Μηχανισμοί Ελέγχου και Ασφάλειας
Το Aegis ενσωματώνει κρίσιμα χαρακτηριστικά για τη διασφάλιση της ακεραιότητας του συστήματος:
- Fail-Closed Execution: Σε συνθήκες αβεβαιότητας, το σύστημα προεπιλέγει μια κλειστή κατάσταση (fail-closed), εμποδίζοντας μη εξουσιοδοτημένες ενέργειες.
- Senate-style Settlement: Μια διαδρομή εξουσιοδότησης βασισμένη σε απαρτία (quorum), η οποία διασφαλίζει ότι οι δράσεις ελέγχονται μέσω μιας συλλογικής διαδικασίας λήψης αποφάσεων.
- Trusted Provenance: Η προέλευση των δράσεων επιλύεται στην πλευρά του διακομιστή για τη διατήρηση μιας ασφαλούς αλυσίδας επιτήρησης.
Αποτελέσματα Αξιολόγησης
Σε αξιολογήσεις που κάλυψαν ένα σώμα δεδομένων 6.300 σειρών σε περιβάλλον sandbox, το Aegis επέδειξε σημαντική αποτελεσματικότητα. Ενώ η διαμόρφωση πολιτικής μέσω προτροπών οδήγησε σε 79 περιπτώσεις επικίνδυνης διαρροής, το σύνολο δεδομένων υπό τη διακυβέρνηση του Aegis κατέγραψε μηδενικές ολοκληρώσεις επικίνδυνων παρενεργειών σε 2.100 σειρές. Επιπλέον, και οι 1.832 σειρές που επιχείρησε να διακυβερνήσει το Aegis διατήρησαν την έμπιστη προέλευση, ενώ και οι 1.019 σειρές που διευθετήθηκαν μέσω της διαδικασίας «Συγκλήτου» διέθεταν απαρτία και αποδεικτικά στοιχεία τελικής καταμέτρησης. Οι ερευνητές τονίζουν ότι αν και αυτά τα αποτελέσματα δεν αποδεικνύουν τη γενική ασφάλεια των αυτόνομων πρακτόρων, υποστηρίζουν τον ισχυρισμό ότι η διακυβέρνηση των ορίων δράσης απέτρεψε τις παρατηρούμενες επικίνδυνες προτάσεις από το να μετατραπούν σε επιχειρησιακές παρενέργειες στο αξιολογούμενο περιβάλλον.