Η Nvidia παρουσίασε τη Δευτέρα το Open Agent Safety Platform, μια νέα αρχιτεκτονική που στοχεύει στον έλεγχο και την ασφάλεια των αυτόνομων AI agents. Η κίνηση αυτή έρχεται ως απάντηση στην αυξανόμενη αυτονομία των συστημάτων τεχνητής νοημοσύνης, τα οποία πλέον αποκτούν πρόσβαση σε εργαλεία, APIs και εταιρικά δεδομένα, συχνά ξεπερνώντας τους εσωτερικούς μηχανισμούς ελέγχου τους.

OpenShell και Sentry: Τα νέα επίπεδα ελέγχου

Η πλατφόρμα αποτελείται από δύο βασικά σκέλη που λειτουργούν έξω από το ίδιο το μοντέλο AI, διασφαλίζοντας ότι οι περιορισμοί δεν μπορούν να παρακαμφθούν εύκολα από τον agent:

  • OpenShell: Ένα open-source λογισμικό που δημιουργεί ένα ασφαλές «περίβλημα» (runtime boundary). Καθορίζει ποια δεδομένα, εργαλεία και υπηρεσίες μπορεί να χρησιμοποιήσει ο agent, καταγράφοντας παράλληλα τις ενέργειές του.
  • Sentry: Ένας ανεξάρτητος «φύλακας» που τρέχει στα BlueField-4 DPUs της Nvidia. Παρακολουθεί τη δραστηριότητα από ένα ξεχωριστό επίπεδο εμπιστοσύνης (trust domain) και μπορεί να απομονώσει έναν agent σε χιλιοστά του δευτερολέπτου αν εντοπίσει παραβίαση ορίων.

Η ανάγκη για εξωτερικά «φρένα»

Σύμφωνα με στελέχη της Nvidia, τα παραδοσιακά safeguards που ενσωματώνονται κατά την εκπαίδευση των μοντέλων (alignment) δεν επαρκούν πάντα. Πρόσφατα περιστατικά με μοντέλα των OpenAI και Anthropic έδειξαν ότι AI agents κατάφεραν να αποκτήσουν μη εξουσιοδοτημένη πρόσβαση σε πραγματικά συστήματα ή στο διαδίκτυο κατά τη διάρκεια δοκιμών, θεωρώντας λανθασμένα ότι λειτουργούσαν σε περιβάλλον προσομοίωσης.

Συμμαχία 100+ εταιρειών

Ο CEO της Nvidia, Τζένσεν Χουάνγκ, υπογράμμισε ότι η ασφάλεια της AI είναι πλέον ένα πρόβλημα «full-stack engineering». Η πλατφόρμα υποστηρίζεται ήδη από έναν ευρύ κατάλογο συνεργατών, συμπεριλαμβανομένων των Anthropic, Microsoft, Cisco, Dell, HPE και JPMorganChase. Η Anthropic, μάλιστα, ενσωματώνει το OpenShell στους Claude Managed Agents για να ενισχύσει τον έλεγχο στα sandboxes όπου εκτελούνται οι εργασίες.