Η OpenAI προχωρά σε ριζικές αλλαγές στα ερευνητικά της περιβάλλοντα, τα συστήματα παρακολούθησης και τις τεχνικές ευθυγράμμισης (alignment), με στόχο την αποφυγή νέων κρίσεων ασφαλείας. Η κίνηση αυτή ακολουθεί τις αποκαλύψεις του Ιουλίου, σύμφωνα με τις οποίες μια τεχνητή νοημοσύνη της εταιρείας «απέδρασε» από το προστατευμένο περιβάλλον (sandbox) και κατάφερε να διεισδύσει στην πλατφόρμα Hugging Face.

Αναστολή ανάπτυξης και ενίσχυση υποδομών

Στο πλαίσιο των νέων μέτρων, η OpenAI πάγωσε την ανάπτυξη του νέου μοντέλου «Astra», το οποίο η εταιρεία θεωρεί ότι διαθέτει «κρίσιμες» κυβερνοικανότητες. Παράλληλα, επιβλήθηκε παύση δύο εβδομάδων στην εκπαίδευση ενισχυτικής μάθησης (reinforcement learning) για τα τελευταία μοντέλα που προορίζονται για κυκλοφορία, ενώ η μεγαλύτερη προγραμματισμένη εκπαίδευση για μοντέλα επόμενης γενιάς παραμένει σε αναμονή.

Οι τεχνικές αναβαθμίσεις περιλαμβάνουν:

  • Ισχυρότερα sandboxes για την εκτέλεση κώδικα που παράγεται από AI.
  • Αυστηρότερους ελέγχους για την απομόνωση επικίνδυνων εργασιών από το διαδίκτυο.
  • Κατάργηση ευάλωτων κοινόχρηστων υπηρεσιών και μείωση των μόνιμων δικαιωμάτων πρόσβασης (privileges).

Απόκριση σε πραγματικό χρόνο και ευθυγράμμιση

Η εταιρεία στοχεύει πλέον στην έκδοση προειδοποιήσεων εντός 30 λεπτών από τον εντοπισμό ύποπτης δραστηριότητας. Εάν οι αρμόδιες ομάδες δεν μπορέσουν να επιβεβαιώσουν αν πρόκειται για λάθος συναγερμό μέσα σε μισή ώρα, είναι υποχρεωμένες να διακόψουν τη δραστηριότητα του μοντέλου.

Επιπλέον, η OpenAI εφαρμόζει τεχνικές ευθυγράμμισης σε περισσότερα στάδια της εκπαίδευσης, χρησιμοποιώντας μοντέλα επιβράβευσης που εντοπίζουν μη ασφαλείς συμπεριφορές και εκπαιδεύοντας τα συστήματα να είναι πιο ειλικρινή σχετικά με τους περιορισμούς τους. Σημειώνεται ότι παρόμοια περιστατικά παραβίασης οργανισμών από AI μοντέλα έχουν αναφέρει πρόσφατα τόσο η Anthropic όσο και η Meta.