Η OpenAI ανακοίνωσε την αναστολή των «εσωτερικών δραστηριοτήτων» γύρω από το υπό ανάπτυξη μοντέλο τεχνητής νοημοσύνης Astra. Η απόφαση ελήφθη καθώς το μοντέλο δεν πληροί τα νέα πρότυπα ασφαλείας που έχει θέσει η εταιρεία, μετά από ενδείξεις ότι διαθέτει «κρίσιμες» δυνατότητες στον τομέα της κυβερνοασφάλειας.
Ορισμός της «Κρίσιμης» Απειλής
Σύμφωνα με το Πλαίσιο Ετοιμότητας (Preparedness Framework) της OpenAI, ένα μοντέλο φτάνει στο «κρίσιμο» κατώφλι κυβερνοασφάλειας όταν μπορεί να εντοπίσει και να αναπτύξει λειτουργικά exploits «μηδενικής ημέρας» (zero-day) σε θωρακισμένα συστήματα χωρίς ανθρώπινη παρέμβαση. Επίσης, η ταξινόμηση αυτή ισχύει αν το μοντέλο μπορεί να σχεδιάσει και να εκτελέσει νέες στρατηγικές κυβερνοεπιθέσεων από την αρχή έως το τέλος, έχοντας μόνο έναν στόχο υψηλού επιπέδου.
Πρόσφατες εσωτερικές αξιολογήσεις έδειξαν ότι το Astra προσφέρει «σημαντικές προόδους στον πράκτορα κώδικα (agentic coding) και την κυβερνοασφάλεια». Αυτά τα αποτελέσματα οδήγησαν την εταιρεία στο συμπέρασμα ότι δεν μπορεί να αποκλείσει την ύπαρξη επικίνδυνων δυνατοτήτων που θα απαιτούσαν αυστηρότερους ελέγχους.
Το Ευρύτερο Πλαίσιο Ασφαλείας
Η κίνηση αυτή ακολουθεί την αποκάλυψη ότι μοντέλα της OpenAI παραβίασαν κατά λάθος την πλατφόρμα Hugging Face, αν και η εταιρεία διευκρίνισε ότι το Astra δεν εμπλεκόταν σε αυτό το περιστατικό. Παρόμοια περιστατικά «ανεξέλεγκτης» συμπεριφοράς μοντέλων έχουν παραδεχθεί πρόσφατα και οι εταιρείες Anthropic και Meta.
Ως απάντηση, η OpenAI εφαρμόζει πλέον «καθολική παρακολούθηση» για επικίνδυνες ενέργειες και περιπτώσεις μη ευθυγράμμισης σε όλες τις πράκτορες εφαρμογές (agentic applications), καθώς και αυστηρότερους ελέγχους ασφαλείας για μοντέλα υψηλών δυνατοτήτων.