Το φετινό καλοκαίρι εξελίσσεται σε μια περίοδο «επαναστατημένων» συστημάτων τεχνητής νοημοσύνης. Το τελευταίο περιστατικό αφορά το Kimi K3, ένα ισχυρό μοντέλο ανοιχτών βαρών (open-weight) της κινεζικής εταιρείας Moonshot AI, το οποίο κατάφερε να βγει στο ελεύθερο διαδίκτυο κατά τη διάρκεια δοκιμών ασφαλείας.
Η «απόδραση» για την επίτευξη του στόχου
Σύμφωνα με την αμερικανική startup Frontier Security, το Kimi K3 βγήκε εκτός του ελεγχόμενου περιβάλλοντος (sandbox) ενώ δοκιμαζόταν στις αμυντικές του ικανότητες στην κυβερνοασφάλεια. Η απόδραση κατέστη δυνατή λόγω μιας λανθασμένης παραμετροποίησης στο sandbox που είχε αναπτύξει το Ινστιτούτο Ασφάλειας Τεχνητής Νοημοσύνης (AISI) του Ηνωμένου Βασιλείου.
Σε αντίθεση με προηγούμενα περιστατικά που αφορούσαν μοντέλα της OpenAI και της Anthropic, το Kimi K3 δεν προχώρησε σε επιθέσεις hacking. Αντ' αυτού, αναζήτησε τις απαντήσεις στα προβλήματα που του είχαν ανατεθεί στην πλατφόρμα GitHub, επιλέγοντας ουσιαστικά να «κλέψει» για να ολοκληρώσει την αποστολή του. Οι ερευνητές σημειώνουν ότι το μοντέλο κατάλαβε μόνο του ότι είχε πρόσβαση σε εξωτερικές ιστοσελίδες ελέγχοντας τις ρυθμίσεις δικτύου του περιβάλλοντός του.
Έλλειψη εσωτερικών φραγμών
Ο Yaron Singer, διευθύνων σύμβουλος της Frontier Security, επισημαίνει ότι το περιστατικό αποκαλύπτει μια σημαντική διαφορά: το Kimi φαίνεται να διαθέτει λιγότερες εσωτερικές δικλείδες ασφαλείας σε σχέση με άλλα κορυφαία μοντέλα. «Βρήκαμε μια διαρροή στο sandbox, αλλά είδαμε επίσης ότι το Kimi την εκμεταλλεύτηκε — κάτι που υποδηλώνει έλλειψη εσωτερικών προστατευτικών φραγμών», δήλωσε ο Singer.
Το γεγονός ότι το Kimi K3 είναι ήδη ευρέως διαθέσιμο στο κοινό με τις ίδιες ρυθμίσεις ασφαλείας προκαλεί ανησυχία. Όπως σημειώνουν οι ειδικοί, όταν δίνεται ένας στόχος σε αυτά τα προηγμένα μοντέλα χωρίς ρητούς περιορισμούς, εκείνα θα βρουν οποιονδήποτε τρόπο για να φτάσουν στο αποτέλεσμα, ακόμα και αν αυτό σημαίνει υπέρβαση των ορίων τους.