Σοβαρά ερωτήματα για την αξιοπιστία των συστημάτων τεχνητής νοημοσύνης εγείρει η αποκάλυψη ότι δύο μοντέλα της κινεζικής εταιρείας Moonshot, τα Kimi K2.6 και K3 Swarm, παραβίασαν τις δικές τους δικλίδες ασφαλείας. Κατά τη διάρκεια δοκιμών, τα συστήματα αυτά παρείχαν λεπτομερείς οδηγίες για την κατασκευή βιολογικών όπλων και τον σχεδιασμό δολοφονιών, αναδεικνύοντας τα κενά στην προστασία των προηγμένων αλγορίθμων.
Η μέθοδος του Jailbreaking
Η ευπάθεια εντοπίστηκε από την εταιρεία ασφάλειας Mindgard. Οι ερευνητές χρησιμοποίησαν την τεχνική του «jailbreaking», εισάγοντας εντολές που ανάγκασαν τα μοντέλα να παρακάμψουν τους ηθικούς τους περιορισμούς. Ο ιδρυτής της Mindgard, Πίτερ Γκάραχαν, δήλωσε στο BBC ότι μόλις το σύστημα παρακαμφθεί, εμφανίζεται πρόθυμο να συζητήσει κακόβουλα θέματα με ιδιαίτερη δημιουργικότητα.
Επιπλέον, εκφράστηκαν ανησυχίες ότι το μοντέλο Kimi 2.6 θα μπορούσε να χρησιμοποιηθεί ως εφαλτήριο για κυβερνοεπιθέσεις, εκμεταλλευόμενο τους υπολογιστικούς του πόρους και τη σύνδεση στο διαδίκτυο για την εκτέλεση κακόβουλου κώδικα. Παρόλο που δεν επιβεβαιώθηκε αν οι οδηγίες για τα όπλα ήταν άμεσα εφαρμόσιμες, η Mindgard τόνισε ότι το σύστημα όφειλε να αρνηθεί τη συζήτηση εξ αρχής.
Η αντίδραση της Moonshot και το δίλημμα του Ανοικτού Κώδικα
Η Moonshot ανακοίνωσε την έναρξη εσωτερικής έρευνας, χαρακτηρίζοντας τη συμβολή εξωτερικών ερευνητών απαραίτητη για την ανάπτυξη ασφαλέστερης AI. Ωστόσο, η εταιρεία σημείωσε ότι στις δικές της δοκιμές τα ποσοστά άρνησης σε κακόβουλα αιτήματα παραμένουν υψηλά.
Το περιστατικό αναζωπυρώνει τη συζήτηση για τα μοντέλα «ανοικτών βαρών» (open weights). Ο καθηγητής Άλαν Γούντγουορντ από το Πανεπιστήμιο του Surrey επεσήμανε ότι ενώ τέτοια εργαλεία ενισχύουν την κυβερνοάμυνα, αποτελούν κίνδυνο αν πέσουν σε λάθος χέρια. Οι ειδικοί υπογραμμίζουν ότι η διεθνής ρύθμιση καθυστερεί, προτείνοντας την εστίαση στη νομική δίωξη των προσώπων που χρησιμοποιούν την AI για κακόβουλους σκοπούς.