Παρά τις εντυπωσιακές τους ικανότητες, τα Μεγάλα Γλωσσικά Μοντέλα (LLMs) παραμένουν ευάλωτα σε επιθέσεις «jailbreak», οι οποίες αποσπούν επιβλαβές περιεχόμενο παρακάμπτοντας τους μηχανισμούς ασφαλείας. Οι παραδοσιακές μέθοδοι ευθυγράμμισης, όπως η Εποπτευόμενη Μικρορύθμιση (SFT) και η Ενισχυτική Μάθηση από Ανθρώπινη Ανατροφοδότηση (RLHF), συχνά οδηγούν σε μια «ρηχή» ασφάλεια, όπου το μοντέλο μαθαίνει απλώς να αρνείται συγκεκριμένες φράσεις, ενώ συχνά παρουσιάζει το φαινόμενο της υπερβολικής άρνησης (over-refusal) σε αθώα ερωτήματα.
Η καινοτομία του SSRFT
Μια νέα μελέτη εισάγει το πλαίσιο SSRFT (Supervised Safe-Role Fine-Tuning), το οποίο επαναπροσδιορίζει την ασφάλεια ως την εσωτερίκευση ενός προκαθορισμένου «ασφαλούς ρόλου». Αντί να εστιάζει σε λίστες απαγορευμένων απαντήσεων, το SSRFT εκπαιδεύει το μοντέλο να υιοθετεί μια ταυτότητα που διέπεται από αξίες και αρχές ασφαλείας.
Η μέθοδος βασίζεται στη δημιουργία ενός συνόλου δεδομένων Safe-Role Question-Answer (SRQA), το οποίο περιλαμβάνει:
- Ψυχομετρικές ερωτήσεις.
- Περιορισμένα δείγματα επιθέσεων jailbreak.
- Περιγραφές ασφαλών ρόλων.
Αποτελέσματα και Ανθεκτικότητα
Οι δοκιμές σε διάφορα μοντέλα έδειξαν ότι η προσέγγιση SSRFT προσφέρει σημαντικά μεγαλύτερη ανθεκτικότητα σε επιθέσεις τύπου «prefilling» και καλύτερη γενίκευση σε άγνωστα πεδία επιθέσεων. Παράλληλα, μειώνει το ποσοστό λανθασμένων αρνήσεων σε ακίνδυνες ερωτήσεις, διατηρώντας αμείωτες τις γενικές ικανότητες του μοντέλου. Αυτό υποδηλώνει ότι η εσωτερίκευση ενός ηθικού ρόλου είναι πιο αποτελεσματική από την απλή εκμάθηση μοτίβων άρνησης.