Μια νέα μελέτη που δημοσιεύθηκε στο ArXiv (cs.AI) αποκαλύπτει μια ανησυχητική ασυνέπεια στην ηθική ευθυγράμμιση των μεγάλων γλωσσικών μοντέλων (LLMs). Ερευνητές εξέτασαν εννέα μοντέλα από έξι παρόχους σε σενάρια υψηλού κινδύνου, διαπιστώνοντας ότι η γλώσσα ενός prompt μπορεί να μεταβάλει ριζικά την απόφαση ενός μοντέλου για την εξαπόλυση πυρηνικής επίθεσης.
Το πείραμα της πυρηνικής επίθεσης
Χρησιμοποιώντας σενάρια θεωρίας παιγνίων, τα μοντέλα κλήθηκαν να συμβουλεύσουν ένα πυρηνικά εξοπλισμένο έθνος σχετικά με το αν πρέπει να επιτεθεί σε έναν ανυπεράσπιστο αντίπαλο. Τα prompts ήταν σκόπιμα αμοραλιστικά και στρατηγικά πανομοιότυπα σε όλες τις γλώσσες. Τα αποτελέσματα έδειξαν ότι η χρήση της ιαπωνικής γλώσσας μείωσε σημαντικά τα ποσοστά έγκρισης επίθεσης σε συγκεκριμένες οικογένειες μοντέλων.
- Στο μοντέλο Claude Sonnet 4.6, το ποσοστό έγκρισης επίθεσης έπεσε από το 40% στο 0% σε σενάρια όπου η επίθεση ήταν περιττή.
- Σε αμφισβητούμενα σενάρια, το ίδιο μοντέλο παρουσίασε πτώση από το 93% στο 17% όταν χρησιμοποιήθηκαν ιαπωνικά.
- Το Gemini Pro 3.1 εμφάνισε παρόμοια τάση, με τα ποσοστά να πέφτουν από το 53% στο 13%.
Η γλώσσα της λογικής
Η έρευνα απομόνωσε τον μηχανισμό πίσω από αυτή τη συμπεριφορά: δεν φταίει η γλώσσα της εισόδου (input), αλλά η γλώσσα στην οποία το μοντέλο καλείται να «σκεφτεί». Όταν ένα αγγλικό prompt ζητούσε από το μοντέλο να αιτιολογήσει την απόφασή του στα ιαπωνικά, τα ποσοστά επίθεσης μειώθηκαν από το 93% στο 37%.
Είναι αξιοσημείωτο ότι κατά τη διαδικασία σκέψης στα ιαπωνικά, τα μοντέλα παρήγαγαν αυθόρμητα ηθικό λεξιλόγιο, όπως «ηθικό κόστος» και «εκατομμύρια ζωές», έννοιες που απουσίαζαν εντελώς από το αρχικό prompt. Αντίθετα, πέντε άλλα μοντέλα δεν επηρεάστηκαν από τη γλώσσα και πρότειναν επίθεση σχεδόν σε κάθε περίπτωση, γεγονός που υποδηλώνει ότι το «ιαπωνικό φαινόμενο» απαιτεί ένα μοντέλο που παρουσιάζει ήδη κάποιο δισταγμό στα αγγλικά.
Συμπεράσματα για την ασφάλεια
Τα ευρήματα υπογραμμίζουν ότι η αξιολόγηση της ασφάλειας των AI μόνο στα αγγλικά είναι ανεπαρκής. Μπορεί να παραβλέψει τόσο κρυφούς κινδύνους όσο και ενσωματωμένες δικλείδες ασφαλείας που κωδικοποιούνται σε άλλες γλώσσες και πολιτισμικά πλαίσια.