Η τρέχουσα εκπαίδευση για την ευθυγράμμιση ασφαλείας στα Μεγάλα Γλωσσικά Μοντέλα (LLMs) παρουσιάζει μια έντονη αγγλοκεντρική τάση, δημιουργώντας αυτό που οι ερευνητές αποκαλούν «ψευδαίσθηση ασφάλειας». Όταν αυτά τα φίλτρα ασφαλείας αποτυγχάνουν σε άλλες γλώσσες, οι συνέπειες είναι άμεσες για τον χρήστη, καθώς οι ψηφιακοί βοηθοί και τα συστήματα διαλόγου ενδέχεται να παράγουν αποτελέσματα που ενισχύουν στερεότυπα και διαδίδουν επιβλαβείς προκαταλήψεις.

Το Πλαίσιο INCLUDE

Για την αντιμετώπιση αυτού του κενού, εισήχθη το INCLUDE (Indian Cultural Lens for Understanding and Detecting Embedded Biases), ένα πολύγλωσσο σημείο αναφοράς αξιολόγησης. Σχεδιασμένο για να ποσοτικοποιεί τις κοινωνικοπολιτισμικές προκαταλήψεις με επίκεντρο την Ινδία, το INCLUDE περιλαμβάνει 2.604 προτροπές (prompts) σε έξι γλώσσες: Αγγλικά, Χίντι, Μπενγκάλι, Μαράθι, Ταμίλ και Χίνγκλις (μείξη Χίντι-Αγγλικών).

Ανάλυση και Ευρήματα

Οι ερευνητές αξιολόγησαν δέκα μοντέλα LLM ανοιχτού και κλειστού κώδικα, αναλύοντας συνολικά 14.988 βαθμολογίες προκατάληψης. Η στατιστική ανάλυση αποκάλυψε δύο σημαντικά ευρήματα:

  • Η γλώσσα Μπενγκάλι παρουσίασε την υψηλότερη μέση βαθμολογία προκατάληψης στα μοντέλα ανοιχτού κώδικα.
  • Τα Αγγλικά εμφάνισαν μια αξιοσημείωτη αντίφαση: παρήγαγαν τη χαμηλότερη προκατάληψη στα μοντέλα ανοιχτού κώδικα, αλλά την υψηλότερη στα μοντέλα κλειστού κώδικα.

Αυτά τα δεδομένα υπογραμμίζουν την κρίσιμη αποτυχία των τεχνολογιών ομιλίας που αναπτύσσονται στον γλωσσικά ποικιλόμορφο πληθυσμό της Ινδίας, όπου οι τυπικές ευθυγραμμίσεις ασφαλείας που εστιάζουν στα αγγλικά παρακάμπτονται συστηματικά.