Η ευθυγράμμιση των μεγάλων γλωσσικών μοντέλων (LLM) με τις ανθρώπινες αξίες αποτελεί κεντρικό στόχο της έρευνας στην Τεχνητή Νοημοσύνη, αλλά μια νέα μελέτη που δημοσιεύθηκε στο arXiv (cs.AI) υποδηλώνει ότι οι τρέχουσες μέθοδοι αξιολόγησης μπορεί να είναι παραπλανητικές. Η έρευνα με τίτλο «Agreement Is Not Alignment» υποστηρίζει ότι η συμφωνία στις τελικές «ετικέτες» ηθικής κρίσης δεν αποδεικνύει ότι τα μοντέλα και οι άνθρωποι βασίζονται στις ίδιες ηθικές βάσεις.

Η ψευδαίσθηση της ηθικής ταύτισης

Οι ερευνητές χρησιμοποίησαν ένα επιμελημένο σημείο αναφοράς (benchmark) 500 στοιχείων, βασισμένο στο σύνολο δεδομένων ETHICS, το οποίο καλύπτει πέντε τομείς ηθικής κρίσης. Η μελέτη συνέκρινε τις απαντήσεις ανθρώπινων αξιολογητών με εκείνες κορυφαίων (frontier) και ανοιχτών μοντέλων AI, εξετάζοντας όχι μόνο την τελική κρίση αλλά και το σκεπτικό (rationale) πίσω από αυτήν.

Παρόλο που τα μοντέλα παρουσίασαν υψηλά ποσοστά συμφωνίας με την πλειοψηφία των ανθρώπινων αξιολογητών στις τελικές απαντήσεις, η ανάλυση σε επίπεδο σκεπτικού αποκάλυψε μια συστηματική απόκλιση. Συγκεκριμένα, τα μοντέλα τείνουν να ανακατανέμουν την προσοχή τους ανάμεσα σε διαφορετικές ηθικές κατηγορίες, όπως:

  • Πρόκληση βλάβης (Harm)
  • Σεβασμός (Respect)
  • Τήρηση υποσχέσεων (Promise-keeping)
  • Δικαιοσύνη (Justice)
  • Αξία/Ενοχή (Desert)
  • Σχετικότητα δικαιολογιών (Excuse relevance)

Κίνδυνοι από την αξιολόγηση βάσει ετικετών

Σύμφωνα με τη μελέτη, η αξιολόγηση που βασίζεται αποκλειστικά στις τελικές απαντήσεις (labels) μπορεί να προσφέρει μια «παραπλανητική καθησύχαση». Δύο δρώντες μπορεί να καταλήξουν στην ίδια κρίση επικαλούμενοι διαφορετικές αρχές, διαφορετικές παραδοχές για το πλαίσιο ή διαφορετικές ερμηνείες μιας κατάστασης.

Τα αποτελέσματα υπογραμμίζουν την ανάγκη για βαθύτερη ανάλυση των λόγων, των αρχών και των ηθικών προτεραιοτήτων που εκφράζονται στις κρίσεις των μοντέλων, αντί για μια απλή μέτρηση της στατιστικής συμφωνίας με τις ανθρώπινες απαντήσεις.