Η πολυ-πρακτορική αντιπαράθεση (Multi-agent debate - MAD) έχει προβληθεί ως μια μέθοδος βελτίωσης της συλλογιστικής και της ακρίβειας των γλωσσικών μοντέλων. Ωστόσο, μια νέα μελέτη που δημοσιεύθηκε στο arXiv ανατρέπει τις καθιερωμένες αντιλήψεις, εξετάζοντας αν η «γνωσιακή ποικιλομορφία» μεταξύ των πρακτόρων είναι όντως ο παράγοντας που οδηγεί σε αυτά τα κέρδη.
Η Κατάρριψη της Υπόθεσης της Ποικιλομορφίας
Οι ερευνητές εξέτασαν 23 ανοιχτά μοντέλα από έντεκα διαφορετικές οικογένειες παρόχων, πραγματοποιώντας πάνω από 5.500 δοκιμές. Μετέβαλαν την ποικιλομορφία σε τρεις άξονες: περσόνες (personas), θερμοκρασία δειγματοληψίας και ταυτότητα μοντέλου. Τα αποτελέσματα ήταν σαφή: η υπόθεση της γνωσιακής ποικιλομορφίας απορρίφθηκε σε κάθε άξονα.
Αν και ο «διάλογος» μεταξύ πρακτόρων αποδίδει καλύτερα από την απλή εξαγωγή συμπεράσματος από ένα μόνο μοντέλο (κατά 3 έως 7 μονάδες), η μελέτη διαπίστωσε ότι όταν ο προϋπολογισμός είναι ισοσκελισμένος, η μέθοδος αυτή χάνει από την απλή δειγματοληψία πλειοψηφίας (self-consistency). Συγκεκριμένα, ο διάλογος απαιτεί 1,6 φορές περισσότερο πραγματικό χρόνο και 3,4 φορές μεγαλύτερο κόστος σε tokens.
Ο «Φόρος Περσόνας» και Τεχνικά Σφάλματα
Ένα ιδιαίτερα ενδιαφέρον εύρημα είναι ο λεγόμενος «φόρος περσόνας». Η χρήση προτροπών για συγκεκριμένες προσωπικότητες (persona prompting) στην πραγματικότητα μειώνει την ακρίβεια. Οι πλεονάζουσες περσόνες βλάπτουν περισσότερο την απόδοση, ενώ οι ομάδες με μέγιστη ποικιλομορφία απλώς ανακτούν μέρος της χαμένης ακρίβειας.
Επιπλέον, η έρευνα ανέδειξε ένα κρίσιμο μεθοδολογικό σφάλμα σε προηγούμενες μελέτες: τα κείμενα των διαλόγων συχνά υπερβαίνουν σιωπηλά τα παράθυρα πλαισίου (context windows) των συστημάτων. Η διόρθωση αυτού του σφάλματος και μόνο μετέφερε τη σύγκριση μεταξύ διαλόγου και απλής δειγματοληψίας από το -1,8 στην ισοπαλία.
Συμπεράσματα για το Μέλλον
Σχεδόν όλο το όφελος της αντιπαράθεσης προέρχεται από την πρώτη ανταλλαγή απαντήσεων. Οι ερευνητές καταλήγουν στο συμπέρασμα ότι τα κέρδη του MAD είναι στην πραγματικότητα ένα φαινόμενο «δειγματοληψίας συνόλου» (ensemble-sampling effect). Η μελέτη θέτει πλέον τον πήχη για μελλοντικούς μηχανισμούς διαλόγου, απαιτώντας να ξεπερνούν την απόδοση της απλής ψηφοφορίας πλειοψηφίας με τον ίδιο υπολογιστικό προϋπολογισμό.