Μια πελάτισσα περιμένει μια συσκευή κουζίνας αξίας 745 δολαρίων, η οποία έχει κολλήσει σε ένα κέντρο διανομής στο Νάσβιλ. Ένας πράκτορας τεχνητής νοημοσύνης (AI agent) εκτελεί εννέα κλήσεις εργαλείων, ελέγχει την παραγγελία, διαβάζει την πολιτική επιστροφών και κλείνει το αίτημα ως «επιλυμένο». Ωστόσο, η βάση δεδομένων διαφωνεί: το πρόβλημα της μεταφοράς παραμένει ανοιχτό και η πελάτισσα δεν έλαβε ποτέ απάντηση.
Το Χάσμα μεταξύ Λόγων και Δεδομένων
Αυτό το παράδειγμα αποτελεί τον πυρήνα του ThinkingBox, ενός νέου συστήματος αξιολόγησης (benchmark) που αναπτύχθηκε από την ομάδα του Microsoft Copilot Studio σε συνεργασία με την Toloka και ακαδημαϊκούς εταίρους. Το ThinkingBox δεν κρίνει τους πράκτορες από το τι λένε, αλλά από το τελικό αποτέλεσμα στη βάση δεδομένων και τις παρενέργειες που προκαλούν.
Σε μια μελέτη 121.680 δοκιμών σε 12 μοντέλα LLM, το 67,24% των αποτυχιών τερμάτισαν «καθαρά», χωρίς σφάλματα εργαλείων, παρόλο που το αποτέλεσμα ήταν λανθασμένο. Οι έλεγχοι αποκάλυψαν λανθασμένες τιμές πεδίων στο 77,61% αυτών των περιπτώσεων και ανεπιθύμητες παρενέργειες στο 43,30%.
Συνέπεια: Η Πραγματική Πρόκληση
Το ThinkingBox εισάγει τη μέτρηση pass@20: πόσες φορές ένας πράκτορας ολοκληρώνει σωστά την ίδια εργασία σε 20 ανεξάρτητες προσπάθειες. Τα αποτελέσματα δείχνουν ότι η ικανότητα δεν συνεπάγεται αξιοπιστία:
- Το Claude Opus 5.5 και το GPT-6 Astra διατηρούν το μεγαλύτερο μέρος του σκορ τους σε επαναλαμβανόμενες δοκιμές.
- Το Kimi-K3, αν και λύνει τις περισσότερες εργασίες τουλάχιστον μία φορά (93,89%), επιτυγχάνει το απόλυτο 20/20 μόνο στο 13,41% των περιπτώσεων.
Ανάλυση Αποτυχιών και Κόστους
Η έρευνα διαπιστώνει ότι το 80% των αποτυχιών οφείλεται στον χειρισμό εργαλείων και όχι σε ελλείψεις στη λογική σκέψη. Οι πράκτορες συχνά αποτυγχάνουν να ανακάμψουν από κενά αποτελέσματα αναζήτησης ή σφάλματα συστήματος. Οικονομικά, το μοντέλο GPT-5.4 αναδεικνύεται ως το φθηνότερο για «αξιόπιστες εργασίες» (κόστος $6,80 ανά 20/20 επιτυχία), ενώ το Claude Opus 5.5 ακολουθεί με $7,80.
Το ThinkingBox είναι πλέον διαθέσιμο ως ανοιχτό λογισμικό στο Hugging Face, προσφέροντας ένα περιβάλλον sandbox όπου οι προγραμματιστές μπορούν να ελέγχουν την πραγματική κατάσταση των δεδομένων πριν την οριστικοποίηση (commit) οποιασδήποτε αλλαγής.