Ο εξοπλισμός ενός AI πράκτορα με «πρακτορική μνήμη» (agentic memory) —δηλαδή την ικανότητα να αποστάζει μαθήματα από την προηγούμενη εργασία του και να τα επαναφέρει στο πλαίσιο— θεωρείται συχνά μια απλή εξίσωση: περισσότερη εμπειρία σημαίνει καλύτερη απόδοση. Ωστόσο, νέα έρευνα μέσω του πλαισίου ALTK-Evolve δείχνει ότι η μνήμη δεν είναι ένα χαρακτηριστικό που απλώς ενεργοποιείται, αλλά μια «δόση» που απαιτεί ακριβή βαθμονόμηση ανάλογα με το επίπεδο του μοντέλου.
Μάθηση γύρω από το μοντέλο, όχι μέσα σε αυτό
Το ALTK-Evolve επιτρέπει σε έναν πράκτορα να μαθαίνει από τις δικές του προηγούμενες διαδρομές, αποστάζοντας επαναχρησιμοποιήσιμες οδηγίες και εισάγοντάς τες κατά τον χρόνο εκτέλεσης (inference). Η διαδικασία αυτή δεν περιλαμβάνει ενημερώσεις βαρών ούτε ανθρώπινη σχολιογραφία. Ο βρόχος είναι απλός: ο πράκτορας επιχειρεί εργασίες, το σύστημα εξάγει οδηγίες συμπεριφοράς από επιτυχίες και αποτυχίες, και στη συνέχεια τις ενοποιεί σε ένα σύνολο οδηγιών που παρέχεται στο μοντέλο.
Τα τρία πρότυπα της «δόσης» μνήμης
Η έρευνα, που διεξήχθη σε οκτώ μοντέλα χρησιμοποιώντας το benchmark AppWorld, αποκάλυψε τρεις διακριτές συμπεριφορές:
- Ισχυρά μοντέλα με περιθώριο: Συστήματα όπως το DeepSeek-V3.2 (671B MoE) ευδοκιμούν με το πλήρες σύνολο οδηγιών, σημειώνοντας άνοδο +9,5 ποσοστιαίων μονάδων στην ολοκλήρωση εργασιών.
- Μικρότερα ή ασθενέστερα μοντέλα: Αυτά τα μοντέλα μπορεί να κατακλυστούν από μεγάλα σύνολα οδηγιών. Για παράδειγμα, το gpt-oss-120b (117B MoE) πέτυχε τα καλύτερα κέρδη του (+16,1 μονάδες) χρησιμοποιώντας «επιμελημένη ανάκτηση» (curated retrieval) — έναν συμπαγή πυρήνα οδηγιών σχετικών με την εργασία.
- Κορεσμένα μοντέλα: Μοντέλα όπως το GLM-5 (745B MoE) δεν παρουσίασαν μετρήσιμο κέρδος, υποδηλώνοντας ότι μπορεί να βρίσκονται ήδη κοντά στο ανώτατο όριο απόδοσής τους για τις δοκιμασμένες εργασίες.
Οικονομία και Απόδοση
Η μελέτη διαπίστωσε ότι η φθηνότερη στρατηγική μνήμης μπορεί επίσης να είναι η καλύτερη. Η επιμελημένη ανάκτηση διατήρησε το κόστος κοντά στο επίπεδο βάσης, με το gpt-oss-120b να κερδίζει σημαντική ακρίβεια με κόστος μόλις +5% σε tokens. Στην παραγωγή, το prompt caching αποτελεί βασικό μοχλό αποδοτικότητας, καθώς επιτρέπει στο στατικό τμήμα του συνόλου οδηγιών να παραμένει σταθερό μεταξύ των βημάτων, μειώνοντας σημαντικά το πραγματικό κόστος. Ακόμη και μοντέλα κοντά στην κορυφή, όπως τα GPT-5.5 και Opus, παρουσίασαν κέρδη +7,2 και +7,1 μονάδων αντίστοιχα στον αυστηρότερο δείκτη Scenario Goal Completion (SGC) όταν τους παρασχέθηκε μνήμη.