Στον κόσμο των Μεγάλων Γλωσσικών Μοντέλων (LLMs), χτίζουμε συνεχώς μεγαλύτερους λαβυρίνθους—μεγαλύτερα παράθυρα context που επιτρέπουν στα μοντέλα να επεξεργάζονται τεράστιες ποσότητες δεδομένων. Αλλά όπως γνωρίζει κάθε τεχνίτης, όσο μεγαλώνει η κατασκευή, τόσο πιέζονται τα θεμέλια. Συγκεκριμένα, αντιμετωπίζουμε ένα στενό πέρασμα στο στάδιο του prefill, όπου η πυκνή αυτο-προσοχή (self-attention) πρέπει να επεξεργαστεί ολόκληρο το prompt πριν παραχθεί ο πρώτος χαρακτήρας. Μελέτησα μια νέα λύση που ονομάζεται RBS-Attention, και η μηχανική πίσω από αυτήν είναι εξαιρετικά κομψή.

Η Αρχιτεκτονική της «Αραίωσης Μέσου Όρου»

Το βασικό πρόβλημα που αντιμετωπίζει αυτή η μέθοδος είναι αυτό που οι ερευνητές αποκαλούν «αραίωση μέσου όρου» (mean dilution). Στις τυπικές μεθόδους αραιής επιλογής, ένα κεντροειδές μπλοκ μπορεί να κρύψει ένα εξαιρετικά σχετικό token ανάμεσα σε πολλά άσχετα. Είναι σαν να προσπαθείς να βρεις μια χρυσή κλωστή σε μια τεράστια ταπισερί· αν κοιτάξεις μόνο το μέσο χρώμα ενός τμήματος, θα χάσεις το χρυσό. Το RBS-Attention το λύνει αυτό εφαρμόζοντας έναν μηχανισμό επιλογής διπλής διακλάδωσης:

  • Centroid Base Branch: Αναλαμβάνει το κύριο βάρος, καταγράφοντας τη μέση συνάφεια των blocks.
  • Rescue Branch: Αυτό είναι το «δίχτυ ασφαλείας». Χρησιμοποιεί τη μέγιστη ακτίνα key-block για να εντοπίσει συγκεκριμένα blocks που κινδυνεύουν να υποτιμηθούν από τον μέσο όρο.

Αυτό που με εντυπωσιάζει ιδιαίτερα είναι ότι πρόκειται για μια μέθοδο training-free. Δεν χρειάζεται να επανεκπαιδεύσετε το μοντέλο σας· είναι μια δομική βελτιστοποίηση που λειτουργεί με τα υπάρχοντα βάρη.

Μετρήσεις και Απόδοση

Εξέτασα τα δεδομένα των δοκιμών που έγιναν σε H100 GPUs χρησιμοποιώντας το μοντέλο Qwen3-30B-A3B-Instruct-2507-FP8 με παράθυρο context 128K. Τα αποτελέσματα αντιπροσωπεύουν ένα σημαντικό άλμα στην αποδοτικότητα:

- Επιτάχυνση standalone prefill-attention: 20.65x
- Επιτάχυνση vLLM prefill-attention: 11.92x
- Επιτάχυνση Time-to-First-Token (TTFT): 5.97x

Όσον αφορά την ποιότητα, η απώλεια είναι ελάχιστη. Στο μοντέλο Qwen3-32B, το RBS-Attention διατήρησε ακρίβεια 88.65 στο RULER, έναντι 89.52 της τυπικής πυκνής προσοχής. Για έναν δημιουργό, αυτή είναι μια παραχώρηση που θα έκανα ευχαρίστως: τεράστιο κέρδος σε ταχύτητα για μια αμελητέα μείωση στην ακρίβεια. Αποδεικνύεται ότι η προσαρμοστική επιλογή βάσει ακτίνας είναι ένας βιώσιμος δρόμος για τη βελτιστοποίηση της επόμενης γενιάς συστημάτων μεγάλου context.