Οι πρόσφατες εξελίξεις στα μεγάλα γλωσσικά μοντέλα (LLMs) επιπέδου byte έχουν καταστήσει τη μοντελοποίηση χωρίς tokenizers (tokenizer-free) ιδιαίτερα ανταγωνιστική, ομαδοποιώντας τα bytes σε δυναμικά μεγέθη πακέτων (patches). Ωστόσο, οι υπάρχουσες αρχιτεκτονικές εφαρμόζουν την ίδια «πυκνή» (dense) υπολογιστική ισχύ σε κάθε πακέτο, ανεξάρτητα από τη σημασιολογική του πολυπλοκότητα ή την κοκκομετρία του.
Η Εισαγωγή του EntropyMoE
Το EntropyMoE έρχεται να διορθώσει αυτόν τον περιορισμό, εισάγοντας μια αρχιτεκτονική Mixture-of-Experts (MoE) σχεδιασμένη ειδικά για δυναμικά πακέτα bytes. Η προσέγγιση αυτή αντικαθιστά τις σταθερές μονάδες feed-forward στον καθολικό μετασχηματιστή πακέτων (global patch Transformer) με επίπεδα Top-K εμπειρογνωμόνων (experts).
Δρομολόγηση βάσει Εντροπίας
Η καινοτομία του EntropyMoE έγκειται στον τρόπο δρομολόγησης των δεδομένων. Ο δρομολογητής επιλέγει τους ειδικούς (experts) απευθείας με βάση την εντροπία του πακέτου, χρησιμοποιώντας το ίδιο σήμα που καθορίζει τη δημιουργία των δυναμικών πακέτων. Οι βασικές αρχές περιλαμβάνουν:
- Κάθε δυναμικό πακέτο λειτουργεί ως η βασική μονάδα δρομολόγησης εμπειρογνωμόνων.
- Η κάλυψη των bytes καθορίζει τη συμβολή κάθε πακέτου στον υπολογιστικό φόρτο.
- Η εντροπία και το μήκος του πακέτου ορίζουν το χώρο χαρακτηριστικών για την εξειδίκευση των εμπειρογνωμόνων.
Σύμφωνα με τα πειραματικά αποτελέσματα, το EntropyMoE επιτυγχάνει το χαμηλότερο ποσοστό bits-per-byte σε σύγκριση με τα υπάρχοντα πυκνά και σπαρταριστά (sparse) μοντέλα αναφοράς. Παράλληλα, διατηρεί συγκρίσιμη ακρίβεια σε downstream εφαρμογές, αποδεικνύοντας ότι η εντροπία πακέτων αποτελεί έναν αποτελεσματικό συντονιστή για τη σπαρταριστή υπό όρους υπολογιστική διαδικασία.