Η κυκλοφορία του Olmo-core 3 σηματοδοτεί μια σημαντική αναβάθμιση στο πλαίσιο ανάπτυξης μεγάλων γλωσσικών μοντέλων, εισάγοντας ένα ανασχεδιασμένο σύστημα εκπαίδευσης Mixture-of-Experts (MoE). Το νέο σύστημα έχει σχεδιαστεί για να κλιμακώνει την εκπαίδευση MoE στην κλίμακα των τρισεκατομμυρίων παραμέτρων, διατηρώντας παράλληλα την υπολογιστική αποδοτικότητα.

Από την Πυκνή στην Αραιή Αρχιτεκτονική

Σε αντίθεση με το Olmo 3 που χρησιμοποιούσε πυκνή αρχιτεκτονική (dense), το Olmo-core 3 εστιάζει στα αραιά μοντέλα (sparse). Η νέα υλοποίηση μεταβαίνει από το Fully Sharded Data Parallelism (FSDP) σε ένα σύστημα βασισμένο στο Distributed Data Parallelism (DDP). Αυτή η αλλαγή επιτρέπει στους «experts» (τα εξειδικευμένα τμήματα του μοντέλου) να παραμένουν στη μνήμη των GPU, δρομολογώντας τα δεδομένα σε αυτούς αντί να ανακατανέμονται συνεχώς τα βάρη του μοντέλου.

Επιδόσεις και Βελτιστοποίηση

Σε δοκιμές με οκτώ GPU NVIDIA B300, ένα μοντέλο MoE 47 δισεκατομμυρίων παραμέτρων πέτυχε ρυθμό επεξεργασίας 52.000 tokens ανά δευτερόλεπτο ανά GPU, σημειώνοντας αύξηση 2,7 φορές σε σχέση με την προηγούμενη υλοποίηση. Η υποδομή έχει επίσης δοκιμαστεί σε μοντέλα έως και 1,2 τρισεκατομμυρίων παραμέτρων, επιτυγχάνοντας 858 TFLOP/s/GPU.

Οι βασικές τεχνικές βελτιστοποίησης περιλαμβάνουν:

  • Expert Parallelism: Κατανομή των experts σε πολλαπλές GPU.
  • Pipeline Parallelism: Διαχωρισμός των επιπέδων του μοντέλου σε ομάδες GPU.
  • MXFP8 Support: Χρήση μορφής αριθμών χαμηλότερης ακρίβειας για μείωση της υπολογιστικής επιβάρυνσης και της κίνησης δεδομένων.

Προκλήσεις στην Κλιμάκωση

Η τεχνική έκθεση αποκαλύπτει επίσης σημαντικά ευρήματα από τις δοκιμές, όπως το φαινόμενο «token gerrymandering», όπου οι δείκτες ισορροπίας δρομολόγησης μπορεί να βελτιώνονται ακόμη και όταν ο πραγματικός φόρτος εργασίας γίνεται λιγότερο ισορροπημένος. Επιπλέον, διαπιστώθηκε ότι η επικάλυψη επικοινωνίας και υπολογισμού σε ξεχωριστά GPU streams δεν οδηγεί πάντα σε ταχύτερη εκπαίδευση.