Στο εργαστήριό μου, πάντα πίστευα ότι η πιο κομψή λύση δεν είναι η μεγαλύτερη, αλλά εκείνη που επιτυγχάνει τα περισσότερα με τα λιγότερα. Η κυκλοφορία των μοντέλων Granite Speech 5.0 Turbo CTC αποτελεί απόδειξη αυτής της φιλοσοφίας. Ενώ η βιομηχανία συχνά κυνηγά δισεκατομμύρια παραμέτρους, αυτά τα μοντέλα περιορίζονται στα 470 εκατομμύρια, και όμως καταφέρνουν να απομαγνητοφωνήσουν πάνω από 3,5 ώρες ομιλίας σε ένα δευτερόλεπτο χρησιμοποιώντας batched inference σε μια NVIDIA H200.

Η Μετάβαση σε Αρχιτεκτονική Encoder-Only

Αυτό που με συναρπάζει ως κατασκευαστή είναι η αρχιτεκτονική στροφή. Σε αντίθεση με τους προκατόχους τους που συνδύαζαν έναν ακουστικό κωδικοποιητή με ένα γλωσσικό μοντέλο (LM), αυτές οι νέες εκδόσεις είναι αποκλειστικά encoder-only. Αυτή η σχεδιαστική επιλογή παρέχει πάνω από 20 φορές ταχύτερη απόδοση και σημαντικά μικρότερο αποτύπωμα μνήμης. Στο εσωτερικό του, το σύστημα χρησιμοποιεί μια εξελιγμένη δομή:

  • 16 Conformer blocks για την εξαγωγή χαρακτηριστικών.
  • Τρία στάδια υποδειγματοληψίας (2x subsampling) για τη μείωση του token rate στα 12,5 tokens ανά δευτερόλεπτο.
  • Connectionist Temporal Classification (CTC) για την ευθυγράμμιση.

Αφαιρώντας το στοιχείο του γλωσσικού μοντέλου, οι μηχανικοί βελτιστοποίησαν αυτά τα μοντέλα για συσκευές edge, όπου η μνήμη και η ταχύτητα είναι οι απόλυτοι περιορισμοί. Κατά την εμπειρία μου, έτσι χτίζεις για τον πραγματικό κόσμο.

Εκπαίδευση και Μετρήσεις Ακριβείας

Η δεξιοτεχνία επεκτείνεται και στα δεδομένα. Η διαδικασία εκπαίδευσης χρησιμοποίησε ένα μείγμα 2.000 ωρών δεδομένων από πολλούς ομιλητές και εξειδικευμένα συνθετικά σύνολα. Για τον χειρισμό σύνθετων οντοτήτων όπως νομίσματα και διευθύνσεις, η ομάδα χρησιμοποίησε LLMs για τη δημιουργία κειμένου και το StyleTTS2 για τη σύνθεση. Τα αποτελέσματα στο OpenASR Leaderboard είναι ενδεικτικά:

Παραλλαγή Μοντέλου | Άδεια Χρήσης | WER (Word Error Rate)
granite-speech-5.0-470m-turboctc-nc | CC-BY-NC-SA-4.0 | 4,85%
granite-speech-5.0-470m-turboctc | Apache 2.0 | 5,00%

Η επίτευξη 4,85% WER με τόσο συμπαγές μέγεθος είναι αξιοσημείωτη. Ωστόσο, οφείλω να δώσω μια προειδοποίηση τύπου Δαίδαλου: ενώ η ταχύτητα των 12.600 RTFx είναι απίστευτη για μαζικές απομαγνητοφωνήσεις, οι δημιουργοί θα πρέπει να επιλέξουν την παραλλαγή τους προσεκτικά βάσει της άδειας χρήσης—Apache 2.0 για εμπορικά εγχειρήματα ή τη μη εμπορική έκδοση για μέγιστη ακρίβεια.