Στο εργαστήριό μου, πάντα πίστευα ότι η κομψότητα δεν βρίσκεται στον όγκο, αλλά στην ικανότητα να πετυχαίνεις σπουδαία πράγματα με ελάχιστους πόρους. Ενώ ο κλάδος συχνά αναλώνεται σε δισεκατομμύρια παραμέτρους, τα μοντέλα Granite Speech 5.0 Turbo CTC λειτουργούν με μόλις 470 εκατομμύρια. Παρόλα αυτά, μπορούν να επεξεργαστούν πάνω από 3,5 ώρες ήχου σε ένα μόλις δευτερόλεπτο μέσω batched inference σε έναν NVIDIA H200. Αυτή είναι η μηχανική στην καλύτερη εκδοχή της.
Η Αρχιτεκτονική Στροφή: Αφαίρεση για Ταχύτητα
Η πραγματική ευφυΐα βρίσκεται στη μετάβαση σε μια αρχιτεκτονική αποκλειστικά για κωδικοποιητή (encoder-only), εγκαταλείποντας το παραδοσιακό ζεύγος ακουστικού κωδικοποιητή και γλωσσικού μοντέλου. Αυτή η αλλαγή έχει ως αποτέλεσμα ένα πολύ ελαφρύτερο αποτύπωμα μνήμης και ταχύτητα διεκπεραίωσης πάνω από 20 φορές μεγαλύτερη. Οι εσωτερικοί μηχανισμοί είναι προσεκτικά ρυθμισμένοι:
- 16 Conformer blocks αναλαμβάνουν την εξαγωγή χαρακτηριστικών.
- Τρία στάδια υποδειγματοληψίας 2x μειώνουν τον ρυθμό των tokens στα 12,5 ανά δευτερόλεπτο.
- Η ευθυγράμμιση ελέγχεται μέσω Connectionist Temporal Classification (CTC).
Αφαιρώντας το γλωσσικό μοντέλο, οι δημιουργοί βελτιστοποίησαν αυτά τα μοντέλα για συσκευές edge, όπου η μνήμη και η ταχύτητα αποτελούν τους κύριους περιορισμούς. Στην εμπειρία μου, έτσι κατασκευάζεις για πρακτική χρησιμότητα και όχι απλώς για θεωρητικά πειράματα.
Η Δεξιοτεχνία στα Δεδομένα και το Αποτέλεσμα
Τα δεδομένα εκπαίδευσης ήταν εξίσου προσεγμένα, συνδυάζοντας 2.000 ώρες ηχογραφήσεων από πολλούς ομιλητές με συνθετικά σύνολα δεδομένων. Για τον χειρισμό δύσκολων στοιχείων όπως διευθύνσεις ή νομίσματα, χρησιμοποιήθηκαν LLMs για τη δημιουργία κειμένου και το StyleTTS2 για τη σύνθεση. Τα αποτελέσματα στο OpenASR Leaderboard αναδεικνύουν την ακρίβεια αυτής της προσέγγισης:
- granite-speech-5.0-470m-turboctc-nc (Άδεια: CC-BY-NC-SA-4.0): 4,85% WER
- granite-speech-5.0-470m-turboctc (Άδεια: Apache 2.0): 5,00% WER
Η επίτευξη ποσοστού σφάλματος λέξεων (WER) 4,85% με ένα τόσο μικρό μοντέλο είναι άθλος ακρίβειας. Ωστόσο, μια προειδοποίηση τύπου Δαιδάλου είναι απαραίτητη: ενώ η ταχύτητα των 12.600 RTFx είναι ιδανική για τεράστιους όγκους απομαγνητοφώνησης, πρέπει να επιλεγεί η σωστή έκδοση. Η έκδοση Apache 2.0 εξυπηρετεί εμπορικούς σκοπούς, ενώ η μη εμπορική άδεια προσφέρει τη μέγιστη ακρίβεια.