Η οικογένεια μοντέλων Granite Speech εμπλουτίζεται με δύο νέες προσθήκες που υπόσχονται να φέρουν επανάσταση στην ταχύτητα απομαγνητοφώνησης. Τα μοντέλα Granite Speech 5.0 Turbo CTC, με μόλις 470 εκατομμύρια παραμέτρους, επιτυγχάνουν πρωτοφανείς επιδόσεις, φτάνοντας τα 12.600 RTFx σε GPU NVIDIA H200. Αυτό σημαίνει πρακτικά ότι μπορούν να μεταγράψουν πάνω από 3,5 ώρες ομιλίας σε ένα δευτερόλεπτο μέσω ομαδικής επεξεργασίας (batched inference).
Δύο Εκδόσεις, Διαφορετικές Άδειες
Η κυκλοφορία περιλαμβάνει δύο εκδόσεις που διαφοροποιούνται κυρίως ως προς τα δεδομένα εκπαίδευσης και το καθεστώς αδειοδότησης:
- granite-speech-5.0-470m-turboctc: Εκπαιδευμένο σε μικρότερο σύνολο δεδομένων, διατίθεται με άδεια Apache 2.0 για εμπορική χρήση.
- granite-speech-5.0-470m-turboctc-nc: Εκπαιδευμένο με πρόσθετα δεδομένα, διατίθεται με άδεια CC-BY-NC-SA-4.0 (μη εμπορική).
Σε ανεπίσημες μετρήσεις στο OpenASR Leaderboard, το μη εμπορικό μοντέλο σημείωσε ποσοστό σφάλματος λέξεων (WER) 4,85%, ενώ η έκδοση Apache 2.0 σημείωσε 5,00%, προσφέροντας και τα δύο υψηλή ακρίβεια παρά το μικρό τους μέγεθος.
Αρχιτεκτονική Εστιασμένη στην Ταχύτητα
Σε αντίθεση με προηγούμενα μοντέλα Granite που χρησιμοποιούσαν συνδυασμό ακουστικού κωδικοποιητή και γλωσσικού μοντέλου (LM), τα νέα μοντέλα είναι αποκλειστικά κωδικοποιητές (encoder-only). Αυτός ο σχεδιασμός επιτρέπει 20 φορές μεγαλύτερη ταχύτητα και μικρότερο αποτύπωμα μνήμης, καθιστώντας τα ιδανικά για συσκευές edge.
Η τεχνική τους βάση περιλαμβάνει 16 Conformer blocks και τρία στάδια υποδειγματοληψίας (subsampling), μειώνοντας τον ρυθμό παραγωγής διακριτικών (tokens) στα 12,5 ανά δευτερόλεπτο. Η εκπαίδευση βασίστηκε σε συνδυασμό φυσικών και συνθετικών δεδομένων, συμπεριλαμβανομένων 2.000 ωρών πολυφωνικού ήχου και εξειδικευμένων δεδομένων για αριθμούς, νομίσματα και διευθύνσεις.