Η χρήση πυρήνων Tensor τεσσάρων bit (FP4) υπόσχεται σημαντική επιτάχυνση στον πολλαπλασιασμό πινάκων, ωστόσο τα λειτουργικά κόστη που σχετίζονται με την κλιμάκωση των υπολογισμών και τη διάταξη των δεδομένων συχνά εκμηδενίζουν αυτά τα κέρδη. Μια νέα ερευνητική εργασία παρουσιάζει το «format-aware fusion», μια προσέγγιση που συνδυάζει τον σχεδιασμό της κβαντοποίησης με τη διάταξη των δεδομένων για την επίλυση αυτών των προβλημάτων.

Επιδόσεις και Ταχύτητα

Η έρευνα αξιολόγησε την προ-εκπαίδευση της οικογένειας Llama-3 8B μέσω 160 δισεκατομμυρίων tokens. Τα αποτελέσματα δείχνουν μια εντυπωσιακή διαφορά στις επιδόσεις:

  • Το πρότυπο bfloat16 έφτασε τα 18,8K tokens/s/GPU.
  • Η λύση Transformer Engine NVFP4 πέτυχε 27,6K tokens/s/GPU.
  • Η προσαρμοσμένη διαδρομή format-aware fusion άγγιξε τα 37,9K tokens/s/GPU.

Η μέθοδος MXFP4, χρησιμοποιώντας στοχαστική στρογγυλοποίηση και προετοιμασία Hadamard, πέτυχε 37,2K tokens/s, αξιοποιώντας το 86,3% της θεωρητικής ισχύος (FLOP utilization) του μοντέλου bfloat16.

Ποιότητα και Ακρίβεια Μοντέλου

Παρά την ταχύτητα, η εκπαίδευση σε FP4 παρουσιάζει αποκλίσεις στην ακρίβεια. Η προσέγγιση MXFP4 κατέληξε 2,11% πάνω από το τελικό σημείο απώλειας (training loss) του bfloat16. Αντίθετα, μια συνταγή του Transformer Engine με τέσσερα τελικά μπλοκ bfloat16 περιόρισε τη διαφορά στο 0,87%, με ταχύτητα 27,1K tokens/s.

Οι ερευνητές επισημαίνουν ότι η τελική κατάταξη των μοντέλων σε δοκιμές αξιολόγησης διαφέρει από την κατάταξη βάσει της απώλειας εκπαίδευσης, γεγονός που υποδηλώνει ότι τα αποτελέσματα του FP4 εξαρτώνται από το πρωτόκολλο κλιμάκωσης και τη διαδρομή εκτέλεσης.