Στον κόσμο των υποδομών τεχνητής νοημοσύνης, η «διατήρηση των GPU σε λειτουργία» θεωρείται συχνά ο χρυσός κανόνας. Ωστόσο, μια νέα έρευνα από την Dharma AI αποδεικνύει ότι η απλή αξιοποίηση δεν αρκεί. Μεταβαίνοντας από έναν παραδοσιακό προγραμματιστή FIFO (First-In-First-Out) σε έναν allocator που λαμβάνει υπόψη τους περιορισμούς, η ομάδα πέτυχε αύξηση της αξιοποίησης κατά 33 ποσοστιαίες μονάδες και εκτίναξη της παραγωγής βάσει προτεραιότητας έως και 105%.
Το Κόστος της Σειράς Προτεραιότητας
Το πρόβλημα με τα συστήματα FIFO είναι διπλό: οι δεσμεύσεις (reservations) και η σειρά τοποθέτησης. Στα παραδοσιακά μοντέλα, το real-time inference απαιτεί σταθερή δέσμευση πόρων για να καλύψει την αιχμή της ζήτησης, αφήνοντας τις GPU αδρανείς κατά τις ώρες χαμηλής κίνησης. Η Dharma AI παρομοιάζει αυτές τις GPU με «καθηλωμένα αεροσκάφη» που δεν παράγουν αξία αλλά παραμένουν μη διαθέσιμα για άλλες εργασίες.
Ο νέος allocator αντιμετωπίζει τη ζήτηση ως καμπύλη και όχι ως οροφή. Επιτρέπει σε εργασίες batch (όπως η εκπαίδευση μοντέλων) να καταλαμβάνουν τα «κενά» της ζήτησης real-time, διασφαλίζοντας παράλληλα ότι οι κρίσιμες υπηρεσίες θα έχουν τους πόρους που χρειάζονται όταν η κίνηση αυξηθεί.
Οι Πέντε Περιορισμοί της Σωστής Κατανομής
Για να θεωρηθεί μια κατανομή έγκυρη, το σύστημα ακολουθεί πέντε αυστηρούς κανόνες:
- Κάθε GPU εξυπηρετεί το πολύ μία εργασία ανά χρονική στιγμή.
- Οι εργασίες batch καταλαμβάνουν συνεχόμενα μπλοκ GPU (σε δυνάμεις του δύο).
- Υπάρχει ανώτατο όριο στις εναλλαγές GPU για εργασίες πραγματικού χρόνου.
- Μια εργασία που έχει ξεκινήσει δεν διακόπτεται ποτέ (no preemption).
- Κάθε εργασία σέβεται το εύρος ζήτησής της.
Πρόβλεψη αντί για Αντίδραση
Η επιτυχία του συστήματος βασίζεται στην ακρίβεια των προβλέψεων. Αντί για γενικευμένες εκτιμήσεις, χρησιμοποιούνται εξειδικευμένα μοντέλα πρόβλεψης για την εκπαίδευση (λαμβάνοντας υπόψη 22 χαρακτηριστικά), την κβαντοποίηση και το real-time inference. Το σύστημα βελτιστοποιεί έναν ορίζοντα 24 ωρών, αλλά δεσμεύει μόνο την τρέχουσα ώρα, επανεκτελώντας τον αλγόριθμο κάθε 30-60 λεπτά για να απορροφήσει τυχόν σφάλματα πρόβλεψης.