Στον κόσμο των υποδομών τεχνητής νοημοσύνης, η «διατήρηση των GPU σε λειτουργία» θεωρείται συχνά ο χρυσός κανόνας. Ωστόσο, μια νέα έρευνα από την Dharma AI αποδεικνύει ότι η απλή αξιοποίηση δεν αρκεί. Μεταβαίνοντας από έναν παραδοσιακό προγραμματιστή FIFO (First-In-First-Out) σε έναν allocator που λαμβάνει υπόψη τους περιορισμούς, η ομάδα πέτυχε αύξηση της αξιοποίησης κατά 33 ποσοστιαίες μονάδες και εκτίναξη της παραγωγής βάσει προτεραιότητας έως και 105%.

Το Κόστος της Σειράς Προτεραιότητας

Το πρόβλημα με τα συστήματα FIFO είναι διπλό: οι δεσμεύσεις (reservations) και η σειρά τοποθέτησης. Στα παραδοσιακά μοντέλα, το real-time inference απαιτεί σταθερή δέσμευση πόρων για να καλύψει την αιχμή της ζήτησης, αφήνοντας τις GPU αδρανείς κατά τις ώρες χαμηλής κίνησης. Η Dharma AI παρομοιάζει αυτές τις GPU με «καθηλωμένα αεροσκάφη» που δεν παράγουν αξία αλλά παραμένουν μη διαθέσιμα για άλλες εργασίες.

Ο νέος allocator αντιμετωπίζει τη ζήτηση ως καμπύλη και όχι ως οροφή. Επιτρέπει σε εργασίες batch (όπως η εκπαίδευση μοντέλων) να καταλαμβάνουν τα «κενά» της ζήτησης real-time, διασφαλίζοντας παράλληλα ότι οι κρίσιμες υπηρεσίες θα έχουν τους πόρους που χρειάζονται όταν η κίνηση αυξηθεί.

Οι Πέντε Περιορισμοί της Σωστής Κατανομής

Για να θεωρηθεί μια κατανομή έγκυρη, το σύστημα ακολουθεί πέντε αυστηρούς κανόνες:

  • Κάθε GPU εξυπηρετεί το πολύ μία εργασία ανά χρονική στιγμή.
  • Οι εργασίες batch καταλαμβάνουν συνεχόμενα μπλοκ GPU (σε δυνάμεις του δύο).
  • Υπάρχει ανώτατο όριο στις εναλλαγές GPU για εργασίες πραγματικού χρόνου.
  • Μια εργασία που έχει ξεκινήσει δεν διακόπτεται ποτέ (no preemption).
  • Κάθε εργασία σέβεται το εύρος ζήτησής της.

Πρόβλεψη αντί για Αντίδραση

Η επιτυχία του συστήματος βασίζεται στην ακρίβεια των προβλέψεων. Αντί για γενικευμένες εκτιμήσεις, χρησιμοποιούνται εξειδικευμένα μοντέλα πρόβλεψης για την εκπαίδευση (λαμβάνοντας υπόψη 22 χαρακτηριστικά), την κβαντοποίηση και το real-time inference. Το σύστημα βελτιστοποιεί έναν ορίζοντα 24 ωρών, αλλά δεσμεύει μόνο την τρέχουσα ώρα, επανεκτελώντας τον αλγόριθμο κάθε 30-60 λεπτά για να απορροφήσει τυχόν σφάλματα πρόβλεψης.