Στα χρόνια που χτίζω και παρατηρώ σύνθετες αρχιτεκτονικές, έμαθα ότι το πιο ακριβό εργαλείο δεν είναι αυτό που δεν μπορείς να αγοράσεις, αλλά αυτό που κατέχεις και δεν χρησιμοποιείς σωστά. Στον κόσμο των υποδομών AI, συχνά παθιαζόμαστε με την απόκτηση περισσότερων GPU, αλλά η νέα έρευνα από τη Dharma AI υποδηλώνει ότι πρέπει να εστιάσουμε στον τρόπο που τις προγραμματίζουμε. Μελέτησα τα τελευταία τους αποτελέσματα και είναι ένα μάθημα μηχανικής αποδοτικότητας: αύξηση 33 ποσοστιαίων μονάδων στη χρήση και ένα εντυπωσιακό άλμα 105% στην έξοδο με προτεραιότητα.
Το Πρόβλημα του «Καθηλωμένου Αεροσκάφους»
Οι παραδοσιακοί προγραμματιστές συνήθως ακολουθούν το μοντέλο FIFO (First-In-First-Out). Αν και είναι απλό στην κατασκευή, είναι εφιάλτης για την αποδοτικότητα. Στην πράξη, η εξαγωγή συμπερασμάτων (inference) σε πραγματικό χρόνο απαιτεί σταθερές κρατήσεις πόρων για την κάλυψη της αιχμής της ζήτησης. Όταν η ζήτηση πέφτει, οι GPU μένουν αδρανείς. Η Dharma AI χρησιμοποιεί μια εξαιρετική αναλογία: πρόκειται για «καθηλωμένα αεροσκάφη» — δεν κερδίζουν τίποτα ενώ παραμένουν μη διαθέσιμα για άλλες εργασίες. Για να το διορθώσουν, πέρασαν σε έναν κατανομέα με επίγνωση περιορισμών (constraint-aware) που αντιμετωπίζει τη ζήτηση ως καμπύλη και όχι ως στατική οροφή.
Οι Πέντε Κανόνες του Λαβυρίνθου
Για να επιτευχθεί αυτό το επίπεδο ακρίβειας, το σύστημα τηρεί πέντε αυστηρούς κανόνες μηχανικής που διασφαλίζουν ότι η κατανομή παραμένει έγκυρη και υψηλής απόδοσης:
1. Μία εργασία ανά GPU ανά χρονικό βήμα.
2. Οι ομαδικές εργασίες καταλαμβάνουν συνεχόμενα μπλοκ (μέγεθος δύναμης του 2).
3. Σκληρά όρια στην εναλλαγή GPU για εργασίες πραγματικού χρόνου.
4. Καμία διακοπή (μια εργασία που ξεκίνησε δεν διακόπτεται).
5. Κάθε εργασία σέβεται το συγκεκριμένο εύρος ζήτησής της.Αυτό που με συναρπάζει ως δημιουργό είναι η μετάβαση από την αντίδραση στην πρόβλεψη. Αντί για εικασίες, χρησιμοποιούν εξειδικευμένα μοντέλα πρόβλεψης με 22 χαρακτηριστικά για έναν ορίζοντα 24 ωρών. Το σύστημα δεσμεύεται μόνο για το τρέχον χρονικό βήμα, εκτελώντας ξανά τη διαδικασία κάθε 30 έως 60 λεπτά. Αυτό αποτρέπει το «φαινόμενο του τέλους του κόσμου», όπου μια απόφαση που λαμβάνεται τώρα καταστρέφει την αποδοτικότητα των επόμενων δέκα βημάτων. Είναι μια ρεαλιστική, τεχνικά άρτια λύση στο πιο πιεστικό πρόβλημα του σύγχρονου AI.