Μια νέα μελέτη που δημοσιεύθηκε στο ArXiv (cs.AI) διερευνά τον τρόπο με τον οποίο η σύνθεση των δεδομένων εκπαίδευσης επηρεάζει τις ικανότητες των ιατρικών μεγάλων γλωσσικών μοντέλων (LLMs). Οι ερευνητές πραγματοποίησαν πειράματα με αντιστοίχιση διακριτικών (tokens), μεταβάλλοντας την αναλογία μεταξύ διδακτικών δεδομένων (όπως ιατρικά εγχειρίδια) και κλινικών δεδομένων (όπως αρχεία ασθενών).
Η Ασυμμετρία στη Μεταφορά Γνώσης
Η έρευνα αποκάλυψε μια σημαντική ασυμμετρία στον τρόπο με τον οποίο τα διαφορετικά είδη δεδομένων επηρεάζουν την απόδοση του μοντέλου. Ενώ τα διδακτικά δεδομένα βελτιώνουν κυρίως εργασίες που απαιτούν έντονη θεωρητική γνώση, τα κλινικά δεδομένα αποδείχθηκαν πιο ευέλικτα. Συγκεκριμένα, τα κλινικά δεδομένα βελτιώνουν τις κλινικά προσανατολισμένες εργασίες, ενώ παραμένουν ανταγωνιστικά και σε εργασίες που απαιτούν καθαρή γνώση.
Το Χάσμα «Γνώσης-Πράξης»
Ένα από τα πιο ενδιαφέροντα ευρήματα της ανάλυσης σφαλμάτων είναι το λεγόμενο «χάσμα γνώσης-πράξης» (knowing-doing gap). Οι ερευνητές παρατήρησαν ότι η βελτίωση στην ανάκληση γνώσης δεν μεταφράζεται απαραίτητα σε καλύτερη κλινική συλλογιστική. Αυτό υποδηλώνει ότι η κατοχή ιατρικών πληροφοριών δεν εγγυάται την ικανότητα εφαρμογής τους σε πραγματικά κλινικά σενάρια.
Στρατηγικές Επιμέλειας Δεδομένων
Σύμφωνα με τη μελέτη, η επιμέλεια δεδομένων για τα ιατρικά LLM θα πρέπει να καθοδηγείται από την εκάστοτε εφαρμογή:
- Μικρές ποσότητες κλινικών δεδομένων αρκούν για σημαντικά κέρδη σε εργασίες που βασίζονται σε ηλεκτρονικά αρχεία υγείας (EHR).
- Υψηλότερες αναλογίες κλινικών δεδομένων προτιμώνται για περιπτώσεις χρήσης που απαιτούν έντονη συλλογιστική.
- Η βέλτιστη αναλογία μείγματος ποικίλλει ανάλογα με τις απαιτήσεις της τελικής εργασίας.