Μια διεθνής συνεργασία παρουσίασε το BioEVAL (BioEngineering Validation of AI and LLMs), ένα νέο πλαίσιο που σχεδιάστηκε για τον έλεγχο των Μεγάλων Γλωσσικών Μοντέλων (LLMs) στον τομέα της βιολογικής μηχανικής. Σε αντίθεση με προηγούμενα σημεία αναφοράς που επικεντρώνονται κυρίως στην απομνημόνευση γεγονότων, η πρωτοβουλία αυτή εστιάζει στην πειραματική συλλογιστική σε 11 διαφορετικά υποπεδία.
Ανάπτυξη και Σύνθεση
Στο έργο συμμετείχαν 22 ερευνητικά ιδρύματα για τη δημιουργία ενός συνόλου αξιολόγησης επιπέδου διδακτορικού, το οποίο αποτελείται από 608 στοιχεία. Το σημείο αναφοράς περιλαμβάνει:
- 359 ερωτήσεις πολλαπλής επιλογής, οι οποίες οριστικοποιήθηκαν μετά από μια αυστηρή διαδικασία ελέγχου.
- 218 εργασίες που επικεντρώνονται στη σύνθεση βιβλιογραφίας.
- 10 πολυτροπικές προκλήσεις που αφορούν την ερμηνεία πειραματικών εικόνων.
Για τη διασφάλιση υψηλών προτύπων, η ομάδα διεξήγαγε κεντρικό έλεγχο ποιότητας και μια τυφλή αξιολόγηση, η οποία οδήγησε στην εξαίρεση 21 στοιχείων από τον τελικό αριθμό των ερωτήσεων πολλαπλής επιλογής.
Βασικά Ευρήματα
Οι δοκιμές περιέλαβαν διάφορα μοντέλα, συμπεριλαμβανομένων συστημάτων που βασίζονται στο cloud, όπως τα ChatGPT, Gemini και Grok, καθώς και μοντέλων που μπορούν να εκτελεστούν σε τοπικό υλικό. Η υψηλότερη καταγεγραμμένη ακρίβεια έφτασε το 90% για τις ερωτήσεις πολλαπλής επιλογής και το 80% για το υποσύνολο της πολυτροπικής συλλογιστικής. Ωστόσο, οι ερευνητές σημείωσαν ότι η απόδοση διέφερε σημαντικά ανάλογα με το συγκεκριμένο υποπεδίο της βιολογικής μηχανικής.
Το BioEVAL έχει δομηθεί ως ένας εξελισσόμενος πόρος, χρησιμοποιώντας τυποποιημένα πρωτόκολλα για την ενσωμάτωση μελλοντικών συνεισφορών από ειδικούς και αξιολογήσεων μοντέλων.