Η ανάδυση συστημάτων «AI Scientist», ικανών για αυτόνομη επιστημονική έρευνα, υπόσχεται την επιτάχυνση της ανακάλυψης, αλλά εγείρει ένα κρίσιμο ερώτημα: πώς αξιολογείται η ποιότητα των παραγόμενων εργασιών; Μια νέα μελέτη που δημοσιεύθηκε στο ArXiv (cs.AI) προτείνει ένα αυστηρό πρωτόκολλο αξιολόγησης χρησιμοποιώντας ένα αυτοματοποιημένο σύστημα ομότιμης κρίσης (peer-review) βασισμένο σε κορυφαία γλωσσικά μοντέλα (LLMs).
Το Πρωτόκολλο Αξιολόγησης
Οι ερευνητές αξιολόγησαν τέσσερα κορυφαία πλαίσια AI Scientist: το Sakana AI (εκδόσεις v1 και v2), το CycleResearcher και το Data-to-Paper. Η δοκιμή βασίστηκε σε 15 ερευνητικές προτάσεις της εμπορικής εταιρείας FARS, παράγοντας συνολικά 60 εργασίες οι οποίες συγκρίθηκαν με 15 πρότυπες εργασίες της FARS. Η αξιολόγηση έγινε σε τέσσερις άξονες:
- Πρωτοτυπία
- Επιστημονική αυστηρότητα
- Σαφήνεια
- Σημασία
Τα Αποτελέσματα και η «Απόκλιση» του GPT-5.4
Τα αποτελέσματα έδειξαν ότι οι εργασίες της FARS υπερτερούν σημαντικά των ανταγωνιστών, με βαθμολογίες 2,14–2,47 στην κλίμακα 1–5, έναντι 1,00–1,87 των άλλων συστημάτων. Ενδιαφέρον παρουσιάζει η συμπεριφορά των μοντέλων-αξιολογητών. Ενώ τα Gemini και Claude εμφάνισαν εξαιρετικά υψηλή συσχέτιση μεταξύ τους (ρ = 0,907), το GPT-5.4 παρουσίασε ασθενέστερη συμφωνία (ρ ≈ 0,32), υποδηλώνοντας ότι χρησιμοποιεί διαφορετικά κριτήρια αξιολόγησης. Παρά τις αποκλίσεις, η μελέτη καταλήγει ότι η πολυμοντελική αξιολόγηση μέσω LLM προσφέρει ένα κλιμακώσιμο και συνεπές πλαίσιο για την εκτίμηση της αυτόνομης έρευνας.