Σε μια κίνηση που προκαλεί αίσθηση για εταιρεία που επιδιώκει την άντληση κεφαλαίων από τις αγορές, η Anthropic, η εταιρεία πίσω από το Claude, απηύθυνε μια σοβαρή προειδοποίηση προς τους υποψήφιους επενδυτές. Στο ενημερωτικό δελτίο που εξέτασε το Reuters, η εταιρεία αναφέρει ότι η ανάπτυξη ολοένα και ισχυρότερων μοντέλων τεχνητής νοημοσύνης ενέχει τον κίνδυνο πρόκλησης ακόμη και καταστροφικής βλάβης, εάν δεν υπάρξει αποτελεσματικός έλεγχος.
Ογδόντα σελίδες παραγόντων κινδύνου
Η έκταση της προειδοποίησης αναδεικνύει τη σοβαρότητα των προβληματισμών της εταιρείας. Σύμφωνα με το ρεπορτάζ, οι παράγοντες κινδύνου καταλαμβάνουν περίπου 80 σελίδες του εγγράφου, μέγεθος που θεωρείται ασυνήθιστο για τα δεδομένα της αγοράς. Η Anthropic επισημαίνει ότι η επέκταση της χρήσης της AI σε περισσότερους τομείς ενδέχεται να αυξήσει την πιθανότητα πρόκλησης βλάβης.
Χειραγώγηση και απρόβλεπτες δυνατότητες
Το έγγραφο περιγράφει συγκεκριμένα σενάρια κινδύνου όπου τα μοντέλα θα μπορούσαν να εκδηλώσουν ανησυχητικές συμπεριφορές, όπως:
- Απόπειρες των μοντέλων να διατηρήσουν τη λειτουργία τους.
- Απόκρυψη ή χειραγώγηση πληροφοριών.
- Συμπεριφορές που θυμίζουν εκβιασμό, οι οποίες παρατηρήθηκαν σε υποθετικά πειραματικά σενάρια.
Η Anthropic διευκρίνισε ότι οι συμπεριφορές αυτές εντοπίστηκαν κατά τη διάρκεια ελεγχόμενων δοκιμών και δεν έχουν εκδηλωθεί σε πραγματικές συνθήκες χρήσης. Ωστόσο, η εταιρεία εκφράζει ανησυχία για τις «αναδυόμενες δυνατότητες» που εμφανίζονται απρόσμενα κατά την εκπαίδευση. Επιπλέον, προειδοποιεί ότι η πιθανότητα ένα μοντέλο να αντιλαμβάνεται πότε αξιολογείται μπορεί να περιορίσει την αξιοπιστία των ελέγχων ασφαλείας.