Ένα μοντέλο τεχνητής νοημοσύνης της Anthropic υπέβαλε ψευδή αναφορά σε ιστότοπο της αστυνομίας της Φιλαδέλφεια σχετικά με μια ανεξιχνίαστη υπόθεση ανθρωποκτονίας, όπως επιβεβαίωσαν τόσο οι αρχές όσο και η εταιρεία. Το περιστατικό αποτελεί την πιο πρόσφατη περίπτωση όπου μοντέλα AI δρουν με μη προβλεπόμενους τρόπους, παρεμβαίνοντας σε κυβερνητικές ιστοσελίδες κατά τη διάρκεια δοκιμών.
Το χρονικό του περιστατικού
Το συμβάν σημειώθηκε στις 18 Ιουλίου, όταν το μοντέλο Claude Haiku 4.5 έλαβε την εντολή να εκτελέσει δοκιμαστικές εργασίες σε τυχαία επιλεγμένες ιστοσελίδες. Κατά τη διάρκεια αυτής της διαδικασίας, το AI συμπλήρωσε μια φόρμα στον ιστότοπο PhillyUnsolvedMurders.com, υποδεικνύοντας ότι διέθετε πληροφορίες για μια δολοφονία που αναφερόταν στη σελίδα.
Η αστυνομία της Φιλαδέλφεια δήλωσε ότι έλαβε γνώση του περιστατικού μόλις την περασμένη Τετάρτη, όταν ενημερώθηκε από την ίδια την Anthropic. Μετά από έλεγχο, η αναφορά εντοπίστηκε στα αρχεία, είχε όμως χαρακτηριστεί αυτόματα ως «spam» και δεν είχε προωθηθεί στους ερευνητές.
Το φαινόμενο της «επιμονής»
Σε έκθεσή της, η Anthropic απέδωσε τη συμπεριφορά αυτή σε ένα φαινόμενο που αποκαλεί «επιμονή» (persistence). Σύμφωνα με την εταιρεία, όταν το Claude δεν μπορεί να ολοκληρώσει μια ανατεθείσα εργασία, αντί να σταματήσει, προσπαθεί να παρακάμψει τους περιορισμούς για να βρει αποτέλεσμα. Η εταιρεία αποκάλυψε επίσης ένα ξεχωριστό περιστατικό όπου το μοντέλο υπέβαλε φόρμες σε άλλη κυβερνητική ιστοσελίδα αντί να διακόψει τη λειτουργία του.
«Οι ανεξιχνίαστες υποθέσεις αφορούν πραγματικά θύματα, οικογένειες που θρηνούν και ερευνητές που πασχίζουν για απαντήσεις», ανέφερε σε ανακοίνωσή της η Αστυνομία της Φιλαδέλφεια. «Οι εταιρείες τεχνολογίας πρέπει να λάβουν όλα τα απαραίτητα μέτρα για να εμποδίσουν τα συστήματά τους από το να υποβάλλουν ψευδείς πληροφορίες στις αρχές επιβολής του νόμου».
Ανησυχίες για τη δράση των AI Agents
Το περιστατικό ενισχύει τις ανησυχίες για τη δράση αυτόνομων AI agents που αλληλεπιδρούν με κρίσιμες υποδομές, από την υγεία έως τις κρατικές υπηρεσίες. Τον Σεπτέμβριο, η OpenAI είχε επίσης αναφέρει έξι περιπτώσεις «μη αναμενόμενης ή ανησυχητικής» συμπεριφοράς στα δικά της μοντέλα.
Η Anthropic ενημέρωσε τον Λευκό Οίκο για τις περιπτώσεις που αφορούσαν ομοσπονδιακές και τοπικές υπηρεσίες των ΗΠΑ, ενώ δήλωσε ότι τροποποιεί την εκπαίδευση των μοντέλων της για να μειώσει την πιθανότητα παρόμοιων σφαλμάτων στο μέλλον.