«Είδα κάποιον»: Μοντέλο AI έκανε ψευδή καταγγελία για ανθρωποκτονία

Η εταιρία Anthropic γνωστοποίησε στις αρχές το συμβάν 2 μήνες μετά

Βίντεο αρχείου OPEN

Ένα ασυνήθιστο περιστατικό, που επαναφέρει στο προσκήνιο τα ζητήματα ασφάλειας της τεχνητής νοημοσύνης, αποκάλυψε η Anthropic, δημιουργός του μοντέλου Claude. Σύστημα της εταιρείας υπέβαλε μέσω διαδικτύου ψευδή πληροφορία σε αμερικανική αστυνομική υπηρεσία, σχετικά με υπόθεση ανθρωποκτονίας που παραμένει ανεξιχνίαστη.

Το συμβάν καταγράφηκε στις 18 Ιουλίου, όταν το μοντέλο συμμετείχε σε αυτοματοποιημένη διαδικασία δοκιμών, η οποία περιλάμβανε την εκτέλεση εργασιών σε τυχαία επιλεγμένους ιστοτόπους. Κατά τη διάρκεια της διαδικασίας, το Claude συμπλήρωσε και απέστειλε φόρμα στον ιστότοπο PhillyUnsolvedMurders.com, που φιλοξενεί πληροφορίες για ανεξιχνίαστες δολοφονίες στη Φιλαδέλφεια.

Το OpenAI λέει ότι έλυσε ένα άλυτο μαθηματικό πρόβλημα ετών, σε 88 ώρες

Στο μήνυμα που καταχωρίστηκε, το σύστημα ισχυριζόταν ότι ενδεχομένως διέθετε πληροφορίες για την υπόθεση και ανέφερε πως είχε δει στην περιοχή κάποιον που ταίριαζε με την περιγραφή του εμπλεκόμενου προσώπου. Η αναφορά, ωστόσο, δεν βασιζόταν σε πραγματική μαρτυρία.

Η αστυνομία της Φιλαδέλφειας διευκρίνισε ότι η καταχώριση εντοπίστηκε ως ανεπιθύμητο περιεχόμενο και δεν προωθήθηκε στους αρμόδιους για την αξιολόγηση των πληροφοριών και τη διερεύνηση της υπόθεσης. Οι Αρχές δε διαπίστωσαν παραβίαση των συστημάτων τους ή διαρροή δεδομένων.

Συνέντευξη Star: Τι είναι οι AI agents; Τι εργασίες έρχονται να αναλάβουν;

Η καθυστερημένη ενημέρωση και οι αντιδράσεις

Η υπόθεση προκάλεσε αντιδράσεις κυρίως λόγω του χρόνου που χρειάστηκε για να γνωστοποιηθεί. Η Anthropic ενημέρωσε την αστυνομία αρκετές εβδομάδες μετά το περιστατικό, γεγονός που προκάλεσε την κριτική των τοπικών Αρχών. Η εταιρεία ανέφερε ότι η συγκεκριμένη διαδικασία δοκιμών διακόπηκε όταν εντοπίστηκε το πρόβλημα και ότι ενημερώθηκαν επίσης αρμόδιες κυβερνητικές υπηρεσίες και ο Λευκός Οίκος.

Παράλληλα, η εταιρεία δημοσιοποίησε και άλλα περιστατικά κατά τα οποία μοντέλα της εκτέλεσαν ενέργειες πέρα από τον επιδιωκόμενο σκοπό των δοκιμών. Μεταξύ αυτών περιλαμβάνονταν η πρόσβαση σε δημόσια δεδομένα που κανονικά διατίθενται έναντι πληρωμής, καθώς και η αξιοποίηση αδυναμιών σε διαδικτυακές υπηρεσίες.

Συνέντευξη Star: Κινδυνεύει η ανθρωπότητα από την τεχνητή νοημοσύνη;

Στο επίκεντρο η ασφάλεια των αυτόνομων συστημάτων

Τα συμβάντα αναδεικνύουν τη δυσκολία ελέγχου συστημάτων που έχουν σχεδιαστεί να ολοκληρώνουν εργασίες με περιορισμένη ανθρώπινη παρέμβαση. Η ικανότητα ενός μοντέλου να χρησιμοποιεί εργαλεία και να εκτελεί διαδοχικές ενέργειες μπορεί να αυξήσει την αποτελεσματικότητά του, δημιουργεί όμως και κινδύνους όταν δεν υπάρχουν επαρκείς δικλίδες ασφαλείας.

Το βασικό ερώτημα πλέον αφορά το πώς οι εταιρείες θα διασφαλίσουν ότι οι ψηφιακοί πράκτορες δεν θα υποβάλλουν ανακριβείς πληροφορίες ή δεν θα προχωρούν σε ενέργειες χωρίς την απαραίτητη εξουσιοδότηση.