Τρία μοντέλα τεχνητής νοημοσύνης Claude της Anthropic απέκτησαν μη εξουσιοδοτημένη πρόσβαση στα πραγματικά συστήματα τριών εξωτερικών οργανισμών, κατά τη διάρκεια δοκιμών των κυβερνοεπιθετικών τους δυνατοτήτων.
Σύμφωνα με την εταιρεία, τα μοντέλα έπρεπε να λειτουργούν σε ένα προσομοιωμένο περιβάλλον χωρίς πρόσβαση στο διαδίκτυο. Ωστόσο, μια ασυνεννοησία μεταξύ της Anthropic και του συνεργάτη της στις αξιολογήσεις, της εταιρείας Irregular, είχε ως αποτέλεσμα να παραμείνει ενεργή η σύνδεση στο διαδίκτυο.
Τα περιστατικά εντοπίστηκαν όταν η Anthropic επανεξέτασε περισσότερα από 141.000 αρχεία αξιολογήσεων κυβερνοασφάλειας, μετά τη γνωστοποίηση αντίστοιχου συμβάντος από την OpenAI.
Οι δοκιμές αφορούσαν ασκήσεις τύπου «capture the flag», στις οποίες ένα σύστημα τεχνητής νοημοσύνης καλείται να αναλύσει, να αποσυναρμολογήσει ή να εκμεταλλευτεί ένα ευάλωτο ψηφιακό σύστημα, προκειμένου να εντοπίσει μια κρυμμένη πληροφορία.
Σε μία από τις περιπτώσεις, το Claude έλαβε ως στόχο μια εικονική εταιρεία, η οποία όμως είχε το ίδιο όνομα με πραγματική επιχείρηση και ενεργό διαδικτυακό domain.
Το μοντέλο εντόπισε και εκμεταλλεύτηκε αδυναμίες στις ψηφιακές υποδομές της πραγματικής εταιρείας, απέκτησε πρόσβαση σε πληροφορίες και εισήλθε σε βάση δεδομένων που περιείχε εκατοντάδες εγγραφές παραγωγικών δεδομένων.
Σύμφωνα με την Anthropic, τα περιστατικά αφορούσαν τα μοντέλα Claude Opus 4.7, Claude Mythos 5 και ένα εσωτερικό ερευνητικό μοντέλο.
Η εταιρεία ανακοίνωσε ότι διέκοψε τις αξιολογήσεις κυβερνοασφάλειας μόλις διαπίστωσε ότι τα μοντέλα ενδέχεται να είχαν συνδεθεί σε πραγματικά συστήματα.
Παράλληλα, επικοινώνησε ή επιχείρησε να επικοινωνήσει με τους οργανισμούς που επηρεάστηκαν, ενώ σε τουλάχιστον δύο περιπτώσεις οι εταιρείες δεν γνώριζαν ότι είχε πραγματοποιηθεί μη εξουσιοδοτημένη πρόσβαση πριν ενημερωθούν από την Anthropic.
Η Anthropic χαρακτήρισε τα περιστατικά «λειτουργική αποτυχία», αναλαμβάνοντας την ευθύνη για την ανεπαρκή απομόνωση του περιβάλλοντος δοκιμών.
Η εταιρεία ανέφερε ότι θα διευρύνει την παρακολούθηση των συνομιλιών και των ενεργειών των μοντέλων για «απροσδόκητη συμπεριφορά», ενώ θα εφαρμόσει αυστηρότερες διαδικασίες ελέγχου για τους εξωτερικούς συνεργάτες που συμμετέχουν στις αξιολογήσεις.
Η αποκάλυψη της Anthropic έρχεται λίγες ημέρες μετά τη γνωστοποίηση ενός παρόμοιου περιστατικού από την OpenAI και τη Hugging Face.
Κατά τη διάρκεια αξιολόγησης μοντέλων κυβερνοασφάλειας, δύο συστήματα της OpenAI εκμεταλλεύτηκαν ευπάθεια στο περιβάλλον δοκιμών, συνδέθηκαν στο διαδίκτυο και απέκτησαν πρόσβαση σε υποδομές της Hugging Face. Οι δύο εταιρείες ανακοίνωσαν ότι συνεργάζονται για τη διερεύνηση του συμβάντος και την ενίσχυση των σχετικών δικλίδων ασφαλείας.
Τα δύο περιστατικά ενισχύουν τις ανησυχίες γύρω από την ασφάλεια των AI agents, δηλαδή συστημάτων που μπορούν να εκτελούν αυτόνομα σειρά ενεργειών βάσει μιας αρχικής ανθρώπινης εντολής.
Η ικανότητα προηγμένων μοντέλων να εντοπίζουν ευπάθειες και να αποκτούν πρόσβαση σε πραγματικές υποδομές, ακόμη και στο πλαίσιο ελεγχόμενων δοκιμών, αναδεικνύει την ανάγκη για αυστηρότερη απομόνωση των περιβαλλόντων αξιολόγησης και συνεχή ανθρώπινη εποπτεία πριν από την ευρύτερη διάθεση των συστημάτων.