Η υπόθεση με τον AI agent της OpenAI που κατάφερε να ξεφύγει από το περιορισμένο περιβάλλον δοκιμών και να πραγματοποιήσει μη εξουσιοδοτημένες ενέργειες φαίνεται πως δεν ήταν μεμονωμένο περιστατικό. Σύμφωνα με αποκλειστικές πληροφορίες του Reuters, η εταιρεία έχει εντοπίσει και άλλες περιπτώσεις κατά τις οποίες αυτόνομοι AI agents παρουσίασαν παρόμοια συμπεριφορά, στο πλαίσιο της εσωτερικής έρευνας που βρίσκεται σε εξέλιξη. Αν και οι νέες περιπτώσεις χαρακτηρίζονται ως περιορισμένης έκτασης, η αποκάλυψη εντείνει τις ανησυχίες γύρω από την ασφάλεια των ολοένα και πιο αυτόνομων συστημάτων τεχνητής νοημοσύνης.
Εσωτερική έρευνα στην OpenAI μετά το περιστατικό της Hugging Face
Η OpenAI ξεκίνησε εκτεταμένη διερεύνηση μετά το περιστατικό των αρχών Ιουλίου, όταν ένας AI agent που συμμετείχε σε εσωτερική δοκιμή κατάφερε να αποκτήσει πρόσβαση στο δίκτυο της Hugging Face και να παραμείνει εκεί για ημέρες. Σύμφωνα με τις πηγές του πρακτορείου, η εταιρεία εξετάζει πλέον αρχεία καταγραφής (logs) που καλύπτουν αρκετούς μήνες λειτουργίας, αναζητώντας αντίστοιχα περιστατικά.
Οι ίδιες πηγές αναφέρουν πως οι επιπλέον «αποδράσεις» δεν φαίνεται να οδήγησαν σε έξοδο των agents από το δίκτυο της OpenAI. Ωστόσο, επιβεβαιώνουν ότι υπήρξαν περιπτώσεις όπου τα μοντέλα τεχνητής νοημοσύνης λειτούργησαν εκτός των αναμενόμενων περιορισμών ασφαλείας.
Παρόμοια ευρήματα στην Anthropic και πιέσεις για κανονισμούς
Οι αποκαλύψεις έρχονται λίγες ημέρες μετά την ανακοίνωση της Anthropic ότι και δικοί της AI agents είχαν πραγματοποιήσει επιθέσεις κατά τη διάρκεια δοκιμών ασφαλείας, οδηγώντας σε παραβιάσεις συστημάτων τριών διαφορετικών εταιρειών. Τόσο η OpenAI όσο και η Anthropic εξετάζουν πλέον παλαιότερα δεδομένα προκειμένου να διαπιστώσουν αν υπήρξαν και άλλα αντίστοιχα περιστατικά που δεν είχαν εντοπιστεί όταν συνέβησαν, εγείροντας το ερώτημα αν οι εταιρείες παρακολουθούσαν τη συμπεριφορά τους σε πραγματικό χρόνο ή εκ των υστέρων.

Οι εξελίξεις έχουν προκαλέσει έντονες αντιδράσεις στην κοινότητα της ασφάλειας AI. Ο μαθηματικός Maurice Chiodo, από το Centre for the Study of Existential Risk του Πανεπιστημίου του Cambridge, υποστηρίζει ότι η ανάπτυξη των AI agents προχωρά ταχύτερα από τα μέτρα ασφαλείας. Σε πολιτικό επίπεδο, στις ΗΠΑ εξετάζονται νέα μέτρα εποπτείας, ενώ η Ευρωπαϊκή Επιτροπή επιβεβαίωσε ότι βρίσκεται σε επαφή με τις εμπλεκόμενες εταιρείες.
Η άποψη του Techmaniacs
Η συγκεκριμένη υπόθεση δείχνει ότι η βιομηχανία της τεχνητής νοημοσύνης μπαίνει σε μια νέα φάση, όπου το ζητούμενο δεν είναι μόνο πόσο ικανό είναι ένα μοντέλο, αλλά κυρίως πόσο προβλέψιμη και ελεγχόμενη είναι η συμπεριφορά του.
Πρέπει ωστόσο να είμαστε προσεκτικοί και να μη δημιουργούνται λανθασμένες εντυπώσεις. Τα μέχρι στιγμής στοιχεία δεν δείχνουν ότι οι AI agents «απέδρασαν» στο διαδίκτυο ή λειτούργησαν ανεξέλεγκτα εκτός των υποδομών των εταιρειών. Αυτό που διερευνάται είναι αν κατάφεραν να παρακάμψουν τους περιορισμούς που είχαν τεθεί μέσα στα δοκιμαστικά περιβάλλοντα (sandboxes) και αν η συμπεριφορά τους εντοπίστηκε έγκαιρα. Βέβαια, η υπόθεση του Hugging Face είναι πλέον επιβεβειωμένη επίθεση από AI Agent και αυτό δείχνει πως ένα τέτοιο σενάριο είναι πλήρως ρεαλιστικό
Παρ’ όλα αυτά, το γεγονός ότι τόσο η OpenAI όσο και η Anthropic ανακάλυψαν αντίστοιχα περιστατικά σε μικρό χρονικό διάστημα δείχνει πως η ασφάλεια των αυτόνομων AI agents αποτελεί ίσως το σημαντικότερο ζήτημα της επόμενης δεκαετίας. Το μόνο σίγουρο είναι πως δε θα θέλαμε AI Agents να τριγυρνούν αυτόνομα στο διαδίκτυο (ή και κατ’εντολή) και να κάνουν επιθέσεις σε servers, σελίδες και υποδομές. Πρόκειται για ένα πολύ επικίνδυνο σενάριο, πλέον έχουμε ενδείξεις πως συμβαίνει. Σίγουρα θα πρέπει να ληφθούν μέτρα, ώστε να είμαστε σίγουροι πως δε θα μπορεί να συμβεί κάτι τέτοιο.