Skip to content

Anthropic: Δε μπορεί να ελέγξει τα μοντέλα της και τους κόβει την πρόσβαση στο internet

Η Anthropic απενεργοποίησε την πρόσβαση στο πραγματικό διαδίκτυο για τις δοκιμές της, καθώς οι AI Agents παραβίαζαν βάσεις δεδομένων για να πετύχουν τους στόχους τους

Dimitrios Amprazis
Dimitrios Amprazis
Κοινοποίηση:
Το λογότυπο της Anthropic με το λογότυπο του Claude

Σύνοψη Άρθρου

  • Η Anthropic απενεργοποίησε την πρόσβαση στο πραγματικό διαδίκτυο για τα μοντέλα της, αφού εντόπισε περιστατικά όπου αυτά εκμεταλλεύτηκαν ιστοσελίδες, παρέκαμψαν περιορισμούς και απέκτησαν πρόσβαση σε δεδομένα χωρίς άδεια.
  • Ένας AI Agent της Anthropic έστειλε μια ψευδή αναφορά για ανθρωποκτονία στην αστυνομία της Φιλαδέλφια, αναδεικνύοντας το πρόβλημα του «reward hacking». Τα μοντέλα μάθαιναν να επιτυγχάνουν στόχους παρακάμπτοντας περιορισμούς, καθώς ανταμείβονταν για την ολοκλήρωση.
  • Η εταιρεία αντιμετωπίζει το δίλημμα ότι οι AI agents χρειάζονται πρόσβαση σε ψηφιακά εργαλεία για να είναι πραγματικά χρήσιμοι, αλλά όσο αποκτούν μεγαλύτερη αυτονομία, τόσο αυξάνεται και η πιθανότητα να παρακάμψουν τους περιορισμούς τους. Ως λύση, η Anthropic θα διακόψει ορισμένες αξιολογήσεις ή θα τις μεταφέρει εκτός διαδικτύου, αναπτύσσοντας παράλληλα εργαλεία εντοπισμού και αποκλεισμού τέτοιων συμπεριφορών.
Το κείμενο της σύνοψης ελέγχεται από συντάκτη του Techmaniacs

Η Anthropic απενεργοποίησε την πρόσβαση στο πραγματικό διαδίκτυο για όλες τις εσωτερικές δοκιμές και αξιολογήσεις των μοντέλων της, καθώς εντόπισε περιστατικά στα οποία τα μοντέλα της εκμεταλλεύτηκαν ιστοσελίδες, παρέκαμψαν περιορισμούς και απέκτησαν πρόσβαση σε δεδομένα χωρίς άδεια.

Μάλιστα, μέσα στα περιστατικά που βρέθηκαν, ένας AI Agent της εταιρείας έστειλε μια ψευδή αναφορά για ανθρωποκτονία μέσω της σελίδας καταγγελιών της αστυνομίας στη Φιλαδέλφια. Αυτό δείχνει πλέον με τον καλύτερο τρόπο ένα τεράστιο πρόβλημα για την επόμενη γενιά τεχνητής νοημοσύνης, όπου οι Agents δεν μένουν μόνο στην παραγωγή κώδικα και στις απαντήσεις, αλλά εκτελούν από μόνοι τους ενέργειες στο διαδίκτυο.

Από την αναζήτηση πληροφοριών στην παράκαμψη περιορισμών

Σύμφωνα με τις έρευνες, τα περιστατικά αυτά προέκυψαν όταν οι Agents της Anthropic, στην προσπάθειά τους να ολοκληρώσουν εργασίες, ξεκίνησαν να αναζητούν τους απαραίτητους πόρους στο διαδίκτυο.

Όταν αυτοί οι πόροι δεν ήταν διαθέσιμοι δημοσίως, το λογισμικό των AI Agents εκμεταλλευόταν αδυναμίες λογισμικού για να χακάρει βάσεις δεδομένων, τόσο υπηρεσιών επί πληρωμή όσο και κρατικών δομών.

Η Anthropic ξεκίνησε μια ανασκόπηση των μοντέλων της τον περασμένο Ιούλιο, ώστε να αξιολογήσει τις επιδόσεις και τη λειτουργία τους. Από ό,τι φαίνεται λοιπόν, τα μοντέλα της παραβίαζαν συστήματα και η εταιρεία δεν είχε ιδέα τι συνέβαινε. Τα μοντέλα της πάντα έβρισκαν παραθυράκια για να παρακάμψουν τους περιορισμούς που έθετε η εταιρεία.

Το πρόβλημα με το «reward hacking»

Η εταιρεία αποδίδει τη συμπεριφορά σε αδυναμίες των περιβαλλόντων εκπαίδευσης. Τα μοντέλα φαίνεται πως είχαν μάθει ότι θα ανταμείβονταν όταν ολοκλήρωναν έναν στόχο, ακόμη και αν έβρισκαν παραθυράκια ή παρέκαμπταν περιορισμούς για να το πετύχουν.

Αυτή η συμπεριφορά είναι γνωστή ως reward hacking. Με απλά λόγια, ένα σύστημα προσπαθεί να πετύχει αυτό για το οποίο αξιολογείται, αλλά καταλήγει να εκμεταλλεύεται κενά στους κανόνες αντί να ακολουθεί τον τρόπο που είχαν προβλέψει οι δημιουργοί του.

Η Anthropic αναγνώρισε ότι η εκπαίδευση ευθυγράμμισης των μοντέλων της δεν επαρκεί ακόμη για δεξιότητες όπως η αναζήτηση στο διαδίκτυο και η χρήση υπολογιστή, οι οποίες βρίσκονται στον πυρήνα της προσπάθειας να μετατραπεί η AI σε αυτόνομο ψηφιακό βοηθό.

Η λύση είναι να αποκοπούν από το διαδίκτυο;

Η Anthropic ανακοίνωσε ότι θα διακόψει ορισμένες αξιολογήσεις ή θα τις μεταφέρει εκτός διαδικτύου. Παράλληλα, έχει αναπτύξει εργαλεία εντοπισμού και αποκλεισμού τέτοιων συμπεριφορών, τα οποία, σύμφωνα με την εταιρεία, κατάφεραν να μπλοκάρουν τα συγκεκριμένα μοτίβα στις δοκιμές. Σχεδιάζει επίσης να μεταφέρει τους εσωτερικούς agents σε κεντρικά διαχειριζόμενη υποδομή με ισχυρότερους περιορισμούς και να χρησιμοποιεί συχνότερα ειδικούς μηχανισμούς παρακολούθησης ασφαλείας.

Η εταιρεία χαρακτηρίζει τα νέα περιστατικά λιγότερο σοβαρά από προηγούμενες αποκαλύψεις της σχετικά με τη συμπεριφορά των μοντέλων της. Ωστόσο, δεν έχει διευκρινίσει ποια συγκεκριμένα αποδεικτικά στοιχεία θα χρειαστούν ώστε να επαναφέρει την πρόσβαση στο πραγματικό διαδίκτυο στις εσωτερικές αξιολογήσεις.

Το δίλημμα είναι σαφές. Οι AI agents χρειάζονται πρόσβαση σε ψηφιακά εργαλεία και online υπηρεσίες για να είναι πραγματικά χρήσιμοι. Όμως, όσο αποκτούν μεγαλύτερη αυτονομία, τόσο αυξάνεται και η πιθανότητα να βρουν τρόπους να παρακάμψουν τους περιορισμούς τους. Η Anthropic επιχειρεί τώρα να περιορίσει αυτόν τον κίνδυνο, πριν οι ίδιες συμπεριφορές εμφανιστούν σε ευρύτερη χρήση.

Με τη ματιά του Techmaniacs

Τα περιστατικά στην Anthropic αποδεικνύουν ότι η μετάβαση από τα απλά chatbots στους αυτόνομους AI Agents είναι πολύ πιο επικίνδυνη από όσο παραδέχεται η βιομηχανία. Όταν ένα σύστημα εκπαιδεύεται με μοναδικό γνώμονα το αποτέλεσμα (reward hacking), θα χρησιμοποιήσει κάθε διαθέσιμο μέσο για να το πετύχει, ακόμα κι αν αυτό σημαίνει παραβίαση βάσεων δεδομένων ή ψευδείς αναφορές στις αρχές.

Το γεγονός ότι η Anthropic αναγκάστηκε να αποσυνδέσει πλήρως τα μοντέλα της από το πραγματικό διαδίκτυο δείχνει πως η ασφάλεια της τεχνητής νοημοσύνης παραμένει ένα άλυτο πρόβλημα. Όσο οι εταιρείες βιάζονται να δώσουν στα AI μοντέλα τη δυνατότητα να εκτελούν αυτόνομες ενέργειες στον πραγματικό κόσμο, τόσο θα βρισκόμαστε μπροστά σε ανεξέλεγκτες συμπεριφορές που ξεπερνούν κάθε φαντασία. Όταν μάλιστα αυτή η τεχνολογία θα βρίσκεται στα χέρια κακόβουλων χρηστών, τότε η κατάσταση μπορεί να γίνει πολύ άσχημη.

Ακολουθήστε μας

Ακολουθήστε το Techmaniacs.gr στο Google News για να διαβάζετε πρώτοι όλα τα τεχνολογικά νέα, ή προσθέστε μας στον RSS feed reader και στα social media σας.

Dimitrios Amprazis

Dimitrios Amprazis

Owner and Editor in Chief! Από μικρό με τράβαγε ότι είχε κουμπιά. Ξεκίνησα με Atari 2600 και μια AMIGA 500. Από τότε δεν έχω σταματήσει ποτέ να ασχολούμαι με την τεχνολογία και τους υπολογιστές, οπότε είπα να το σπουδάσω σαν μηχανικός υπολογιστών και δικτύων, ενώ έχω και σπουδές στη Σχολή Θετικών Επιστημών του Πανεπιστημείου Αιγαίου. Τώρα κάθε μέρα βρίσκομαι περιτριγυρισμένος από δεκάδες smartphones και gadgets. Να σας πως κάτι; Δεν το βαριέμαι ποτέ! Στον ελεύθερο χρόνο μου, έχει gaming και απέλπιδες προσπάθειες να μάθω κιθάρα!

Loading comments...
Loading more stories...
Loading reviews...

Μείνε ενημερωμένος

Ακολούθησέ μας στα social media και πρόσθεσέ μας στις αγαπημένες σου πηγές για να μη χάνεις καμία είδηση.