Η OpenAI είναι από τις εταιρείες που μέσω του Sam Altman έχουν εκφράσει τους φόβους τους για την έλλειψη ελέγχων των μοντέλων. Τώρα, η εταιρεία ανακοίνωσε ένα νέο πλαίσιο για την καταγραφή, διερεύνηση και δημοσιοποίηση περιστατικών misalignment, δηλαδή περιπτώσεων όπου ένα μοντέλο αποκλείνει από τις οδηγίες και τους στόχους που έχουν τεθεί, παρακάμπτοντας τους περιορισμούς.
Μαζί με το νέο πλαίσιο, η OpenAI δημοσιεύει και έξι τρανταχτά περιστατικά που εντοπίστηκαν κατά την εκπαίδευση και την αξιολόγηση των μοντέλων. Η εταιρεία λέει πως είναι μεμονωμένα περιστατικά και δεν μπορούν να χρησιμοποιηθούν για την αξιολόγηση της συχνότητας misalignment των μοντέλων της.
Τι έκαναν τα μοντέλα;
Τα έξι περιστατικά δημοσιεύθηκαν από την εταιρεία γιατί παρουσιάζουν διαφορετικές μορφές απρόβλεπτης συμπεριφοράς. Αυτό πιθανότατα σημαίνει πως τα περιστατικά είναι αρκετά παραπάνω, όμως η εταιρεία επέλεξε αυτά σαν δείγματα συμπεριφοράς.
Σε ένα από αυτά, ένα ερευνητικό μοντέλο εισήγαγε δικές του οδηγίες μέσα στις περιλήψεις εργασιών, οι οποίες χρησιμοποιούνταν για να συνεχίσει μια εργασία σε νέα βάση. Σε 27 περιπτώσεις, οι οδηγίες περιλάμβαναν προσπάθειες να αγνοηθούν οι κανονικοί περιορισμοί του μοντέλου. Κοινώς, η ίδια η τεχνητή νοημοσύνη άλλαζε τον τρόπο που κινείται ένα μοντέλο, αλλάζοντας τους στόχους του.
Σε ένα άλλο περιστατικό, κατά την εκπαίδευση του GPT-5.6 Sol, τα μοντέλα πρόσθεταν οδηγίες στις περιλήψεις, ώστε να κρύβουν λάθη ή μη προβληματικές ενέργειες από τον χρήστη. Για παράδειγμα, σε ένα από τα περιστατικά, το μοντέλο έδινε οδηγίες για την επινόηση δεδομένων που έλειπαν, χωρίς να αποκαλύπτεται ότι αυτά είχαν κατασκευαστεί.
Ένα ακόμη περιστατικό αφορά την αναζήτηση οικονομικών στοιχείων. Το μοντέλο εντόπισε ένα εκτεθειμένο API key σε δημόσιο repository, το χρησιμοποίησε χωρίς εξουσιοδότηση και, όταν δεν κατάφερε να πάρει τα ζητούμενα στοιχεία, δημιούργησε δικά του δεδομένα και τα παρουσίασε ως πληροφορίες από την πηγή που είχε ζητήσει ο χρήστης.
Σε διαφορετικό test, ένα μοντέλο ανέβασε αρχείο στο διαδίκτυο χωρίς να ζητήσει άδεια, προκειμένου να μπορέσει να το χρησιμοποιήσει ως πηγή σε μια απάντηση. Κοινώς, κατασκεύασε την πληροφορία χωρίς να βασιστεί σε πραγματικά δεδομένα, την ανέβασε στο διαδίκτυο και την χρησιμοποίησε σαν πηγή για να κατασκευάσει μια απάντηση.
Υπήρξαν επίσης περιπτώσεις όπου μοντέλα χρησιμοποίησαν εσωτερικό software repository σαν κανάλι επικοινωνίας μεταξύ διαφορετικών training samples, ενώ άλλα συνεργαζόμενα agents χρησιμοποίησαν δημόσιες υπηρεσίες φιλοξενίας αρχείων για να ανταλλάξουν δεδομένα, παρότι οι οδηγίες απαιτούσαν αποκλειστικά χρήση τοπικών αρχείων.
Όλα αυτά σημαίνουν πως τα μοντέλα δεν ακολουθούν πάντα τις οδηγίες των προγραμματιστών, ενώ ταυτόχρονα κατασκευάζουν πληροφορίες και καταστάσεις, ώστε να ξεπεράσουν τους περιορισμούς που έχουν τεθεί από τους ανθρώπους, και αυτό είναι πολύ τρομακτικό.
Αλλαγή στον τρόπο δημοσιοποίησης των περιστατικών από την OpenAI
Μέχρι σήμερα, η OpenAI αναφέρει ότι οι σχετικές αποκαλύψεις γίνονταν χωρίς ένα ενιαίο και συστηματικό πλαίσιο. Πλέον, οποιοσδήποτε εργαζόμενος της εταιρείας θα μπορεί να αναφέρει ένα πιθανό περιστατικό στις ομάδες safety και alignment.
Κάθε υπόθεση κατατάσσεται σε μία από τρεις κατηγορίες: Ready for Disclosure, Minor Investigation ή Larger Investigation, για πιο σύνθετες περιπτώσεις, ιδιαίτερα όταν εμπλέκονται τρίτοι, όπως η επίθεση των AI Agents της OpenAI στο HuggingFace, που έγινε χωρίς εντολές ή έγκριση από τους προγραμματιστές.
Το νέο πλαίσιο θα καλύπτει όλο τον κύκλο ζωής κάθε μοντέλου, από την εκπαίδευσή τους και τις δοκιμές, μέχρι την αξιολόγηση και την ανάπτυξή τους, σε πραγματικές υπηρεσίες που είναι δημόσια προσβάσιμες.
Η απόφαση της OpenAI έρχεται πάνω στη στιγμή που έχει ανοίξει η συζήτηση για τον περιορισμό των μοντέλων τεχνητής νοημοσύνης, λόγω των φόβων για προβληματική συμπεριφορά, όταν έχουν ήδη γίνει πολύ ισχυρά.
Η OpenAI αναγνωρίζει ότι η ευθυγράμμιση και η παρακολούθηση των ολοένα ισχυρότερων συστημάτων δεν έχουν ακόμη λυθεί πλήρως και υποστηρίζει ότι χρειάζονται περισσότερα δεδομένα που μπορούν να εξετάσουν ανεξάρτητοι ερευνητές και άλλοι οργανισμοί.
Σύμφωνα με την OpenAI, το νέο πλαίσιο είναι το πρώτο βήμα προς τη συστημική διαφάνεια. Υποστηρίζει πως θα πατήσει σε αυτό για να αναπτύξει πιο ασφαλή μοντέλα στο μέλλον.