Skip to content

OpenΑΙ: Η AI έδωσε εντολή παράκαμψης ελέγχων από ανθρώπους! Αρχίζει να ξεφεύγει;

Η OpenAI αποκαλύπτει έξι περιστατικά απρόβλεπτης συμπεριφοράς και θεσπίζει νέο σύστημα καταγραφής και διερεύνησης για το misalignment των μοντέλων της.

Dimitrios Amprazis
Dimitrios Amprazis
Κοινοποίηση:
OpenAI νέο πλαίσιο αναφοράς περιστατικών misalignment

Σύνοψη Άρθρου

  • Η OpenAI ανακοίνωσε ένα νέο πλαίσιο για την καταγραφή, διερεύνηση και δημοσιοποίηση περιστατικών misalignment, δηλαδή περιπτώσεων όπου ένα μοντέλο αποκλίνει από τις οδηγίες και τους στόχους που έχουν τεθεί, παρακάμπτοντας τους περιορισμούς.
  • Μαζί με το νέο πλαίσιο, η OpenAI δημοσιεύει έξι τρανταχτά περιστατικά απρόβλεπτης συμπεριφοράς, όπου μοντέλα εισήγαγαν δικές τους οδηγίες, επινόησαν δεδομένα ή χρησιμοποίησαν μη εξουσιοδοτημένες πηγές.
  • Τα περιστατικά αυτά δείχνουν ότι τα μοντέλα δεν ακολουθούν πάντα τις οδηγίες των προγραμματιστών, κατασκευάζοντας πληροφορίες και καταστάσεις για να ξεπεράσουν τους ανθρώπινους περιορισμούς. Η OpenAI αναγνωρίζει ότι η ευθυγράμμιση των ισχυρών συστημάτων δεν έχει ακόμη λυθεί πλήρως και υποστηρίζει ότι χρειάζονται περισσότερα δεδομένα.
Το κείμενο της σύνοψης ελέγχεται από συντάκτη του Techmaniacs

Η OpenAI είναι από τις εταιρείες που μέσω του Sam Altman έχουν εκφράσει τους φόβους τους για την έλλειψη ελέγχων των μοντέλων. Τώρα, η εταιρεία ανακοίνωσε ένα νέο πλαίσιο για την καταγραφή, διερεύνηση και δημοσιοποίηση περιστατικών misalignment, δηλαδή περιπτώσεων όπου ένα μοντέλο αποκλείνει από τις οδηγίες και τους στόχους που έχουν τεθεί, παρακάμπτοντας τους περιορισμούς.

Μαζί με το νέο πλαίσιο, η OpenAI δημοσιεύει και έξι τρανταχτά περιστατικά που εντοπίστηκαν κατά την εκπαίδευση και την αξιολόγηση των μοντέλων. Η εταιρεία λέει πως είναι μεμονωμένα περιστατικά και δεν μπορούν να χρησιμοποιηθούν για την αξιολόγηση της συχνότητας misalignment των μοντέλων της.

Τι έκαναν τα μοντέλα;

Τα έξι περιστατικά δημοσιεύθηκαν από την εταιρεία γιατί παρουσιάζουν διαφορετικές μορφές απρόβλεπτης συμπεριφοράς. Αυτό πιθανότατα σημαίνει πως τα περιστατικά είναι αρκετά παραπάνω, όμως η εταιρεία επέλεξε αυτά σαν δείγματα συμπεριφοράς.

Σε ένα από αυτά, ένα ερευνητικό μοντέλο εισήγαγε δικές του οδηγίες μέσα στις περιλήψεις εργασιών, οι οποίες χρησιμοποιούνταν για να συνεχίσει μια εργασία σε νέα βάση. Σε 27 περιπτώσεις, οι οδηγίες περιλάμβαναν προσπάθειες να αγνοηθούν οι κανονικοί περιορισμοί του μοντέλου. Κοινώς, η ίδια η τεχνητή νοημοσύνη άλλαζε τον τρόπο που κινείται ένα μοντέλο, αλλάζοντας τους στόχους του.

Σε ένα άλλο περιστατικό, κατά την εκπαίδευση του GPT-5.6 Sol, τα μοντέλα πρόσθεταν οδηγίες στις περιλήψεις, ώστε να κρύβουν λάθη ή μη προβληματικές ενέργειες από τον χρήστη. Για παράδειγμα, σε ένα από τα περιστατικά, το μοντέλο έδινε οδηγίες για την επινόηση δεδομένων που έλειπαν, χωρίς να αποκαλύπτεται ότι αυτά είχαν κατασκευαστεί.

Ένα ακόμη περιστατικό αφορά την αναζήτηση οικονομικών στοιχείων. Το μοντέλο εντόπισε ένα εκτεθειμένο API key σε δημόσιο repository, το χρησιμοποίησε χωρίς εξουσιοδότηση και, όταν δεν κατάφερε να πάρει τα ζητούμενα στοιχεία, δημιούργησε δικά του δεδομένα και τα παρουσίασε ως πληροφορίες από την πηγή που είχε ζητήσει ο χρήστης.

Σε διαφορετικό test, ένα μοντέλο ανέβασε αρχείο στο διαδίκτυο χωρίς να ζητήσει άδεια, προκειμένου να μπορέσει να το χρησιμοποιήσει ως πηγή σε μια απάντηση. Κοινώς, κατασκεύασε την πληροφορία χωρίς να βασιστεί σε πραγματικά δεδομένα, την ανέβασε στο διαδίκτυο και την χρησιμοποίησε σαν πηγή για να κατασκευάσει μια απάντηση.

Υπήρξαν επίσης περιπτώσεις όπου μοντέλα χρησιμοποίησαν εσωτερικό software repository σαν κανάλι επικοινωνίας μεταξύ διαφορετικών training samples, ενώ άλλα συνεργαζόμενα agents χρησιμοποίησαν δημόσιες υπηρεσίες φιλοξενίας αρχείων για να ανταλλάξουν δεδομένα, παρότι οι οδηγίες απαιτούσαν αποκλειστικά χρήση τοπικών αρχείων.

Όλα αυτά σημαίνουν πως τα μοντέλα δεν ακολουθούν πάντα τις οδηγίες των προγραμματιστών, ενώ ταυτόχρονα κατασκευάζουν πληροφορίες και καταστάσεις, ώστε να ξεπεράσουν τους περιορισμούς που έχουν τεθεί από τους ανθρώπους, και αυτό είναι πολύ τρομακτικό.

Αλλαγή στον τρόπο δημοσιοποίησης των περιστατικών από την OpenAI

Μέχρι σήμερα, η OpenAI αναφέρει ότι οι σχετικές αποκαλύψεις γίνονταν χωρίς ένα ενιαίο και συστηματικό πλαίσιο. Πλέον, οποιοσδήποτε εργαζόμενος της εταιρείας θα μπορεί να αναφέρει ένα πιθανό περιστατικό στις ομάδες safety και alignment.

Κάθε υπόθεση κατατάσσεται σε μία από τρεις κατηγορίες: Ready for Disclosure, Minor Investigation ή Larger Investigation, για πιο σύνθετες περιπτώσεις, ιδιαίτερα όταν εμπλέκονται τρίτοι, όπως η επίθεση των AI Agents της OpenAI στο HuggingFace, που έγινε χωρίς εντολές ή έγκριση από τους προγραμματιστές.

Το νέο πλαίσιο θα καλύπτει όλο τον κύκλο ζωής κάθε μοντέλου, από την εκπαίδευσή τους και τις δοκιμές, μέχρι την αξιολόγηση και την ανάπτυξή τους, σε πραγματικές υπηρεσίες που είναι δημόσια προσβάσιμες.

Η απόφαση της OpenAI έρχεται πάνω στη στιγμή που έχει ανοίξει η συζήτηση για τον περιορισμό των μοντέλων τεχνητής νοημοσύνης, λόγω των φόβων για προβληματική συμπεριφορά, όταν έχουν ήδη γίνει πολύ ισχυρά.

Η OpenAI αναγνωρίζει ότι η ευθυγράμμιση και η παρακολούθηση των ολοένα ισχυρότερων συστημάτων δεν έχουν ακόμη λυθεί πλήρως και υποστηρίζει ότι χρειάζονται περισσότερα δεδομένα που μπορούν να εξετάσουν ανεξάρτητοι ερευνητές και άλλοι οργανισμοί.

Σύμφωνα με την OpenAI, το νέο πλαίσιο είναι το πρώτο βήμα προς τη συστημική διαφάνεια. Υποστηρίζει πως θα πατήσει σε αυτό για να αναπτύξει πιο ασφαλή μοντέλα στο μέλλον.

Ακολουθήστε μας

Ακολουθήστε το Techmaniacs.gr στο Google News για να διαβάζετε πρώτοι όλα τα τεχνολογικά νέα, ή προσθέστε μας στον RSS feed reader και στα social media σας.

Dimitrios Amprazis

Dimitrios Amprazis

Owner and Editor in Chief! Από μικρό με τράβαγε ότι είχε κουμπιά. Ξεκίνησα με Atari 2600 και μια AMIGA 500. Από τότε δεν έχω σταματήσει ποτέ να ασχολούμαι με την τεχνολογία και τους υπολογιστές, οπότε είπα να το σπουδάσω σαν μηχανικός υπολογιστών και δικτύων, ενώ έχω και σπουδές στη Σχολή Θετικών Επιστημών του Πανεπιστημείου Αιγαίου. Τώρα κάθε μέρα βρίσκομαι περιτριγυρισμένος από δεκάδες smartphones και gadgets. Να σας πως κάτι; Δεν το βαριέμαι ποτέ! Στον ελεύθερο χρόνο μου, έχει gaming και απέλπιδες προσπάθειες να μάθω κιθάρα!

Loading comments...
Loading more stories...
Loading reviews...

Μείνε ενημερωμένος

Ακολούθησέ μας στα social media και πρόσθεσέ μας στις αγαπημένες σου πηγές για να μη χάνεις καμία είδηση.