Έρευνα της Anthropic δείχνει ότι τα συστήματα τεχνητής νοημοσύνης μπορούν να βελτιώσουν άλλα μοντέλα με πιο γρήγορο και ταυτόχρονα πιο φθηνό τρόπο σε σχέση με τους ανθρώπους.
Τι ήθελε να εξετάζει η έρευνα: Οι ερευνητές ήθελαν να εξετάσουν κατά πόσο ένα σύστημα τεχνητής νοημοσύνης μπορεί να αυτοματοποιήσει το alignment research, δηλαδή να αναζητήσει και να εφαρμόσει μεθόδους που μειώνουν τις περιπτώσεις προβληματικών συμπεριφορών σε άλλα μοντέλα.
Πως το έκαναν;: Το Claude αποτέλεσε έναν autonomous research agent που αντιμετώπισε 10 διαφορετικές κατηγορίες με τέτοιες αστοχίες.
- Μελετούσε τη βιβλιογραφία
- Πρότεινε μεθόδους και δεδομένα εκπαίδευσης που θα μπορούσαν να μειώσουν το ποσοστό αστοχιών
- Εκπαίδευε το μοντέλο με τις μεθόδους που πρότεινε
- Αξιολογούσε το αποτέλεσμα και
- Εεπαναλάμβανε ξανά τη διαδικασία χρησιμοποιώντας τα αποτελέσματα προηγούμενων δοκιμών.
Η έρευνα βασίστηκε σε έναν αυτοματοποιημένο κύκλο, έναν κύκλο δηλαδή που περιλαμβάνει τη βιβλιογραφική αναζήτηση, την πρόταση της μεθόδου, το training, το evaluation και τέλος την επανάληψη και τη βελτίωση. Ενώ, την ίδια στιγμή η Claude έτρεξε ανεξάρτητους ελέγχους προκειμένου να αποκλειστούν περιπτώσεις πιθανού cheating.
Πως έγινε η αξιολόγηση των αποτελεσμάτων: Η αξιολόγηση των αποτελεσμάτων των πειραμάτων των ερευνητών μετρήθηκε ως προς το πόση απόσταση κατάφερε να καλύψει μεταξύ της αρχικής απόδοσης του μοντέλου και της θεωρητικά τέλειας απόδοσης.
Δεν ήθελαν απλώς να διαπιστώσουν ότι το μοντέλο πέτυχε να ανεβάσει τις επιδόσεις του σε ένα συγκεκριμένο benchmark. Για αυτόν ακριβώς το λόγο εξέτασαν και αν οι βελτιώσεις γίνονταν και σε benchmarks που το Claude δεν είχε πρόσβαση και αν διατηρούνταν οι ικανότητες του μοντέλου και σε μεγαλύτερα.
Τι έδειξαν τα αποτελέσματα: Η έρευνα με τίτλο «Automated Researchers Can Reliably Mitigate Alignment Failures» δείχνει πώς τα συστήματα AI μπορούν να βελτιώσουν με συνέπεια την απόδοση ενός μοντέλου σε πλήθος benchmarks.
Ένα σύστημα τεχνητής νοημοσύνης μπορεί να αυτοματοποιήσει ένα σημαντικό μέρος του alignment research, δηλαδή να διαβάσει προηγούμενη έρευνα, να δημιουργήσει υποθέσεις, να εκπαιδεύσει μοντέλα, να αξιολογήσει τα αποτελέσματα και να βελτιώνει τις μεθόδους του.
Πάντως, ακόμη και οι ίδιοι οι ερευνητές τονίζουν ότι πρόκειται για ένα πρώιμο αποτέλεσμα. Από την άλλη πλευρά, αποτελεί και ένα βήμα προς αυτό που συχνά περιγράφεται ως recursive self-improvement.
Στην εν λόγω έρευνα του άρθρου, ένα σύστημα τεχνητής νοημοσύνης βελτίωσε τον τρόπο που εκπαιδεύονται άλλα μοντέλα για καλύτερο alignment. Στο μέλλον, αντίστοιχοι agents θα μπορούσαν να βελτιώσουν όχι απλώς το alignment training, αλλά και τις ίδιες τις διαδικασίες εκπαίδευσης των μοντέλων, ουσιαστικά δημιουργώντας έναν πιο αυτοματοποιημένο κύκλο βελτίωσης της AI.
Το ζήτημα: Και κάπου εδώ μπαίνει ένα ενδιαφέρον ζήτημα στη συζήτηση. Ποιος θα είναι λοιπόν ο ρόλος του ανθρώπου σε αυτό το νέο περιβάλλον;
Η άποψή μας: Πάντως, για να είμαστε απόλυτα ακριβείς, θα πρέπει να αναφέρουμε ότι η μελέτη δεν δείχνει ότι η τεχνητή νοημοσύνη έχει αρχίσει να βελτιώνεται από μόνη της. Δείχνει, κατά την άποψή μας, κάτι πολύ πιο συγκεκριμένο. Ότι ένα σύστημα τεχνητής νοημοσύνης μπορεί να αυτοματοποιήσει έναν κύκλο ερευνητικής εργασίας για τη βελτίωση του alignment άλλων μοντέλων.