Ερευνητής της Anthropic, ο Jacob Coxon, παραιτήθηκε προειδοποιώντας για ένα μέλλον όπου τα συστήματα τεχνητής νοημοσύνης δεν θα μπορούν πλέον να ελεγχθούν από την ανθρωπότητα. Η αιτία, όπως έγραψε ο ίδιος, δεν είναι ότι θεωρεί πως οι άνθρωποι στην Anthropic αδιαφορούν για την ασφάλεια.
Το αντίθετο, μάλιστα. Πιστεύει ότι αντιλαμβάνονται τους κινδύνους της τεχνητής νοημοσύνης, αλλά ο ανταγωνισμός τους ωθεί στην ανάπτυξη ολοένα και ισχυρότερων μοντέλων.
«Καμία από τις δύο εταιρείες δεν ενεργεί υπεύθυνα», γράφει ο ίδιος. «Τρέχουν κατευθείαν προς μια αυτοβελτιούμενη τεχνητή νοημοσύνη και παίζουν με τις ζωές μας». Η φράση αυτή προέρχεται από έναν άνθρωπο ο οποίος έχει εργαστεί σε δύο από τις μεγαλύτερες εταιρείες που αναπτύσσουν μοντέλα επόμενης γενιάς.
Ο Coxon δεν περιγράφει απλά έναν θεωρητικό μελλοντικό κίνδυνο από κάποια απόσταση. Αντίθετα, υποστηρίζει ότι η ίδια η δυναμική της αγοράς και ο ανταγωνισμός που υπάρχει σε αυτήν καθιστούν εξαιρετικά δύσκολο για οποιαδήποτε εταιρεία να επιβραδύνει την ανάπτυξη της τεχνητής νοημοσύνης ή, τουλάχιστον, να την ελέγξει.
Η ανησυχία για το recursive self-improvement
Λάδι στη φωτιά έριξε και ο Evan Hubinger, από την Anthropic, ο οποίος έγραψε, στο πλαίσιο αυτής της παραίτησης, ότι προσωπικά εκτιμά, με πιθανότητα άνω του 10%, πως η τεχνητή νοημοσύνη θα σκοτώσει τους ανθρώπους μέσα στην επόμενη δεκαετία.
Ο Hubinger διευκρινίζει επίσης κάτι εξίσου σημαντικό: ο κίνδυνος από τα σημερινά μοντέλα είναι ιδιαίτερα χαμηλός. Η ανησυχία του δεν αφορά το Claude, το ChatGPT ή οποιοδήποτε άλλο σημερινό chatbot που θα αποκτήσει ξαφνικά δικές του προθέσεις και θέλω.
Αφορά ένα πιθανό μελλοντικό σημείο όπου τα συστήματα τεχνητής νοημοσύνης θα μπορούν να δημιουργήσουν καλύτερες εκδόσεις του εαυτού τους, μια διαδικασία η οποία περιγράφεται με τον όρο recursive self-improvement.
Η εικόνα της Anthropic και το πρόβλημα του alignment
Αξίζει σε αυτό το σημείο να σημειωθεί ότι μεγάλο μέρος της δημόσιας εικόνας της Anthropic βασίζεται στην παρουσίασή της ως εταιρείας που υποστηρίζει την ασφαλή ανάπτυξη της τεχνητής νοημοσύνης.
Η εταιρεία διατηρεί ομάδες που μελετούν το alignment, δημοσιεύει αξιολογήσεις κινδύνων και υποστηρίζει ότι η ανάπτυξη ολοένα και ισχυρότερων μοντέλων πρέπει να συνοδεύεται από συγκεκριμένες δικλίδες ασφαλείας και κανόνες.
Όμως, παραδέχεται εδώ δημόσια ότι η εταιρεία δεν έχει ακόμη σχέδιο για να λύσει το πρόβλημα του alignment μιας μελλοντικής υπερνοημοσύνης και ξεκάθαρα δεν κινείται προς αυτή την κατεύθυνση.