Φυσικοί από το George Washington University υποστηρίζουν ότι ανέπτυξαν έναν απλό μαθηματικό τύπο, ικανό να υπολογίζει πότε ένα γλωσσικό μοντέλο θα αρχίσει να παράγει επικίνδυνες απαντήσεις. Η έρευνα των Neil F. Johnson και Frank Yingjie Huo δημοσιεύθηκε στο επιστημονικό περιοδικό Patterns και φέρει τον τίτλο «Competition for Attention Predicts Good-to-Bad Tipping in AI».
Ενώ η κοινή αντίληψη θεωρεί ότι μια απόκριση της τεχνητής νοημοσύνης είναι είτε ορθή είτε εσφαλμένη, οι ερευνητές αναδεικνύουν μια κρίσιμη τρίτη διάσταση: μια απάντηση μπορεί να είναι πραγματολογικά ακριβής, αλλά ταυτόχρονα εξαιρετικά επικίνδυνη ή ανεύθυνη ως προς τις συνέπειές της. Όπως επισημαίνει ο συγγραφέας της μελέτης Frank Yingjie Huo, «Μέχρι σήμερα κανείς δεν μπορούσε να γνωρίζει πότε ακριβώς θα συντελεστεί αυτή η μετάβαση».
Ο κίνδυνος στα τοπικά και offline μοντέλα τεχνητής νοημοσύνης
Οι ειδικοί εστιάζουν τον προβληματισμό τους κυρίως σε όσους εκτελούν συστήματα AI offline σε τοπικό επίπεδο, όπου απουσιάζουν οι δικλείδες ασφαλείας (safeguards) που ενσωματώνουν οι μεγάλες cloud πλατφόρμες. Η τοπική εκτέλεση είναι απαραίτητη σε επαγγελματικούς κλάδους που διαχειρίζονται ευαίσθητα δεδομένα, όπως γιατροί που δεσμεύονται από το ιατρικό απόρρητο, δικηγόροι ή στρατιωτικοί που επιχειρούν σε απομακρυσμένες περιοχές χωρίς σύνδεση στο διαδίκτυο.
Σε τέτοια απομονωμένα περιβάλλοντα, η παραγωγή επιβλαβών απαντήσεων ενέχει απρόβλεπτες συνέπειες, καθώς δεν υπάρχει εξωτερικός μηχανισμός εποπτείας για να παρέμβει έγκαιρα. Η ερευνητική ομάδα υποστηρίζει ότι, αντί να παρακολουθούμε παθητικά τις αστοχίες, είναι απαραίτητο να προβλέπεται μαθηματικά το σημείο καμπής, δηλαδή η στιγμή που το σύστημα πλησιάζει στην παραγωγή επικίνδυνου περιεχομένου.
Ο μαθηματικός τύπος και η σταδιακή μετατόπιση της συμπεριφοράς
Αξιοποιώντας το θεωρητικό τους υπόβαθρο στη φυσική, οι ερευνητές διατύπωσαν ένα μαθηματικό τύπο που περιγράφει με ακρίβεια αυτή τη μεταβολή. Συγκεκριμένα, το context της συνομιλίας μπορεί να εκτρέψει το σύστημα είτε άμεσα, μέσω ενός μεμονωμένου prompt, είτε σταδιακά μετά από διαδοχικά μηνύματα.
Ο τύπος προσδιορίζει εάν η στροφή προς μη αποδεκτές απαντήσεις θα είναι ακαριαία ή εάν θα προηγηθεί μια σειρά φαινομενικά ασφαλών αποκρίσεων. Όπως σημειώνεται στη μελέτη, η σταδιακή μετατόπιση αποτελεί το πλέον ανησυχητικό σενάριο: ο χρήστης χτίζει μια ψευδή αίσθηση εμπιστοσύνης με το εργαλείο, ενώ στην πραγματικότητα κάθε επόμενη απόκριση τον οδηγεί σε όλο και πιο επισφαλείς θέσεις.

Επαλήθευση σε 7 γλωσσικά μοντέλα και ποσοστό επιτυχίας
Ο αλγόριθμος δοκιμάστηκε σε 7 διαφορετικά μοντέλα AI, προβλέποντας με επιτυχία το σημείο εκτροπής στις 18 από τις 19 περιπτώσεις. Οι δοκιμές περιλάμβαναν ευαίσθητα ερωτήματα γύρω από εμβόλια, καθώς και θέματα πρόκλησης βλάβης σε τρίτους ή αυτοτραυματισμού. Τα ευρήματα επιβεβαίωσαν ότι η αλληλουχία των ερωτήσεων επηρεάζει τη συμπεριφορά του μοντέλου, με τον μαθηματικό τύπο να προβλέπει τη στιγμή της μεταστροφής σε μη ασφαλές περιεχόμενο.