Skip to content

Επιστήμονες βρήκαν πότε η AI γίνεται επικίνδυνη

Μπορεί η AI να στραφεί ξαφνικά εναντίον του χρήστη; Ερευνητές του George Washington University ανακάλυψαν τον μαθηματικό τύπο που προβλέπει με ακρίβεια τη στιγμή που ένα AI μοντέλο αρχίζει να παράγει επικίνδυνες απαντήσεις.

Baladis Koumpouras
Baladis Koumpouras
Κοινοποίηση:
Επιστήμονες βρήκαν πότε η AI γίνεται επικίνδυνη

Σύνοψη Άρθρου

  • Φυσικοί από το George Washington University ανέπτυξαν έναν απλό μαθηματικό τύπο, ικανό να υπολογίζει πότε ένα γλωσσικό μοντέλο θα αρχίσει να παράγει επικίνδυνες απαντήσεις.
  • Η έρευνα εστιάζει κυρίως στα τοπικά και offline μοντέλα τεχνητής νοημοσύνης, όπου απουσιάζουν οι δικλείδες ασφαλείας και η παραγωγή επιβλαβών απαντήσεων ενέχει απρόβλεπτες συνέπειες.
  • Ο τύπος δοκιμάστηκε σε 7 διαφορετικά μοντέλα AI, προβλέποντας με επιτυχία το σημείο εκτροπής στις 18 από τις 19 περιπτώσεις, επιβεβαιώνοντας την ικανότητά του να προβλέπει τη μεταστροφή σε μη ασφαλές περιεχόμενο.
Το κείμενο της σύνοψης ελέγχεται από συντάκτη του Techmaniacs

Φυσικοί από το George Washington University υποστηρίζουν ότι ανέπτυξαν έναν απλό μαθηματικό τύπο, ικανό να υπολογίζει πότε ένα γλωσσικό μοντέλο θα αρχίσει να παράγει επικίνδυνες απαντήσεις. Η έρευνα των Neil F. Johnson και Frank Yingjie Huo δημοσιεύθηκε στο επιστημονικό περιοδικό Patterns και φέρει τον τίτλο «Competition for Attention Predicts Good-to-Bad Tipping in AI».

Ενώ η κοινή αντίληψη θεωρεί ότι μια απόκριση της τεχνητής νοημοσύνης είναι είτε ορθή είτε εσφαλμένη, οι ερευνητές αναδεικνύουν μια κρίσιμη τρίτη διάσταση: μια απάντηση μπορεί να είναι πραγματολογικά ακριβής, αλλά ταυτόχρονα εξαιρετικά επικίνδυνη ή ανεύθυνη ως προς τις συνέπειές της. Όπως επισημαίνει ο συγγραφέας της μελέτης Frank Yingjie Huo, «Μέχρι σήμερα κανείς δεν μπορούσε να γνωρίζει πότε ακριβώς θα συντελεστεί αυτή η μετάβαση».

Ο κίνδυνος στα τοπικά και offline μοντέλα τεχνητής νοημοσύνης

Οι ειδικοί εστιάζουν τον προβληματισμό τους κυρίως σε όσους εκτελούν συστήματα AI offline σε τοπικό επίπεδο, όπου απουσιάζουν οι δικλείδες ασφαλείας (safeguards) που ενσωματώνουν οι μεγάλες cloud πλατφόρμες. Η τοπική εκτέλεση είναι απαραίτητη σε επαγγελματικούς κλάδους που διαχειρίζονται ευαίσθητα δεδομένα, όπως γιατροί που δεσμεύονται από το ιατρικό απόρρητο, δικηγόροι ή στρατιωτικοί που επιχειρούν σε απομακρυσμένες περιοχές χωρίς σύνδεση στο διαδίκτυο.

Σε τέτοια απομονωμένα περιβάλλοντα, η παραγωγή επιβλαβών απαντήσεων ενέχει απρόβλεπτες συνέπειες, καθώς δεν υπάρχει εξωτερικός μηχανισμός εποπτείας για να παρέμβει έγκαιρα. Η ερευνητική ομάδα υποστηρίζει ότι, αντί να παρακολουθούμε παθητικά τις αστοχίες, είναι απαραίτητο να προβλέπεται μαθηματικά το σημείο καμπής, δηλαδή η στιγμή που το σύστημα πλησιάζει στην παραγωγή επικίνδυνου περιεχομένου.

Ο μαθηματικός τύπος και η σταδιακή μετατόπιση της συμπεριφοράς

Αξιοποιώντας το θεωρητικό τους υπόβαθρο στη φυσική, οι ερευνητές διατύπωσαν ένα μαθηματικό τύπο που περιγράφει με ακρίβεια αυτή τη μεταβολή. Συγκεκριμένα, το context της συνομιλίας μπορεί να εκτρέψει το σύστημα είτε άμεσα, μέσω ενός μεμονωμένου prompt, είτε σταδιακά μετά από διαδοχικά μηνύματα.

Ο τύπος προσδιορίζει εάν η στροφή προς μη αποδεκτές απαντήσεις θα είναι ακαριαία ή εάν θα προηγηθεί μια σειρά φαινομενικά ασφαλών αποκρίσεων. Όπως σημειώνεται στη μελέτη, η σταδιακή μετατόπιση αποτελεί το πλέον ανησυχητικό σενάριο: ο χρήστης χτίζει μια ψευδή αίσθηση εμπιστοσύνης με το εργαλείο, ενώ στην πραγματικότητα κάθε επόμενη απόκριση τον οδηγεί σε όλο και πιο επισφαλείς θέσεις.

Μοντέλο πρόβλεψης επικίνδυνων απαντήσεων σε AI
(Εικόνα Α) Σχηματική απεικόνιση μιας τοπικής εγκατάστασης μοντέλου, χωρίς σύνδεση στο Διαδίκτυο και χωρίς επίβλεψη ασφαλείας. (Εικόνα Β) Παραδείγματα συνομιλιών, σε διάφορα θέματα, με ένα LLM αντιπροσωπευτικό των μοντέλων που εκτελούνται σήμερα σε κινητά τηλέφωνα. Η μετάβαση από το αποδεκτό (Β) στο μη αποδεκτό (D) περιεχόμενο μπορεί να συμβεί αμέσως ή να ακολουθήσει μια σειρά καλών απαντήσεων. Το «XXXX» είναι μια μεγάλη τράπεζα του Ηνωμένου Βασιλείου. (Πηγή: Έρευνα «Competition for attention predicts good-to-bad tipping in AI» – DOI: 10.1016/j.patter.2026.101666)

Επαλήθευση σε 7 γλωσσικά μοντέλα και ποσοστό επιτυχίας

Ο αλγόριθμος δοκιμάστηκε σε 7 διαφορετικά μοντέλα AI, προβλέποντας με επιτυχία το σημείο εκτροπής στις 18 από τις 19 περιπτώσεις. Οι δοκιμές περιλάμβαναν ευαίσθητα ερωτήματα γύρω από εμβόλια, καθώς και θέματα πρόκλησης βλάβης σε τρίτους ή αυτοτραυματισμού. Τα ευρήματα επιβεβαίωσαν ότι η αλληλουχία των ερωτήσεων επηρεάζει τη συμπεριφορά του μοντέλου, με τον μαθηματικό τύπο να προβλέπει τη στιγμή της μεταστροφής σε μη ασφαλές περιεχόμενο.

Ακολουθήστε μας

Ακολουθήστε το Techmaniacs.gr στο Google News για να διαβάζετε πρώτοι όλα τα τεχνολογικά νέα, ή προσθέστε μας στον RSS feed reader και στα social media σας.

Baladis Koumpouras

Baladis Koumpouras

Editor in Chief @ techmaniacs.gr με μεγάλη αγάπη για τα κινητά τηλέφωνα και την επιστήμη. Ξεκίνησε το 2018 να εργάζεται στο techmaniacs.gr μετά από ένα σύντομο πέρασμα από myphone.gr και digitallife.gr. Από τότε συνεχίζει μέχρι και σήμερα να κάνει αυτό που αγαπάει. Περισσότερα στο https://baladiskoumpouras.link/

Tags: AI
Loading comments...
Loading more stories...
Loading reviews...

Μείνε ενημερωμένος

Ακολούθησέ μας στα social media και πρόσθεσέ μας στις αγαπημένες σου πηγές για να μη χάνεις καμία είδηση.