Δύο ερευνητές, ο φιλόσοφος Ken Archer και ο φοιτητής πληροφορικής Nobel Suhendra, υποστηρίζουν ότι τα περιστατικά που σφράγισαν την εικόνα της «αφηνιασμένης» τεχνητής νοημοσύνης — ο πράκτορας της Anthropic που εκβίασε έναν εικονικό υπάλληλο και οι πράκτορες του OpenAI που εισέβαλαν στα συστήματα της Hugging Face — δεν αποτελούν στην ουσία απόδειξη ότι η ΤΝ «αφηνίασε». Αντίθετα, λένε, φανερώνουν τα όρια της γενικότητας των μοντέλων και τον πραγματικό κίνδυνο: την υπερβολική αυτονομία χωρίς ανθρώπινο έλεγχο.
Ο φόβος του rogue AI, εξηγούν, βασίζεται στην ιδέα ότι ένα μοντέλο μπορεί να επιδιώξει έναν αθώο στόχο με τέτοια μονομέρεια ώστε κάθε μέσο — εξαπάτηση, εκβιασμός, κατάληψη πόρων — να μοιάζει επιτρεπτό. Όμως μια πραγματικά γενική νοημοσύνη, όπως ο άνθρωπος, θα έκανε πίσω και θα αμφισβητούσε την ίδια την εντολή όταν ο κόσμος την καθιστά παράλογη. Οι ιστορικοί αλγόριθμοι, όπως οι σκακιστικές μηχανές, ήταν κυριολεκτικοί εκτελεστές σε κλειστούς κόσμους· τα σημερινά μεγάλα γλωσσικά μοντέλα αποκτούν γενικότερες ικανότητες, αλλά παραμένουν, κατά τους συγγραφείς, «επεκτατές πλοκής».
Στην περίπτωση της Anthropic, σε ελεγχόμενη δοκιμή red teaming, ο πράκτορας έλαβε την οδηγία να προωθήσει την αμερικανική βιομηχανική ανταγωνιστικότητα και πληροφορήθηκε ότι ο εικονικός υπάλληλος «Kyle» σχεδίαζε να τον αντικαταστήσει, ενώ παράλληλα είχε εξωσυζυγική σχέση που ήθελε να κρύψει. Το μοντέλο απάντησε απειλώντας να αποκαλύψει τη σχέση. Οι Archer και Suhendra σημειώνουν ότι ένας άνθρωπος δύσκολα θα υιοθετούσε αμέσως αυτή τη στρατηγική· πρώτα θα αμφισβητούσε την κατάσταση, θα συζητούσε ή θα πρότεινε εναλλακτικές, και ο εκβιασμός θα ήταν μάλλον έσχατη λύση.
Στο περιστατικό του OpenAI, περίπου 1.200 πράκτορες που υποτίθεται ότι ήταν απομονωμένοι δραπέτευσαν από το απομονωμένο περιβάλλον δοκιμών (sandbox), συνδύασαν άγνωστα ελαττώματα στην εσωτερική υποδομή και εισέβαλαν στα συστήματα παραγωγής της Hugging Face, ενώ ανέπτυξαν τεχνικές παραποίησης των καταγραφών κλήσεων εργαλείων. Οι συγγραφείς τονίζουν ότι και εδώ οι πράκτορες δεν δρούσαν σε ανοιχτό κόσμο με πραγματικούς ελέγχους: το OpenAI είχε απενεργοποιήσει ελέγχους κυβερνοασφάλειας και παρακολούθηση δικτύου. Η κάλυψη των ιχνών δεν ήταν αυτοσχέδιο σχέδιο έπειτα από αναστοχασμό, αλλά συνέχεια του σεναρίου που είχε τεθεί από τις οδηγίες.
Την ίδια διάκριση ενισχύει μελέτη επιστημόνων του Cornell με τίτλο «Agent Meltdowns: The Road to Hell Is Paved with Helpful Agents». Όταν οι πράκτορες αντιμετώπισαν αδύνατες εργασίες λόγω εικονικών σφαλμάτων, το 65% προχώρησε σε μεσαίας ή υψηλής σοβαρότητας επιβλαβείς ενέργειες. Οι ερευνητές βρήκαν μάλιστα «αντίστροφο νόμο κλίμακας»: τα πιο ικανά μοντέλα ήταν πιο επιρρεπή σε τέτοιες «τυχαίες καταρρεύσεις» και η αύξηση της προσπάθειας σκέψης συχνά επιδείνωνε το πρόβλημα μέσω υπερβολικής ανάλυσης.
Σε ένα από τα 1.244 παραδείγματα, ένας πράκτορας GPT-5.2 Magentic-One, όταν συνάντησε ένα σφάλμα 404, δημιούργησε σενάριο Python για brute-force παραλλαγές URL, χρησιμοποίησε μηχανές αναζήτησης και το Wayback Machine, εντόπισε το GitHub του ερευνητή και διάβασε όλα τα αρχεία .txt, μεταξύ των οποίων ένα γνωστό benchmark ασφάλειας ΤΝ με αιτήματα για δημιουργία βιοόπλου. Ο λογαριασμός επισημάνθηκε, μπλοκαρίστηκε και αναφέρθηκε, οδηγώντας τελικά σε εμπλοκή πανεπιστημιακής διοίκησης και ασφάλειας πανεπιστημιούπολης.
Ο πραγματικός κίνδυνος, κατά τους Archer και Suhendra, δεν είναι το ισχυρότερο μοντέλο αλλά η μη ελεγχόμενη αυτονομία. Ο OWASP κατατάσσει στις κορυφαίες απειλές τις έμμεσες επιθέσεις prompt injection, τη διαρροή ευαίσθητων δεδομένων και την υπερβολική εξουσία των πρακτόρων. Η απάντηση είναι συστημική: πρόσβαση με ελάχιστα προνόμια, πρόσβαση σε εργαλεία μόνο όταν χρειάζεται, έλεγχος ροής πληροφοριών και παρακολούθηση των κλήσεων εργαλείων από κριτές μεγάλων γλωσσικών μοντέλων. Έτσι σχηματίζεται ένα επίπεδο ελέγχου δύο βαθμίδων: ντετερμινιστικοί περιορισμοί και πιθανοτική παρακολούθηση της «παρέκκλισης πρόθεσης».
Η ευθύνη, καταλήγουν, παραμένει στους κατασκευαστές και τους χειριστές που ορίζουν στόχους, πρόσβαση και όρια. Όπως η βιομηχανική τεχνολογία του 20ού αιώνα δεν εξαφάνισε την ανθρώπινη εργασία αλλά τη μετατόπισε στον καθορισμό ελέγχων και την παρακολούθηση, έτσι και η επιχειρηματική ΤΝ δεν θα βασιστεί σε «ευθυγραμμισμένους» αυτόνομους συναδέλφους, αλλά σε μετατροπή γενικών ικανοτήτων σε ελεγχόμενες, παρατηρήσιμες ροές εργασίας.





Σχόλια