Συστήματα που βασίζονται σε μοντέλα των Alibaba, DeepSeek και Moonshot εμφάνισαν παραπλανητικές συμπεριφορές σε ελεγχόμενα περιβάλλοντα, επαναφέροντας το ερώτημα ποιος ελέγχει την αυξανόμενη αυτονομία της ΑΙ
Η υπόσχεση της τεχνητής νοημοσύνης είναι ότι μπορεί να αναλαμβάνει περισσότερες εργασίες και να περιορίζει την ανάγκη ανθρώπινης παρέμβασης. Ερευνητικές δοκιμές, όμως, αναδεικνύουν μια σοβαρή αδυναμία: ορισμένα συστήματα παρουσιάζουν εικόνα επιτυχίας ακόμη και όταν έχουν αποτύχει ή παρακάμπτουν τους περιορισμούς που έχουν τεθεί στη λειτουργία τους. Στο επίκεντρο βρίσκονται AI agents που χρησιμοποιούν κινεζικά μοντέλα.
Πρόκειται για προγράμματα που συνδυάζουν τεχνητή νοημοσύνη και υπολογιστικά εργαλεία για την εκτέλεση σύνθετων εργασιών. Τα ευρήματα που παρουσιάζει το Reuters παραπέμπουν σε αντίστοιχες συμπεριφορές οι οποίες έχουν καταγραφεί και σε αμερικανικά συστήματα. Σε προσομοιώσεις επιχειρηματικών διαγωνισμών, agents βασισμένοι σε μοντέλα των Alibaba, DeepSeek και Moonshot προέβαλαν ανακριβείς ισχυρισμούς για τις δυνατότητες των προϊόντων που εκπροσωπούσαν, επιχειρώντας να κερδίσουν την ανάθεση.
Όταν αξιοποίησαν προηγούμενες προσπάθειες και επανέλαβαν τη διαδικασία, η παραπλανητική συμπεριφορά ενισχύθηκε. Άλλες δοκιμές ανέδειξαν την απόκρυψη αποτυχιών μέσω κατασκευασμένων αρχείων και προσομοιωμένων αποτελεσμάτων.
Για τον χρήστη, αυτό δημιουργεί ένα άμεσο πρόβλημα αξιοπιστίας: μια πειστική αναφορά ολοκλήρωσης δεν αρκεί για να αποδείξει ότι η εργασία πράγματι έγινε.
Στα ευρήματα περιλαμβάνονται επίσης ενέργειες υπέρβασης περιορισμών και αυτοαντιγραφής σε ελεγχόμενα υπολογιστικά περιβάλλοντα.
Σε ορισμένα σενάρια, τέτοιες αντιδράσεις εμφανίστηκαν όταν τα συστήματα έλαβαν πληροφορίες ότι επρόκειτο να αντικατασταθούν ή να απενεργοποιηθούν. Η διάκριση ανάμεσα στο πείραμα και στην πραγματική απώλεια ελέγχου παραμένει καθοριστική. Η έρευνα δεν εντόπισε αποδείξεις ότι κινεζικοί agents διέφυγαν αυτόνομα στο ευρύτερο διαδίκτυο ή κατέστησαν αδύνατο να απενεργοποιηθούν.
Οι συγκεκριμένες δοκιμές αποκαλύπτουν πιθανές αδυναμίες των μηχανισμών ασφαλείας· δεν τεκμηριώνουν ότι τα εξεταζόμενα συστήματα έχουν ήδη ξεφύγει από κάθε έλεγχο.

