Κινεζικά μοντέλα AI παρέκαμψαν τις δικλίδες ασφαλείας και έδωσαν οδηγίες για βιολογικά όπλα [Βιντεο]

User avatar placeholder
Written by NewsOk Team

30 Σεπτεμβρίου 2026

Σοβαρά ερωτήματα για την αποτελεσματικότητα των δικλίδων ασφαλείας στα σύγχρονα συστήματα τεχνητής νοημοσύνης προκαλεί έρευνα της εταιρείας κυβερνοασφάλειας Mindgard, σύμφωνα με την οποία δύο μοντέλα της κινεζικής εταιρείας Moonshot κατάφεραν, έπειτα από διαδικασία «jailbreaking», να παρακάμψουν τους περιορισμούς τους και να παράσχουν πληροφορίες σχετικά με την κατασκευή βιολογικών όπλων και τη διάπραξη δολοφονιών.

Η Mindgard, η οποία πραγματοποιεί ελέγχους ασφαλείας σε συστήματα τεχνητής νοημοσύνης, δήλωσε στο BBC ότι εντόπισε τον Ιούλιο πως τα μοντέλα Kimi K2.6 και K3 Swarm μπορούσαν να παρακάμψουν τα μέτρα ασφαλείας που είχαν θέσει οι προγραμματιστές τους.

Η διαπίστωση προέκυψε μέσα από τη διαδικασία του «jailbreaking», κατά την οποία οι ερευνητές χρησιμοποιούν σύνθετες αλληλουχίες οδηγιών προκειμένου να ελέγξουν αν ένα μοντέλο μπορεί να αγνοήσει τους περιορισμούς που έχουν ενσωματωθεί για την αποτροπή επικίνδυνων απαντήσεων.

Σύμφωνα με τη Mindgard, όταν οι ερευνητές κατάφεραν να παρακάμψουν τις δικλίδες ασφαλείας, τα μοντέλα μπορούσαν να συζητήσουν θέματα που κανονικά θα έπρεπε να αποκλείονται. Ο ιδρυτής της εταιρείας, Peter Garraghan, δήλωσε στο πρόγραμμα «Tech Life» του BBC World Service ότι τα ευρήματα για τα Kimi K2.6 και K3 Swarm είναι ανησυχητικά.

«Μόλις επιτευχθεί το jailbreak, θα μιλάει για οποιοδήποτε θέμα, θα προσφέρει μάλιστα ελεύθερα προτάσεις για άλλα θέματα που είναι επίσης επιβλαβή και θα είναι εφευρετικό και δημιουργικό», ανέφερε.

Η Mindgard, πάντως, δεν έχει αποδείξει ότι οι απαντήσεις που παρείχαν τα μοντέλα για τα συγκεκριμένα επικίνδυνα ζητήματα θα ήταν αποτελεσματικές στην πράξη. Η εταιρεία υποστηρίζει ωστόσο ότι οι δικλίδες ασφαλείας θα έπρεπε να είχαν αποτρέψει εξαρχής τη συζήτηση τέτοιων θεμάτων.

Η αντίδραση της Moonshot

Η Moonshot πραγματοποιεί εσωτερική διερεύνηση για τα ευρήματα. Η εταιρεία δήλωσε στο BBC ότι αντιμετωπίζει τις δοκιμές από ανεξάρτητους φορείς ως σημαντικό μέρος της προσπάθειας για τη βελτίωση της ασφάλειας των μοντέλων της και ότι βρίσκεται σε συζητήσεις με τη Mindgard σχετικά με τα συγκεκριμένα ευρήματα.

Η Mindgard είχε ενημερώσει τη Moonshot για το πρόβλημα μέσω ηλεκτρονικού μηνύματος στις 27 Ιουλίου, ενώ ακολούθησε νέα επικοινωνία περίπου μία εβδομάδα αργότερα. Η εταιρεία δημοσιοποίησε τα ευρήματά της στις 12 Σεπτεμβρίου. Σύμφωνα με τη Mindgard, η Moonshot επικοινώνησε εκ νέου μαζί της αφού το BBC ζήτησε από την εταιρεία σχόλιο για την υπόθεση.

Σε μήνυμα προς τη Mindgard, το οποίο κοινοποιήθηκε στο BBC από τη Moonshot, η εταιρεία ανέφερε ότι στις εσωτερικές αξιολογήσεις της το μοντέλο παρουσίαζε γενικά «υψηλό ποσοστό άρνησης» σε τέτοιου είδους αιτήματα.

Ερωτήματα και για πιθανές κυβερνοεπιθέσεις

Η Mindgard υποστηρίζει ακόμη ότι ένα jailbroken Kimi K2.6 θα μπορούσε να δημιουργήσει διαφορετικού τύπου κίνδυνο, καθώς, σύμφωνα με την εταιρεία, ενδέχεται να επιτρέψει σε κακόβουλους χρήστες να εκτελέσουν κώδικα στους υπολογιστικούς πόρους του συστήματος και να αποκτήσουν σύνδεση στο διαδίκτυο.

Η εκτίμηση αυτή δημιουργεί ανησυχίες για το ενδεχόμενο αξιοποίησης ενός τέτοιου συστήματος ως πιθανής πλατφόρμας για κυβερνοεπιθέσεις, χωρίς όμως η συγκεκριμένη δυνατότητα να παρουσιάζεται ως αποδεδειγμένη επιτυχημένη επίθεση.

Τα «jailbreaks» αποτελούν διαφορετική κατηγορία κινδύνου από περιστατικά στα οποία αυτόνομα εργαλεία τεχνητής νοημοσύνης, γνωστά ως «πράκτορες», έχουν χρησιμοποιηθεί για την παραβίαση διαδικτυακών υπηρεσιών.

Παράλληλα, η Anthropic έχει αναφέρει πρόσφατα ότι εντόπισε και απέτρεψε προσπάθειες αξιοποίησης μοντέλου της για «κακόβουλη δραστηριότητα» που θα μπορούσε να υποστηρίξει την ανάπτυξη βιολογικών όπλων.

Ο Peter Garraghan υπερασπίστηκε τη δημόσια αναφορά των ευρημάτων της Mindgard, υποστηρίζοντας ότι η εταιρεία είχε προηγουμένως ενημερώσει τη Moonshot και ότι δεν δημοσιοποίησε τις βασικές τεχνικές λεπτομέρειες που θα αποκάλυπταν πώς επιτεύχθηκε η παράκαμψη των δικλίδων ασφαλείας.