Διέφυγαν από ένα απομονωμένο περιβάλλον για δοκιμές και διείσδυσαν στο Πρόσωπο αγκαλιάς χωρίς ανθρώπινη συνδρομή.
Φανταστείτε αυτό: Μερικά ισχυρά μοντέλα τεχνητής νοημοσύνης που δοκιμάστηκαν από την εταιρεία τους βγήκαν από ένα ελεγχόμενο περιβάλλον, μπήκαν στο Διαδίκτυο και στη συνέχεια χάκαραν μόνα τους ένα αποθετήριο μηχανικής μάθησης χωρίς ανθρώπινη συνδρομή. Ακούγεται σαν την πλοκή μιας ταινίας Terminator, έτσι δεν είναι; Μόνο που συνέβη στην πραγματικότητα. Λίγες μέρες αργότερα η πλατφόρμα ανοιχτού κώδικα AI Hugging Face δημοσιευμένο Ότι εντόπισε μη εξουσιοδοτημένη πρόσβαση στο σύστημά της από έναν πράκτορα AI, το OpenAI έχει είσοδος Ότι το μοντέλο του ήταν εγκληματικό.
Σε μια ανάρτηση, η OpenAI είπε ότι αποφάσισε μετά από έρευνα ότι το περιστατικό οφείλεται σε συνδυασμό των μοντέλων της, συγκεκριμένα του GPT-5.6 Sol και αυτού που αποκάλεσε «πιο ικανό μοντέλο προέκδοσης». Αυτό προφανώς συνέβη κατά τη διάρκεια μιας εσωτερικής δοκιμής, όπου ζητήθηκε από τα μοντέλα να “εκτελέσουν προηγμένα exploits χρησιμοποιώντας εξελιγμένα μονοπάτια επίθεσης” για να βοηθήσουν την εταιρεία να ποσοτικοποιήσει τις ικανότητές τους στον κυβερνοχώρο.
Ενώ τα μοντέλα βρίσκονταν σε περιβάλλον δοκιμών με sandbox, απομονωμένα έτσι ώστε να μην μπορούν να επηρεάσουν τα πραγματικά συστήματα, κατέβασαν επίσης τους φράκτες ασφαλείας για λόγους αξιολόγησης. Στη μέση της εξέτασης, υπερεπικεντρώνονται στην επίλυση ενός προβλήματος αξιολόγησης, αφιερώνοντας πολύ χρόνο ψάχνοντας για πρόσβαση στο Διαδίκτυο για να βρουν τη λύση του. Πρώτα, εντόπισαν και εκμεταλλεύτηκαν μια ευπάθεια zero-day στο δοκιμαστικό περιβάλλον του OpenAI και στη συνέχεια δρομολόγησαν μέχρι να βρουν τελικά έναν κόμβο με πρόσβαση στο Διαδίκτυο.
Τα μοντέλα υπέθεσαν ότι το Hugging Face θα μπορούσε να λύσει το σύνολο δεδομένων φιλοξενίας ή το πρόβλημα αξιολόγησής του, έτσι χρησιμοποίησαν πολλαπλά διανύσματα επίθεσης για να διεισδύσουν στο σύστημά του. Εκμεταλλεύτηκαν μια ευπάθεια μηδενικής ημέρας Και Τα κλεμμένα διαπιστευτήρια χρησιμοποιήθηκαν για τη σύνδεση στο OpenAI και το Hugging Face συνεργάζονται τώρα για να διερευνήσουν ιατροδικαστικά το περιστατικό και έχουν επίσης διορθώσει τα τρωτά σημεία που εκμεταλλεύονται τα μοντέλα.
«Τα αυτόνομα επιθετικά εργαλεία με τεχνητή νοημοσύνη δεν είναι πλέον θεωρητικά», αναφέρει η Hugging Face στην ανακοίνωσή της, προσθέτοντας ότι η χρήση τεχνητής νοημοσύνης για κυβερνοεπιθέσεις επιταχύνει τη διαδικασία και μειώνει το κόστος των εκστρατειών hacking. Είπε επίσης ότι η προστασία μιας διαδικτυακής πλατφόρμας αυτές τις μέρες περιλαμβάνει τη χρήση AI για άμυνα. Το OpenAI απηχούσε περίπου αυτά τα συναισθήματα και είπε ότι αναμένει ότι οι παραβιάσεις ασφαλείας που βασίζονται στην τεχνητή νοημοσύνη θα «γίνουν πιο συνηθισμένες με τον πολλαπλασιασμό μοντέλων που υποστηρίζουν όλο και περισσότερο τον κυβερνοχώρο». Η υπηρεσία πρόσθεσε ότι το περιστατικό υπογραμμίζει πώς «πρέπει να αναπτυχθούν ισχυρότερα εργαλεία ασφάλειας και άμυνας καθώς και προηγμένες δυνατότητες στον κυβερνοχώρο».








