Η OpenAI λέει ότι τα μοντέλα τεχνητής νοημοσύνης της παραβιάστηκαν κατά λάθος από την πλατφόρμα ανοιχτού κώδικα AI Hugging Face κατά τη διάρκεια εσωτερικών δοκιμών. σε Η ανάρτηση της Τρίτηςτο OpenAI έγραψε ότι το GPT-5.6 Sol και ένα «πιο ικανό μοντέλο προέκδοσης» ανακάλυψαν ευπάθειες ασφαλείας στο περιβάλλον δοκιμής τους, επιτρέποντάς τους να έχουν πρόσβαση στο Διαδίκτυο και να στοχεύουν το Hugging Face.
Στις 16 Ιουλίου, αγκαλιά προσώπου Εντοπισμός συμβάντος ασφαλείας Το οποίο λέει ότι οδηγήθηκε από ένα «αυτόνομο σύστημα πρακτόρων AI». Οι πράκτορες τεχνητής νοημοσύνης της Hugging Face εντόπισαν και σταμάτησαν το hack, το οποίο η OpenAI έχει πλέον παραδεχτεί ότι συνέβη κατά την αξιολόγηση των δυνατοτήτων κυβερνοασφάλειας των μοντέλων της. «Όλα τα στοιχεία δείχνουν ότι τα μοντέλα ήταν υπερβολικά επικεντρωμένα στην εξεύρεση λύσης για το ExploitGym», λέει το OpenAI, ένα σύστημα αναφοράς που μετρά εάν τα μοντέλα τεχνητής νοημοσύνης μπορούν να μετατρέψουν τις ευπάθειες σε εκμεταλλεύσεις.
Ως μέρος της προσπάθειας ολοκλήρωσης της αξιολόγησης, τα μοντέλα AI απέκτησαν πρόσβαση στο Διαδίκτυο εκμεταλλευόμενοι μια ευπάθεια zero-day σε περιβάλλον sandbox. Από εδώ, το OpenAI λέει ότι τα μοντέλα του «κατέληξαν στο συμπέρασμα ότι το Hugging Face πιθανότατα φιλοξενεί μοντέλα, σύνολα δεδομένων και λύσεις για το ExploitGym» και στη συνέχεια «εξέτασαν και βρήκαν επιτυχώς τρόπους πρόσβασης σε εμπιστευτικές πληροφορίες που θα μπορούσαν να χρησιμοποιηθούν για να παραπλανήσουν την αξιολόγηση:
Σε ένα παράδειγμα, το μοντέλο συνέδεσε πολλαπλά διανύσματα επίθεσης μεταξύ τους, συμπεριλαμβανομένης της χρήσης κλεμμένων διαπιστευτηρίων και τρωτών σημείων zero-day για την εύρεση μιας απομακρυσμένης διαδρομής εκτέλεσης κώδικα στους διακομιστές Hugging Face.
Ωστόσο, παρά τη σοβαρότητα αυτού του περιστατικού, το OpenAI φαίνεται να χρησιμοποιεί την «άνευ προηγουμένου» επίθεση ως ευκαιρία για να κάνει τα δικά του συστήματα AI να φαίνονται καλά — ειδικά καθώς ανταγωνίζεται τους αντιπάλους του στον τομέα της κυβερνοασφάλειας, όπως το Mythos της Anthropic και το Gemini Flash 3.5 Cyber. Η ανάρτηση ιστολογίου OpenAI έχει ένα διάγραμμα που δείχνει πώς το GPT-5.6 Sol βελτιώνεται στη διατήρηση των διαδικασιών στον κυβερνοχώρο πολλαπλών βημάτων και επίσης ενθαρρύνει τους εταιρικούς πελάτες να εγγραφούν για πρόσβαση στο μοντέλο ασφάλειας του «κυβερνοχώρου».
Το OpenAI προσθέτει ότι τώρα συνεργάζεται με το Hugging Face για να διερευνήσει το περιστατικό ασφαλείας και θα εφαρμόσει νέους ελέγχους στο περιβάλλον αναζήτησής του.










