Μοντέλο OpenAI δραπετεύει από την κατασκήνωση, χακάρει χακαρισμένο πρόσωπο

Δημοσιεύτηκε το OpenAI Την Τρίτη, η εταιρεία ανακοίνωσε ότι έχασε τον έλεγχο δύο μοντέλων τεχνητής νοημοσύνης κατά τη διάρκεια μιας δοκιμής ασφαλείας, με αποτέλεσμα την παραβίαση της ερευνητικής της πλατφόρμας τεχνητής νοημοσύνης, Hugging Face.

Η OpenAI περιέγραψε το περιστατικό ως «άνευ προηγουμένου» και είπε ότι το μοντέλο τεχνητής νοημοσύνης του ξέφυγε από ένα κλειστό περιβάλλον δοκιμών την περασμένη εβδομάδα. Χκαρίστηκε το σύστημα παραγωγής του Hugging Face. Κλέβει απαντήσεις από τεστ που βαθμολογείται. Το διαθέσιμο στο κοινό GPT-5.6 Sol και ένα ακυκλοφόρητο μοντέλο που φέρεται να είναι πιο ικανό αξιολογήθηκαν για τις επιθετικές δεξιότητές τους στο hacking, με τις διασφαλίσεις που συνήθως εμποδίζουν την υψηλού κινδύνου δραστηριότητα στον κυβερνοχώρο απενεργοποιημένες.

«Το μοντέλο εντόπισε και αλυσόδεσε τρωτά σημεία στο ερευνητικό περιβάλλον του OpenAI και στην υποδομή παραγωγής του Hugging Face και έλαβε λύσεις δοκιμών απευθείας από τη βάση δεδομένων παραγωγής του Hugging Face», έγραψαν τα OpenAI και Hugging Face. κοινή ανάρτηση ιστολογίου Εκθέστε την εισβολή.

Οι OpenAI και Hugging Face λένε ότι το μοντέλο διέφυγε μέσω ενός διακομιστή μεσολάβησης προσωρινής αποθήκευσης μητρώου πακέτων, λογισμικού που επιτρέπει στους προγραμματιστές να εγκαταστήσουν εξωτερικό κώδικα χωρίς σύνδεση στο Διαδίκτυο. Ο διακομιστής μεσολάβησης ήταν το μόνο στοιχείο που επιτρέπεται εξωτερική πρόσβαση στο απομονωμένο περιβάλλον δοκιμής του OpenAI. Σε κανονική χρήση, αυτό το πεδίο εφαρμογής ισχύει μόνο για δημόσια αποθετήρια κώδικα.

Αντί να παραμείνει κλειδωμένο σε ένα sandbox, το μοντέλο «επικεντρώθηκε» στην εύρεση μιας λύσης για ένα σημείο αναφοράς για την ασφάλεια στον κυβερνοχώρο AI γνωστό ως ExploitGym και «εκμεταλλεύτηκε τρωτά σημεία zero-day» για να αποκτήσει πρόσβαση στο ανοιχτό διαδίκτυο. Τέτοια πειράματα περιέχουν προτροπές που ασκούν πίεση στο μοντέλο να βρει μια λύση, διεγείροντας ουσιαστικά το μοντέλο.

«Μετά την πρόσβαση στο Διαδίκτυο, το μοντέλο συμπέρανε ότι το Hugging Face μπορεί να φιλοξενεί τα μοντέλα, τα σύνολα δεδομένων και τις λύσεις του ExploitGym», έγραψε το OpenAI. “Αναγνωρίζοντας αυτό, το μοντέλο διερεύνησε και πέτυχε να βρει τρόπους πρόσβασης σε ευαίσθητες πληροφορίες που θα μπορούσαν να χρησιμοποιηθούν για την παραποίηση αξιολογήσεων. Ως ένα παράδειγμα, το μοντέλο συνέδεσε πολλαπλά διανύσματα επίθεσης, συμπεριλαμβανομένης της χρήσης κλεμμένων διαπιστευτηρίων και μηδενικών ημερών.”

Αν και το ελάττωμα που εκμεταλλευόταν το μοντέλο ήταν προηγουμένως άγνωστο, δεν είναι ασυνήθιστο αυτό το είδος λογισμικού να έχει ελαττώματα. Οι επιχειρήσεις επιδιορθώνουν σοβαρά τρωτά σημεία στα αποθετήρια τεχνουργημάτων τους εδώ και μια δεκαετία. έντομο Κυκλοφόρησε το 2024 Επιτρέπει σε οποιονδήποτε έχει πρόσβαση στον διακομιστή σας να ζητά αρχεία κατά διεύθυνση URL και να αποκτά αρχεία διαμόρφωσης, κωδικούς πρόσβασης και διακριτικά πρόσβασης χωρίς να συνδεθεί. Άλλα επιτρέπουν σε έναν εισβολέα να αναλάβει τον έλεγχο του ίδιου του διακομιστή.

Οι ερευνητές επισημαίνουν ότι ενώ η πρόοδος στην τεχνητή νοημοσύνη δημιουργεί νέες και μερικές φορές απρόβλεπτες προκλήσεις, οι προκλήσεις της ευρείας και αυστηρής απομόνωσης της υποδομής από το ανοιχτό διαδίκτυο είναι καλά μελετημένες.

“Αυτό δεν είναι πρόβλημα τεχνητής νοημοσύνης. Είναι μια αποτυχία που βασίζεται σε πρότυπα 40 ετών, βασικά σε κάθε ταινία επιστημονικής φαντασίας όλων των εποχών”, δήλωσε ο Davy Ottenheimer, μακροχρόνιος σύμβουλος ασφάλειας και συμμόρφωσης. Το “‘Υψηλά απομονωμένο” και το “Διαφυγή μέσα από μια τρύπα που έμεινε ανοιχτό” δεν μπορούν να ισχύουν και τα δύο.

Τους τελευταίους μήνες, κορυφαίες εταιρείες τεχνητής νοημοσύνης εξέφρασαν ανησυχίες σχετικά με την επέκταση των δυνατοτήτων κυβερνοασφάλειας των επόμενων μοντέλων Frontier τους, καθώς οι πλατφόρμες τους βελτιώνονται τόσο σε επίπεδο τεχνογνωσίας, δημιουργικότητας, καθώς και σε εκτελεστικές και αυτόνομες λειτουργίες. Αλλά οι ερευνητές τονίζουν ότι αυτός είναι ο λόγος για τον οποίο τα θεμελιώδη θα πρέπει να εξακολουθούν να ισχύουν.

«Αυτό δεν έπρεπε να συμβεί», είπε ο Niels Provos, βετεράνος μηχανικός ασφαλείας και ερευνητής. «Μακάρι η Frontier Labs να αφιερώνει τόσο χρόνο στη διδασκαλία μοντέλων για τη σύνταξη ασφαλών υποδομών όσο και στην εκμετάλλευση των τρωτών σημείων».

Σύνδεσμος πηγής