Η Anthropic ζήτησε συγγνώμη για τον κρυφό στραγγαλισμό του νέου της μοντέλου AI, Claude Fable 5, με κρυφά προστατευτικά κιγκλιδώματα που υπονομεύουν τους ερευνητές και τους ανταγωνιστές που το χρησιμοποιούν για την ανάπτυξη ανταγωνιστικών συστημάτων. Η εταιρεία λέει ότι αντιστρέφει την πορεία της και θα είναι πιο διαφανής σχετικά με το πότε θα ξεκινήσουν οι περιορισμοί, ακόμα κι αν αυτό σημαίνει ότι η Fable απορρίπτει περαιτέρω έρευνες.
Το Fable είναι το πρώτο ευρέως διαθέσιμο μοντέλο στην κατηγορία συστημάτων τεχνητής νοημοσύνης Mythos της Anthropic, μια ομάδα που η εταιρεία έχει περάσει μήνες προειδοποιώντας ότι είναι πολύ επικίνδυνο για να κυκλοφορήσει στο κοινό. Η Anthropic λέει ότι έχει αντιμετωπίσει μερικούς από αυτούς τους κινδύνους λανσάροντας το Fable με διασφαλίσεις που την εμποδίζουν να ανταποκριθεί σε ορισμένες ερωτήσεις «υψηλού κινδύνου». Μία από τις ανθρωπικές περιοχές Είπε Αυτό που θα περιόριζε τις απαντήσεις του Fable είναι η απόσταξη, μια τεχνική για την εκπαίδευση μικρότερων μοντέλων τεχνητής νοημοσύνης χρησιμοποιώντας την έξοδο μεγαλύτερων μοντέλων.
σε Κάρτα συστήματος Fable – Ένα δημόσιο έγγραφο που κυκλοφόρησε από τους προγραμματιστές της τεχνητής νοημοσύνης για να εξηγήσει πώς λειτουργεί το σύστημα – Η Anthropic είπε ότι θα χειριστεί ερωτήματα που πιστεύει ότι αποτελούν απόπειρες απόσταξης αλλάζοντας απευθείας και υποβαθμίζοντας τις απαντήσεις του μοντέλου. Οι χρήστες δεν θα ειδοποιηθούν ότι έχουν ενεργοποιήσει την ενέργεια ασφαλείας ή ότι έχουν ενημερώσει ότι οι απαντήσεις έχουν αλλάξει.
Ανθρωπικό Είπε Τώρα αλλάζει την προσέγγισή της στην απόσταξη: Τα ερωτήματα θα επιστρέψουν τώρα στο Claude Opus 4.8, το προηγούμενο μοντέλο ναυαρχίδα της Anthropic, είπε η εταιρεία σε μια ανάρτηση στο X. Η Anthropic θα λέει επίσης ευδιάκριτα στους χρήστες: “Θα το βλέπετε αυτό κάθε φορά που συμβαίνει αυτό.”
Αυτό είναι παρόμοιο με τον τρόπο με τον οποίο το Fable χειρίζεται ερωτήματα σε άλλες περιοχές υψηλού κινδύνου. Όταν οι λειτουργίες ασφαλείας είναι ενεργοποιημένες σε τομείς όπως η βιολογία, η χημεία και η ασφάλεια στον κυβερνοχώρο, τα ερωτήματα δρομολογούνται μέσω του Opus 4.8, εκτός εάν αποκλείονται πλήρως από τους ευρύτερους κανόνες ασφαλείας της εταιρείας, όπως αυτοί που καλύπτουν φάρμακα, όπλα ή άλλο απαγορευμένο περιεχόμενο. Σε ορισμένες περιπτώσεις, ιδιαίτερα στη βιολογία, οι εγγυήσεις έχουν βαθμονομηθεί τόσο ευρέως που το Fable είναι πρακτικά άχρηστο ακόμη και για βασικά ερωτήματα, κάτι που ο Anthropic αναγνώρισε σε ένα σχόλιο στο Ακρη.
«Οι οπτικές εγγυήσεις είναι επαληθεύσιμες, επομένως πρέπει να είναι ισχυρές, κάτι που χρειάζεται πολύ χρόνο για να γίνει σωστό», έγραψε η Anthropic. “Οι αόρατες εξασφαλίσεις μπορούν να στοχευθούν πιο στενά, επιτρέποντάς μας να αποστέλλουμε γρήγορα με πολύ λίγα ψευδώς θετικά. Επιλέξαμε αόρατες εξασφαλίσεις για αυτόν τον λόγο – και αυτό ήταν λάθος ανταλλαγή. Πρέπει να έχετε μια σαφή εικόνα για το τι εξασφαλίσεις έχουμε και γιατί. Λυπούμαστε που δεν επιτύχαμε τη σωστή ισορροπία.”
Ακολουθεί αλλαγή Έντονη αντίδραση από την ερευνητική κοινότητα της AI σχετικά με την απόφαση της Anthropic να περιορίσει σιωπηλά τους χρήστες που είναι ύποπτοι ότι προσπαθούν να μετατρέψουν το Fable σε ανταγωνιστικά μοντέλα — μια προστασία που οι επικριτές προειδοποίησαν ότι θα μπορούσε επίσης να επηρεάσει τρίτα μέρη που προσπαθούν να αξιολογήσουν το μοντέλο συνόρων. Στην κάρτα παραγγελιών, η Anthropic είπε ότι η ικανότητα των νεότερων μοντέλων να επιταχύνουν την ανάπτυξη τεχνητής νοημοσύνης δικαιολογεί τη στόχευση αυτών των αιτημάτων, σημειώνοντας ότι «η χρήση του Claude για την ανάπτυξη ανταγωνιστικών μοντέλων ήδη παραβιάζει τους όρους παροχής υπηρεσιών μας». Η Anthropic έχει κατηγορήσει στο παρελθόν Κινέζους ανταγωνιστές, όπως η DeepSec, για άδικη απόσταξη των μοντέλων της σε «βιομηχανική» κλίμακα.








