Νέα μοντέλα Claude για coding, έρευνα και agentic εργασίες με φθηνότερο prompt caching
Η Anthropic παρουσίασε την 1η Σεπτεμβρίου τα Claude Fable 5.1 και Claude Mythos 5.1, μια νέα έκδοση της κορυφαίας οικογένειας μοντέλων της που επικεντρώνεται στο coding, στη σύνθετη εργασία γνώσης, στην επιστημονική έρευνα και κυρίως σε εργασίες που εκτελούνται από AI agents για μεγάλο χρονικό διάστημα. Η κυκλοφορία δεν περιορίζεται σε μια ακόμη αύξηση επιδόσεων. Το πιο ενδιαφέρον στοιχείο είναι ότι αλλάζει ταυτόχρονα η οικονομία της χρήσης του μοντέλου, η αρχιτεκτονική των safeguards και ο τρόπος με τον οποίο διαχωρίζονται οι δυνατότητες γενικής χρήσης από τις δυνατότητες που προορίζονται για ελεγμένους οργανισμούς.
Το Claude Fable 5.1 είναι το μοντέλο γενικής διάθεσης, ενώ το Claude Mythos 5.1 απευθύνεται σε περιορισμένο αριθμό vetted οργανισμών που δραστηριοποιούνται κυρίως στην κυβερνοασφάλεια και στις βιοεπιστήμες. Τα δύο μοντέλα βασίζονται στο ίδιο υποκείμενο σύστημα. Η διαφορά βρίσκεται στα safeguards που εφαρμόζονται κατά τη χρήση τους και επομένως στο εύρος των εργασιών που μπορούν να εκτελέσουν χωρίς περιορισμούς ή μεταφορά του αιτήματος σε άλλο μοντέλο.
Αυτός ο διαχωρισμός έχει ιδιαίτερη σημασία για την αγορά των frontier models. Αντί να δημιουργείται ένα ενιαίο ισχυρό μοντέλο με τις ίδιες δυνατότητες για όλους, διαμορφώνεται ένα μοντέλο πρόσβασης στο οποίο η ίδια βασική τεχνολογία μπορεί να λειτουργεί διαφορετικά ανάλογα με το επίπεδο εμπιστοσύνης, τον οργανισμό και το είδος της εργασίας.
Το Fable 5.1 στοχεύει σε εργασίες που διαρκούν ώρες ή ημέρες
Η βασική κατεύθυνση του Claude Fable 5.1 είναι οι μεγάλες, πολυσταδιακές εργασίες. Πρόκειται για σενάρια όπου ένα μοντέλο δεν καλείται απλώς να απαντήσει σε ένα prompt, αλλά πρέπει να σχεδιάσει μια διαδικασία, να χρησιμοποιήσει εργαλεία, να διαβάσει μεγάλο όγκο δεδομένων, να ελέγξει τα αποτελέσματά του και να επανέλθει όταν κάποιο βήμα αποτύχει.
Στο software engineering αυτό μπορεί να σημαίνει αλλαγές που επηρεάζουν ολόκληρο codebase, code review, debugging, performance optimization και αυτόνομες συνεδρίες που διαρκούν πολλές ώρες. Σε εταιρικές ροές εργασίας μπορεί να σημαίνει έρευνα σε μεγάλο αριθμό εγγράφων, συνδυασμό δεδομένων από διαφορετικές εφαρμογές και παραγωγή ολοκληρωμένων παραδοτέων χωρίς συνεχή επίβλεψη.
Αυτό ακριβώς είναι το πεδίο όπου το κόστος των μοντέλων αρχίζει να γίνεται πιο περίπλοκο από μια απλή σύγκριση τιμής ανά εκατομμύριο tokens. Ένας agent που λειτουργεί επί ώρες μπορεί να διαβάζει ξανά και ξανά το ίδιο context, οδηγίες, αρχεία, ιστορικό συζήτησης και δεδομένα εργαλείων. Όσο αυξάνεται η διάρκεια της εργασίας, το repeated context μπορεί να αποτελέσει σημαντικό μέρος του συνολικού inference bill.
Η μεγάλη αλλαγή βρίσκεται στο prompt caching
Η βασική τιμή του Claude Fable 5.1 παραμένει στα 10 δολάρια ανά εκατομμύριο input tokens και στα 50 δολάρια ανά εκατομμύριο output tokens. Η ουσιαστική αλλαγή αφορά τα cache reads, δηλαδή την ανάγνωση περιεχομένου που έχει ήδη επεξεργαστεί και αποθηκευτεί προσωρινά ώστε να μη χρεώνεται ξανά με τον ίδιο τρόπο σε κάθε επανάληψη.
Το κόστος των cache reads μειώνεται στα 0,25 δολάρια ανά εκατομμύριο tokens, δηλαδή κατά 75% σε σχέση με το Fable 5. Η διαφορά αυτή μπορεί να μειώσει το συνολικό κόστος μιας τυπικής εργασίας περίπου κατά 25%, ενώ σε ιδιαίτερα agentic workloads η εξοικονόμηση μπορεί να πλησιάσει το 45%.
Η αλλαγή είναι σημαντική επειδή χτυπά ένα από τα ακριβότερα χαρακτηριστικά των persistent agents. Ένα agentic σύστημα μπορεί να χρειάζεται να κρατά ενεργό μεγάλο context για μεγάλο χρονικό διάστημα, να επιστρέφει σε προηγούμενα δεδομένα και να επαναχρησιμοποιεί κοινές οδηγίες ή repositories. Σε τέτοιες περιπτώσεις, η τιμή του cached input επηρεάζει το τελικό κόστος περισσότερο από όσο φαίνεται σε ένα απλό chatbot session.
Η Anthropic ουσιαστικά μετακινεί τον ανταγωνισμό από την τιμή του μεμονωμένου prompt στο κόστος ολοκλήρωσης μιας ολόκληρης εργασίας. Για επιχειρήσεις που αξιολογούν AI agents σε πραγματικές παραγωγικές διαδικασίες, αυτή είναι συχνά πιο χρήσιμη μέτρηση από το κόστος ενός εκατομμυρίου tokens.
Μεγάλη άνοδος σε coding και agentic benchmarks
Τα δημοσιευμένα αποτελέσματα δείχνουν σημαντική βελτίωση σε benchmarks που προσεγγίζουν πιο σύνθετες εργασίες από τα κλασικά τεστ ερωτήσεων και απαντήσεων. Στο Terminal-Bench-Science 0.1, το Fable 5.1 φτάνει το 52,6%, έναντι 24,7% για το Fable 5. Στο Terminal-Bench 4.0, που αξιολογεί agentic coding σε περιβάλλον terminal, το Fable 5.1 φτάνει το 55,8%, ενώ η έκδοση Mythos 5.1 φτάνει το 60,9%. Το Fable 5 είχε καταγράψει 42%.
Βελτιώσεις εμφανίζονται επίσης σε δοκιμές knowledge work, computer use, multidisciplinary reasoning και επιχειρησιακής αυτοματοποίησης. Η κατεύθυνση είναι σαφής: η νέα έκδοση έχει σχεδιαστεί όχι μόνο για καλύτερες μεμονωμένες απαντήσεις, αλλά για διατήρηση της ποιότητας σε μεγαλύτερες ακολουθίες ενεργειών.
Αυτό είναι κρίσιμο για τα AI agents, επειδή η συνολική αξιοπιστία μιας εργασίας μειώνεται όταν κάθε επιμέρους βήμα έχει πιθανότητα σφάλματος. Ένα μοντέλο που είναι ελαφρώς καλύτερο σε ένα isolated task μπορεί να είναι πολύ καλύτερο σε μια διαδικασία 20 ή 50 διαδοχικών βημάτων, εφόσον αποτυγχάνει λιγότερο συχνά, εντοπίζει τα λάθη του και επαναφέρει σωστά τη ροή εργασίας.
Fable και Mythos: ίδιο μοντέλο, διαφορετικά όρια
Το Claude Mythos 5.1 είναι η πιο χαρακτηριστική πλευρά της νέας στρατηγικής. Δεν αποτελεί διαφορετική αρχιτεκτονική από το Fable 5.1, αλλά έκδοση με διαφορετικό επίπεδο safeguards για εξειδικευμένη εργασία υψηλότερου κινδύνου.
Η πρόσβαση παραμένει περιορισμένη σε vetted cyberdefenders και ερευνητές βιοεπιστημών. Στις βιοεπιστήμες λειτουργεί πρόγραμμα επαλήθευσης με μειωμένους περιορισμούς για προηγμένη έρευνα, ενώ στην κυβερνοασφάλεια η πρόσβαση στα Mythos models συνδέεται με trusted access προγράμματα για αμυντικές χρήσεις.
Το Fable 5.1, παρότι γενικά διαθέσιμο, έχει πλέον πιο ακριβή safeguards. Μπορεί να χρησιμοποιηθεί για εντοπισμό vulnerabilities σε source code, αλλά εξακολουθεί να περιορίζει εργασίες όπως exploit generation, penetration testing και binary-based vulnerability scanning. Σε ορισμένα αιτήματα κυβερνοασφάλειας ή βιολογίας, το σύστημα μπορεί να μεταφέρει την εργασία σε λιγότερο ικανό ή διαφορετικά περιορισμένο μοντέλο.
Η λογική αυτή προσπαθεί να μειώσει ένα από τα βασικά προβλήματα των ισχυρών safeguards, τα false positives. Όταν ένα ασφαλές αίτημα μπλοκάρεται επειδή μοιάζει με επικίνδυνο, το μοντέλο χάνει πρακτική αξία για νόμιμους επαγγελματίες. Τα νέα cybersecurity safeguards παράγουν περίπου 60% λιγότερα benign false positives. Στη βιολογία, οι παρεμβάσεις σε αβλαβή αιτήματα είναι κατά 85% λιγότερες σε σχέση με τα αρχικά safeguards του Fable 5.
Η ασφάλεια γίνεται χαρακτηριστικό προϊόντος
Η εξέλιξη δείχνει ότι τα safeguards δεν αντιμετωπίζονται πλέον μόνο ως ένα εξωτερικό φίλτρο γύρω από το μοντέλο. Επηρεάζουν άμεσα την απόδοση, τη χρηστικότητα, το κόστος και ακόμη και τα benchmarks.
Όταν ένα σύστημα ασφαλείας επεμβαίνει σε μια εργασία, μπορεί να μπλοκάρει το αίτημα, να μειώσει τις διαθέσιμες δυνατότητες ή να το δρομολογήσει σε άλλο μοντέλο. Αυτό σημαίνει ότι δύο χρήστες που θεωρητικά χρησιμοποιούν το ίδιο underlying model μπορούν να έχουν διαφορετική πραγματική εμπειρία ανάλογα με το επίπεδο πρόσβασης και το domain της εργασίας τους.
Η προσέγγιση Fable και Mythos μπορεί να αποτελέσει πρότυπο για το πώς θα διατίθενται μελλοντικά frontier capabilities. Οι πιο ισχυρές δυνατότητες δεν χρειάζεται να είναι είτε πλήρως διαθέσιμες είτε πλήρως κλειδωμένες. Μπορούν να παρέχονται σε διαφορετικά επίπεδα, με verification, ειδικούς όρους πρόσβασης και safeguards που προσαρμόζονται στο ρίσκο της συγκεκριμένης χρήσης.
Νέα προσέγγιση και στο enterprise data retention
Παράλληλα αλλάζει και η διαχείριση δεδομένων για επιχειρησιακούς πελάτες. Η χρήση του Fable 5.1 συνοδεύεται από προεπιλεγμένη περίοδο διατήρησης δεδομένων 30 ημερών για safety monitoring. Για επιλέξιμους enterprise πελάτες δημιουργείται όμως ένα διαφορετικό μοντέλο μέσω των Enterprise Frontier Safeguards.
Σε αυτή την αρχιτεκτονική, τα δεδομένα μπορούν να παραμένουν σε cloud infrastructure που ελέγχεται από τον ίδιο τον πελάτη, ενώ η ανθρώπινη αξιολόγηση γίνεται κατά προτεραιότητα από τον οργανισμό και όχι από τον πάροχο του μοντέλου. Μέχρι να ολοκληρωθεί η διάθεση της υποδομής, επιλέξιμοι πελάτες μπορούν να χρησιμοποιούν το Fable 5.1 με zero data retention.
Για μεγάλους οργανισμούς, αυτή η αλλαγή μπορεί να είναι εξίσου σημαντική με την επίδοση του μοντέλου. Η υιοθέτηση frontier AI σε κώδικα, οικονομικά δεδομένα, νομικά έγγραφα ή εσωτερικές επιχειρησιακές διαδικασίες εξαρτάται όχι μόνο από την ποιότητα της απάντησης, αλλά και από το πού αποθηκεύονται τα δεδομένα και ποιος μπορεί να έχει πρόσβαση σε αυτά.
Ο πραγματικός ανταγωνισμός μεταφέρεται στο κόστος ανά ολοκληρωμένη εργασία
Το Claude Fable 5.1 και το Mythos 5.1 δείχνουν πώς αλλάζει η αγορά των κορυφαίων AI μοντέλων. Η σύγκριση δεν γίνεται πλέον μόνο με βάση ένα benchmark ή την τιμή εισόδου και εξόδου. Για τα agentic systems, μεγαλύτερη σημασία αποκτούν η διάρκεια της εργασίας, η κατανάλωση context, η επαναχρησιμοποίηση cached δεδομένων, η αξιοπιστία σε πολλά διαδοχικά βήματα και το ποσοστό των αιτημάτων που περιορίζονται από safeguards.
Η μείωση κατά 75% στο κόστος των cache reads είναι επομένως κάτι περισσότερο από μια μικρή αλλαγή τιμοκαταλόγου. Είναι μια κίνηση σχεδιασμένη για την εποχή των persistent AI agents, όπου το μοντέλο μπορεί να εργάζεται επί ώρες, να επανέρχεται σε μεγάλα repositories και να εκτελεί δεκάδες ή εκατοντάδες ενέργειες πριν ολοκληρώσει ένα project.
Ταυτόχρονα, ο διαχωρισμός μεταξύ Fable και Mythos δημιουργεί μια νέα μορφή προϊόντος για frontier AI. Η ίδια υποκείμενη νοημοσύνη μπορεί να προσφέρεται μαζικά με αυστηρότερα όρια και παράλληλα να ανοίγει περισσότερο για ελεγμένους επαγγελματίες σε κρίσιμους τομείς.
Αν αυτή η προσέγγιση αποδειχθεί λειτουργική, το επόμενο στάδιο του ανταγωνισμού δεν θα κριθεί μόνο στο ποιο μοντέλο είναι πιο έξυπνο. Θα κριθεί στο ποιο μοντέλο μπορεί να ολοκληρώνει πολύωρη πραγματική εργασία με χαμηλότερο συνολικό κόστος, καλύτερη αξιοπιστία, πιο ακριβή safeguards και αρκετή ευελιξία ώστε να χρησιμοποιείται σε παραγωγικά συστήματα χωρίς να περιορίζει υπερβολικά τους νόμιμους χρήστες.













