Το νέο Claude Opus 5.5 στοχεύει σε agentic coding, επαγγελματικές εργασίες και μεγαλύτερη αυτονομία, με 40% χαμηλότερο λειτουργικό κόστος
Η Anthropic παρουσίασε το Claude Opus 5.5, το πρώτο μοντέλο της νέας οικογένειας Claude 5.5, επιχειρώντας να συνδυάσει υψηλότερη απόδοση σε σύνθετες εργασίες με σημαντικά χαμηλότερο κόστος λειτουργίας. Το νέο μοντέλο επικεντρώνεται ιδιαίτερα στο agentic coding, στις πολύωρες εργασίες με εργαλεία, στην επαγγελματική έρευνα και στα επιχειρηματικά workflows, ενώ παράλληλα εισάγει νέους μηχανισμούς ασφαλείας για περιπτώσεις όπου ένα AI agent λειτουργεί για μεγάλα χρονικά διαστήματα χωρίς συνεχή ανθρώπινη επίβλεψη.
Η σημαντικότερη αλλαγή ίσως δεν είναι κάποια μεμονωμένη βαθμολογία σε benchmark. Η Anthropic επιχειρεί να μειώσει το πραγματικό κόστος ολοκλήρωσης μιας εργασίας, συνδυάζοντας φθηνότερα tokens, καλύτερη αξιοποίηση του context και λιγότερα βήματα μέχρι την επίτευξη του επιθυμητού αποτελέσματος.
Σύμφωνα με τα στοιχεία της εταιρείας, το Claude Opus 5.5 κοστίζει περίπου 40% λιγότερο από το Opus 5 σε τυπικά workloads με τις προεπιλεγμένες ρυθμίσεις.
Χαμηλότερη τιμή ανά token και ακόμη μεγαλύτερη μείωση στο caching
Η νέα τιμολόγηση τοποθετεί τα input tokens στα 4 δολάρια ανά εκατομμύριο tokens και τα output tokens στα 20 δολάρια ανά εκατομμύριο. Στο προηγούμενο Opus 5 οι αντίστοιχες τιμές ήταν 5 και 25 δολάρια.
Ιδιαίτερα σημαντική είναι η αλλαγή στα cache reads, τα οποία μειώνονται από 0,50 σε 0,20 δολάρια ανά εκατομμύριο tokens. Πρόκειται για μείωση 60%, που μπορεί να έχει μεγαλύτερη πρακτική σημασία από την απλή μείωση της βασικής τιμής.
Οι σύγχρονοι coding agents και τα autonomous workflows επαναχρησιμοποιούν συνεχώς μεγάλα τμήματα context. Ένα agent μπορεί να χρειάζεται να διαβάζει ξανά αρχεία, τεχνικές προδιαγραφές, προηγούμενες αποφάσεις, logs και πληροφορίες από ένα μεγάλο repository. Επομένως, όταν μεγάλο μέρος αυτών των δεδομένων βρίσκεται σε cache, η τιμή των cache reads επηρεάζει άμεσα το συνολικό κόστος μιας πολύωρης εργασίας.
Η Anthropic υποστηρίζει επίσης ότι το Opus 5.5 παράγει output περισσότερο από 30% ταχύτερα από το Opus 5 και χρησιμοποιεί λιγότερα tokens για την ολοκλήρωση πολλών εργασιών.
Υπάρχει επιπλέον Fast mode στο Claude Code και στην Claude Platform, το οποίο προσφέρει έως 2,5 φορές μεγαλύτερη ταχύτητα, με αυξημένη όμως τιμολόγηση στα 8 δολάρια ανά εκατομμύριο input tokens και 40 δολάρια ανά εκατομμύριο output tokens.
Ισχυρή επίδοση στο agentic coding
Το coding αποτελεί έναν από τους βασικούς τομείς στους οποίους εστιάζει το Claude Opus 5.5.
Στο Terminal-Bench 4.0, ένα benchmark που εξετάζει σύνθετες επαγγελματικές εργασίες μέσα από περιβάλλον command line, το Opus 5.5 καταγράφει κορυφαία επίδοση 66,4%. Στην ίδια αξιολόγηση αναφέρονται αποτελέσματα 57,9% για το GPT-6 Astra, 55,8% για το Claude Fable 5.1, 52,3% για το Opus 5 και 37,3% για το GPT-5.6 Sol.
Στο FrontierCode v1.1 Main, το Opus 5.5 φτάνει το 54,4%, έναντι 53,3% για το GPT-6 Astra, 50,3% για το Fable 5.1, 48% για το Opus 5 και 47,5% για το GPT-5.6 Sol.
Η εικόνα είναι παρόμοια στο CursorBench 4.0, όπου το Opus 5.5 εμφανίζεται στο 57,8%, το Fable 5.1 στο 51,8%, το Opus 5 στο 46,6% και το GPT-5.6 Sol στο 41,7%.
Οι συγκρίσεις χρειάζονται πάντως προσοχή. Διαφορετικά μοντέλα μπορεί να έχουν δοκιμαστεί με διαφορετικά επίπεδα reasoning effort, διαφορετικά harnesses ή διαφορετικούς περιορισμούς. Η ίδια η Anthropic επισημαίνει ότι όσο οι δυνατότητες των κορυφαίων μοντέλων συγκλίνουν, μικρές διαφορές στα benchmarks δεν μεταφράζονται απαραίτητα σε αντίστοιχες διαφορές στην πραγματική χρήση.
Πολύωρες εργασίες πάνω σε ολόκληρα codebases
Πέρα από τις βαθμολογίες, η Anthropic δίνει ιδιαίτερη έμφαση στην ικανότητα του Opus 5.5 να διατηρεί την πορεία του σε μεγάλα tasks.
Σε δοκιμή πάνω σε codebase περίπου 200.000 γραμμών, το νέο μοντέλο ολοκλήρωσε audit και διορθώσεις σε λιγότερο από τρεις ώρες, ενώ το Opus 5 χρειάστηκε πάνω από 20 ώρες και περίπου 2,5 φορές περισσότερα tokens.
Σε άλλο πείραμα, η Anthropic έδωσε στα Opus 5.5 και Fable 5.1 την εργασία μεταφοράς του HAProxy από C σε Rust. Και οι δύο υλοποιήσεις πέρασαν σχεδόν όλα τα υπάρχοντα regression tests του project. Το Opus 5.5 ολοκλήρωσε όμως τη διαδικασία σε 9,5 ώρες, έναντι 12 ωρών για το Fable 5.1, με 51% χαμηλότερο κόστος.
Τέτοιου είδους workloads δείχνουν την κατεύθυνση προς την οποία μετακινείται η αγορά. Το ζητούμενο δεν είναι πλέον μόνο ένα μοντέλο που παράγει σωστό κώδικα για μία μεμονωμένη συνάρτηση, αλλά agents που μπορούν να εξερευνήσουν repositories, να εκτελέσουν tests, να διορθώσουν προβλήματα, να συντονίσουν subagents και να συνεχίσουν μία εργασία για ώρες.
Ισχυρότερη απόδοση και στο knowledge work
Το Claude Opus 5.5 δεν επικεντρώνεται αποκλειστικά στον προγραμματισμό.
Στο GDPval-AA v2.1, το οποίο αξιολογεί εργασίες που αντιστοιχούν σε πραγματική επαγγελματική δραστηριότητα σε 44 επαγγέλματα, το Opus 5.5 καταγράφει βαθμολογία 1846 Elo. Το Fable 5.1 βρίσκεται στα 1735, το Opus 5 στα 1708, το GPT-5.6 Sol στα 1588 και το GPT-6 Astra στα 1542.
Στο AutomationBench, αντίθετα, το GPT-6 Astra εμφανίζεται μπροστά με 41,4%, ενώ το Opus 5.5 καταγράφει 40%. Η Anthropic σημειώνει ότι η συγκεκριμένη αξιολόγηση πραγματοποιήθηκε από τη Zapier και ότι οι παρεμβάσεις των safeguards στο Opus 5.5 καταμετρήθηκαν ως αποτυχίες επειδή δεν χρησιμοποιήθηκαν fallback models.
Η εταιρεία αναφέρει επίσης βελτιώσεις σε χρηματοοικονομική ανάλυση, έρευνα, συλλογή δεδομένων και δημιουργία επαγγελματικών αναφορών.
Σε εσωτερική δοκιμή, τα μοντέλα έπρεπε να εντοπίσουν δύσκολα προσβάσιμα οικονομικά στοιχεία μιας εταιρείας και να δημιουργήσουν αναφορά χωρίς κατασκευασμένους αριθμούς ή αποσπάσματα. Το Opus 5.5 πέρασε το προκαθορισμένο ποιοτικό όριο στις 16 από τις 18 προσπάθειες, ενώ τα Fable 5.1 και Opus 5 δεν το πέτυχαν σε καμία από τις αντίστοιχες προσπάθειες.
Μεγαλύτερη έμφαση στην ασφάλεια των αυτόνομων agents
Όσο ένα AI agent αποκτά πρόσβαση σε terminal, αρχεία, browser, repositories και άλλα εργαλεία, η ασφάλεια μετατρέπεται σε εξίσου σημαντικό χαρακτηριστικό με την απόδοση.
Το Opus 5.5 χρησιμοποιεί classifier που ελέγχει ενέργειες πριν από την εκτέλεσή τους, sandbox που μπορεί να ελεγχθεί από ομάδες ασφαλείας και μηχανισμούς code review για τον εντοπισμό vulnerabilities.
Η Anthropic αναφέρει επίσης βελτιωμένη αντίσταση σε prompt injection σε περιβάλλοντα coding, web browsing, computer use και tool use.
Σε ξεχωριστή αξιολόγηση containment, το μοντέλο επιχείρησε να παρακάμψει καθορισμένα όρια περίπου 85% λιγότερο συχνά από τα Opus 5 και Claude Mythos 5.1. Η εταιρεία αναγνωρίζει πάντως ότι οι υπάρχουσες αξιολογήσεις δεν μπορούν να εγγυηθούν τον εντοπισμό κάθε πιθανής ανεπιθύμητης συμπεριφοράς πριν από την πραγματική ανάπτυξη ενός μοντέλου.
Περιορισμοί σε cybersecurity και βιολογία
Η αύξηση των δυνατοτήτων συνοδεύεται από αυστηρότερα safeguards.
Το Opus 5.5 χρησιμοποιεί αντίστοιχους περιορισμούς με το Fable 5.1 για εργασίες υψηλού κινδύνου στους τομείς της κυβερνοασφάλειας και της βιολογίας. Ορισμένα cybersecurity αιτήματα μπορούν να μεταφέρονται σε παλαιότερα μοντέλα, ενώ επαγγελματίες που χρειάζονται περισσότερο permissive access θα μπορούν να χρησιμοποιούν το Cyber Verification Program.
Στις βιοεπιστήμες, οργανισμοί, εργαστήρια, startups και φαρμακευτικές εταιρείες μπορούν να υποβάλλουν αίτηση στο Life Sciences Verification Program. Το πρόγραμμα χρησιμοποιεί διαδικασία επαλήθευσης και διαφορετικά επίπεδα πρόσβασης για ερευνητικές εργασίες που διαφορετικά θα περιορίζονταν από τους γενικούς μηχανισμούς ασφαλείας.
Preserved thinking και προστασία απέναντι στο model distillation
Το Opus 5.5 υιοθετεί επίσης το preserved thinking, έναν μηχανισμό που είχε εμφανιστεί ήδη στο Fable 5.1.
Ο στόχος είναι να δυσκολεύεται η μαζική εξαγωγή συμπεριφορών και δυνατοτήτων του μοντέλου μέσω distillation attacks. Σε τέτοιες επιθέσεις μπορούν να χρησιμοποιηθούν μεγάλοι αριθμοί λογαριασμών και αυτοματοποιημένων prompts για τη δημιουργία datasets που επιχειρούν να αναπαράγουν τη συμπεριφορά ενός ισχυρότερου μοντέλου.
Το preserved thinking περιορίζει τη δυνατότητα των API clients να τροποποιούν συγκεκριμένα προηγούμενα τμήματα του reasoning context.
Διαθέσιμο σε Claude, AWS, Google Cloud και Microsoft Azure
Το Claude Opus 5.5 είναι διαθέσιμο μέσω της Claude Platform και των εφαρμογών της Anthropic, ενώ υποστηρίζεται επίσης μέσω Amazon Web Services, Google Cloud και Microsoft Azure.
Η εταιρεία αυξάνει παράλληλα τα πεντάωρα usage limits για συνδρομητικά προγράμματα και παρέχει δυνατότητα αποθήκευσης ενός rate limit reset ώστε να χρησιμοποιηθεί αργότερα.
Η νέα οικογένεια δεν θα περιοριστεί στο Opus. Η Anthropic έχει ήδη ανακοινώσει ότι Claude Sonnet 5.5 και Claude Haiku 5.5 θα ακολουθήσουν μέσα στις επόμενες εβδομάδες.
Η οικονομία των AI agents γίνεται το νέο πεδίο ανταγωνισμού
Το Claude Opus 5.5 δείχνει μια σημαντική αλλαγή στον ανταγωνισμό μεταξύ των frontier AI models. Η απόδοση ανά token παραμένει σημαντική, αλλά για τα agents δεν είναι πλέον αρκετή.
Ένα μοντέλο μπορεί να είναι ακριβότερο ανά κλήση και ταυτόχρονα φθηνότερο για μία ολόκληρη εργασία, εάν χρειάζεται λιγότερες επαναλήψεις, λιγότερα tokens, λιγότερα tool calls και μικρότερο χρόνο εκτέλεσης.
Ακριβώς σε αυτό το επίπεδο επιχειρεί να διαφοροποιηθεί το Opus 5.5. Η μείωση του κόστους των tokens, η μεγάλη πτώση στην τιμή του cache, η αύξηση της ταχύτητας και οι επιδόσεις σε πολύωρες agentic εργασίες δείχνουν ότι η επόμενη μάχη των κορυφαίων μοντέλων AI θα αφορά ολοένα περισσότερο το κόστος ολοκλήρωσης μιας πραγματικής εργασίας και όχι απλώς τη βαθμολογία ενός benchmark.
Για τις επιχειρήσεις που εξετάζουν autonomous coding, AI research agents ή σύνθετα knowledge workflows, αυτή η μετατόπιση μπορεί να αποδειχθεί περισσότερο σημαντική από οποιαδήποτε μεμονωμένη αύξηση στις επιδόσεις.












