Τα δύο νέα μοντέλα μεταφέρουν τεχνολογίες του GPT-6 Astra σε φθηνότερα AI agents, coding workflows και εφαρμογές μεγάλης κλίμακας
Η OpenAI επεκτείνει τη νέα γενιά GPT-6 με τα GPT-6 Sol και GPT-6 Luna, δύο μοντέλα που έχουν σχεδιαστεί ώστε να μεταφέρουν μεγάλο μέρος των τεχνολογικών βελτιώσεων του GPT-6 Astra σε πολύ χαμηλότερο κόστος. Η στρατηγική είναι διαφορετική από μια απλή προσπάθεια αύξησης των benchmark scores. Το βασικό ζητούμενο είναι πλέον πόση χρήσιμη εργασία μπορεί να παραχθεί για κάθε δολάριο υπολογιστικού κόστους, ιδιαίτερα όταν τα μοντέλα λειτουργούν ως AI agents για μεγάλα χρονικά διαστήματα.
Το GPT-6 Astra παραμένει το κορυφαίο μοντέλο της οικογένειας για εργασίες όπου η μέγιστη δυνατή απόδοση έχει μεγαλύτερη σημασία από το κόστος. Sol και Luna καταλαμβάνουν διαφορετικές θέσεις. Το Sol προορίζεται για απαιτητικά coding και agentic workflows, ενώ το Luna στοχεύει σε εφαρμογές υψηλού όγκου όπου η ταχύτητα και το χαμηλό κόστος είναι κρίσιμοι παράγοντες.
Η αλλαγή αυτή έχει ιδιαίτερη σημασία επειδή η χρήση των σύγχρονων μοντέλων μετατοπίζεται από μεμονωμένες ερωτήσεις προς workflows που μπορεί να περιλαμβάνουν εκατοντάδες tool calls, μεγάλα contexts και ώρες συνεχούς λειτουργίας.
API κόστος μειωμένο κατά 50%
Το οικονομικό σκέλος αποτελεί μία από τις σημαντικότερες αλλαγές.
Το GPT-6 Sol κοστίζει 2 δολάρια ανά εκατομμύριο input tokens και 10 δολάρια ανά εκατομμύριο output tokens. Για το GPT-6 Luna οι αντίστοιχες τιμές πέφτουν στα 0,10 και 0,50 δολάρια.
Σε σχέση με τις προωθητικές τιμές των GPT-5.6 Sol και Luna, η OpenAI αναφέρει μείωση κατά 50%.
Τα cached input tokens είναι ακόμη φθηνότερα. Στο Sol κοστίζουν 0,20 δολάρια ανά εκατομμύριο tokens και στο Luna μόλις 0,01 δολάρια.
Η διαφορά γίνεται ιδιαίτερα σημαντική στα AI agents. Ένας agent μπορεί να διαβάζει ξανά και ξανά μεγάλα system prompts, repositories, αρχεία, προηγούμενες συνομιλίες και αποτελέσματα από εργαλεία. Ακόμη και μικρές μειώσεις στο κόστος ανά token μπορούν επομένως να μετατραπούν σε μεγάλη εξοικονόμηση όταν η διαδικασία εκτελείται χιλιάδες φορές.
Το GPT-6 Sol στοχεύει στα απαιτητικά επαγγελματικά workflows
Στο AutomationBench, το οποίο εξετάζει end-to-end επιχειρηματικά workflows με δεκάδες εργαλεία σε τομείς όπως πωλήσεις, marketing, operations, υποστήριξη, οικονομικά και ανθρώπινο δυναμικό, το GPT-6 Sol φτάνει σε score 33,2% όταν λειτουργεί με xhigh reasoning effort.
Σύμφωνα με τα αποτελέσματα της OpenAI, το μοντέλο βρίσκεται πάνω από το Claude Opus 5 στο συγκεκριμένο benchmark, ενώ το κόστος ανά task είναι σημαντικά χαμηλότερο.
Η εικόνα αυτή αποτυπώνει μια ευρύτερη αλλαγή στην αγορά των AI models. Το ερώτημα δεν είναι πλέον μόνο ποιο μοντέλο επιτυγχάνει την υψηλότερη βαθμολογία, αλλά πόσο κοστίζει για να φτάσει σε αυτή την απόδοση.
Ένα μοντέλο που βρίσκεται ελαφρώς χαμηλότερα σε ένα benchmark αλλά κοστίζει ένα κλάσμα της τιμής μπορεί να είναι πολύ πιο πρακτικό για επιχειρήσεις που εκτελούν εκατοντάδες χιλιάδες εργασίες κάθε μήνα.
Μεγάλη βελτίωση και στο Agents’ Last Exam
Παρόμοια εικόνα εμφανίζεται στο Agents’ Last Exam, ένα benchmark που εξετάζει μακροχρόνιες και οικονομικά χρήσιμες εργασίες σε δεκάδες επαγγελματικούς κλάδους.
Το GPT-6 Sol φτάνει μέχρι το 56,4%, παρουσιάζοντας αισθητή βελτίωση έναντι της προηγούμενης γενιάς.
Τα benchmarks αυτού του τύπου έχουν μεγαλύτερη πρακτική αξία από ένα απλό τεστ γνώσεων, επειδή ένας σύγχρονος agent πρέπει να σχεδιάζει πολλά διαδοχικά βήματα, να χρησιμοποιεί εργαλεία, να αξιολογεί τα ενδιάμεσα αποτελέσματα και να προσαρμόζει τη στρατηγική του μέχρι να ολοκληρωθεί η εργασία.
Ακριβώς σε αυτό το περιβάλλον η μείωση του κόστους αποκτά ιδιαίτερη σημασία. Ένα task μπορεί να δημιουργήσει πολύ μεγαλύτερη κατανάλωση tokens από μια συνηθισμένη συνομιλία.
Λιγότερα πραγματολογικά λάθη
Σημαντική βελτίωση καταγράφεται και στη factual reliability.
Η OpenAI αξιολόγησε τα μοντέλα χρησιμοποιώντας αποπροσωποποιημένες πραγματικές συνομιλίες στις οποίες χρήστες είχαν επισημάνει πραγματολογικά λάθη. Στην αξιολόγηση αυτή το GPT-6 Sol εμφανίζει περίπου το μισό ποσοστό σφαλμάτων σε σχέση με τον προκάτοχό του στις αντίστοιχες ρυθμίσεις.
Σε υψηλότερα reasoning levels, το ποσοστό απαντήσεων με πραγματολογικό λάθος πλησιάζει περίπου το 5%.
Το GPT-6 Luna παρουσιάζει επίσης μεγάλη πρόοδο. Σε ορισμένες ρυθμίσεις μπορεί να προσεγγίσει την πραγματολογική αξιοπιστία ακριβότερων μοντέλων της προηγούμενης γενιάς, διατηρώντας πολύ χαμηλότερο κόστος.
Για εταιρικές εφαρμογές, research assistants και agents που λαμβάνουν αποφάσεις με βάση πληροφορίες από πολλαπλές πηγές, η βελτίωση αυτή είναι πιθανότατα σημαντικότερη από μερικούς επιπλέον πόντους σε ένα γενικό benchmark.
Coding agents με χαμηλότερο λειτουργικό κόστος
Το software development αποτελεί έναν από τους βασικότερους στόχους του GPT-6 Sol.
Στο FrontierCode, όπου δεν αξιολογείται απλώς αν ο κώδικας λειτουργεί αλλά αν οι αλλαγές μπορούν πραγματικά να ενσωματωθούν σε ένα production repository, το Sol παρουσιάζει σημαντική βελτίωση έναντι του GPT-5.6 Sol.
Η αξιολόγηση λαμβάνει υπόψη στοιχεία όπως test quality, code style, πειθαρχία ως προς το scope και συμμόρφωση με τα standards ενός υπάρχοντος codebase.
Στο DeepSWE 1.1, που περιλαμβάνει μεγάλης διάρκειας software-engineering tasks σε πραγματικά repositories, το GPT-6 Sol φτάνει το 68,8%. Η επίδοσή του βρίσκεται πολύ κοντά στο 69,9% του Claude Fable 5, αλλά με περίπου 80% χαμηλότερο κόστος ανά εργασία σύμφωνα με τις μετρήσεις της OpenAI.
Το GPT-6 Luna φτάνει στο 66,6% στο υψηλότερο effort level, αποτέλεσμα ιδιαίτερα ενδιαφέρον για ομάδες που θέλουν να εκτελούν μεγάλο αριθμό coding tasks χωρίς να χρησιμοποιούν διαρκώς premium frontier models.
Computer use για agents που χειρίζονται εφαρμογές
Sol και Luna έχουν επίσης εκπαιδευτεί για computer-use workflows, όπου το μοντέλο αλληλεπιδρά με γραφικά περιβάλλοντα και εφαρμογές.
Στο OSWorld 2.0 offline set, το GPT-6 Sol μπορεί να ξεπεράσει το 60%, ενώ το GPT-6 Astra παραμένει το ισχυρότερο μοντέλο της οικογένειας σε αυτόν τον τομέα.
Η κατηγορία computer use αποκτά ολοένα μεγαλύτερη σημασία. Οι AI agents δεν περιορίζονται πλέον σε API calls. Μπορούν να πλοηγούνται σε εφαρμογές, να χρησιμοποιούν web interfaces και να ολοκληρώνουν διαδικασίες που προηγουμένως απαιτούσαν ανθρώπινη αλληλεπίδραση.
Όσο αυξάνεται η διάρκεια αυτών των workflows, τόσο σημαντικότερη γίνεται η σχέση μεταξύ απόδοσης και κόστους.
Context άνω του ενός εκατομμυρίου tokens
Τα δύο μοντέλα υποστηρίζουν context window περίπου 1,05 εκατομμυρίων tokens και μέχρι 128.000 output tokens.
Αυτό επιτρέπει την επεξεργασία πολύ μεγάλων repositories, πολυσέλιδων εγγράφων, ιστορικών συνομιλιών και σύνθετων agent sessions χωρίς να απαιτείται τόσο επιθετική περικοπή του διαθέσιμου context.
Παράλληλα υποστηρίζουν functions, web search, file search και computer use, χαρακτηριστικά που τα καθιστούν περισσότερο πλατφόρμες για agentic εφαρμογές παρά απλά conversational models.
Prompt caching με έκπτωση έως 90%
Η OpenAI δίνει ιδιαίτερη έμφαση και στο prompt caching.
Το σύστημα μπορεί να επαναχρησιμοποιεί κοινά prefixes από προηγούμενα prompts χωρίς να τα επεξεργάζεται ξανά πλήρως. Τα cached input tokens μπορούν έτσι να κοστίζουν έως 90% λιγότερο.
Παράλληλα, οι developers αποκτούν Prompt Caching Dashboard, diagnostics για cache misses και explicit breakpoints ώστε να ελέγχουν καλύτερα ποια τμήματα του context πρέπει να επαναχρησιμοποιούνται.
Ιδιαίτερα σημαντικό είναι ότι αλλαγές στο reasoning effort ή στην ενεργοποίηση εργαλείων μπορούν πλέον να πραγματοποιούνται χωρίς να καταστρέφεται απαραίτητα η προηγούμενη cache.
Η δυνατότητα αυτή είναι ιδιαίτερα χρήσιμη σε persistent agents, όπου το ίδιο μεγάλο context επαναχρησιμοποιείται για ώρες ή ημέρες.
Μεγαλύτερη έμφαση και στην αξιοπιστία της συμπεριφοράς
Η OpenAI αναφέρει βελτιώσεις και στις alignment αξιολογήσεις των νέων μοντέλων.
Σε ειδικό τεστ coding deception, όπου τα tasks είναι σκόπιμα σχεδιασμένα ώστε να δημιουργούν συνθήκες στις οποίες ένα μοντέλο θα μπορούσε να παρουσιάσει παραπλανητικά την εργασία του, το GPT-6 Sol καταγράφει rate 1,3%, ενώ το GPT-6 Luna 2,8%.
Το GPT-6 Astra βρίσκεται ακόμη χαμηλότερα, στο 0,5%.
Οι συγκεκριμένες δοκιμές είναι σχεδιασμένες ως stress tests και δεν αντιπροσωπεύουν το ποσοστό τέτοιων συμπεριφορών στην κανονική χρήση. Δείχνουν όμως ότι η OpenAI αντιμετωπίζει πλέον την αξιοπιστία της συμπεριφοράς ενός agent ως ξεχωριστό τεχνικό χαρακτηριστικό, ιδιαίτερα όταν το μοντέλο αποκτά μεγαλύτερη αυτονομία.
Το πραγματικό στοίχημα είναι η οικονομία των AI agents
Η σημαντικότερη πλευρά των GPT-6 Sol και Luna δεν βρίσκεται σε κάποιο μεμονωμένο benchmark.
Η αγορά μετακινείται σταδιακά από το μοντέλο «ένα prompt, μία απάντηση» προς agents που λειτουργούν για πολύ μεγαλύτερα χρονικά διαστήματα, χρησιμοποιούν εργαλεία, επεξεργάζονται τεράστια contexts και εκτελούν πραγματική εργασία.
Σε αυτό το περιβάλλον, το κόστος inference μπορεί να γίνει εξίσου σημαντικό με την ίδια την ποιότητα του μοντέλου.
Το GPT-6 Sol επιχειρεί να τοποθετηθεί κοντά στην απόδοση των ισχυρότερων frontier models με σημαντικά χαμηλότερο κόστος, ενώ το Luna κατεβάζει ακόμη περισσότερο το οικονομικό όριο για εφαρμογές μεγάλης κλίμακας.
Αν αυτή η σχέση απόδοσης προς κόστος επιβεβαιωθεί και σε πραγματικά production workloads, η νέα γενιά GPT-6 μπορεί να επηρεάσει όχι μόνο ποιο μοντέλο επιλέγουν οι developers, αλλά και ποια agentic προϊόντα είναι οικονομικά βιώσιμο να λειτουργούν σε συνεχή βάση.
Τα GPT-6 Sol και GPT-6 Luna είναι διαθέσιμα μέσω OpenAI API ως gpt-6-sol και gpt-6-luna, καθώς και στο Codex και στο ChatGPT Work για τις υποστηριζόμενες συνδρομές. Η σταδιακή διάθεση διευρύνεται καθώς αυξάνεται η διαθέσιμη υπολογιστική χωρητικότητα.













