Με ισχυρότερο software engineering, 1M context και επιθετική τιμολόγηση, το νέο Flash στοχεύει στην παραγωγική χρήση AI
Η Google παρουσίασε το Gemini 3.7 Flash μόλις τρεις εβδομάδες μετά την κυκλοφορία του Gemini 3.6 Flash, σε ακόμη μία ένδειξη ότι ο κύκλος αναβάθμισης των κορυφαίων μοντέλων AI έχει επιταχυνθεί δραματικά. Το νέο μοντέλο δεν σχεδιάστηκε απλώς ως ένα ταχύτερο chatbot. Η βασική του στόχευση είναι το coding, τα AI agents και οι σύνθετες ροές εργασίας που απαιτούν πολλά διαδοχικά βήματα, χρήση εργαλείων και διατήρηση του στόχου για μεγάλο χρονικό διάστημα.
Το ενδιαφέρον βρίσκεται στον συνδυασμό απόδοσης και κόστους. Το Gemini 3.7 Flash πλησιάζει ή ξεπερνά ακριβότερα μοντέλα σε αρκετές δοκιμές software engineering, enterprise automation και document understanding, ενώ η εισαγωγική τιμή του παραμένει στα 0,75 δολάρια ανά εκατομμύριο input tokens και 3,75 δολάρια ανά εκατομμύριο output tokens.
Αυτό μετατρέπει την κυκλοφορία σε κάτι περισσότερο από μια συνηθισμένη αναβάθμιση. Η Google επιχειρεί να μεταφέρει δυνατότητες που μέχρι πρόσφατα συνδέονταν με premium reasoning models σε ένα μοντέλο που μπορεί να χρησιμοποιηθεί μαζικά σε παραγωγικά συστήματα.
Δεν είναι νέο μοντέλο από το μηδέν
Το Gemini 3.7 Flash βασίζεται στο Gemini 3.6 Flash και αποτελεί εξέλιξη της ίδιας οικογένειας, με αλγοριθμικές βελτιώσεις στον πυρήνα του reasoning. Αυτό εξηγεί σε μεγάλο βαθμό πώς η Google κατάφερε να κυκλοφορήσει νέα έκδοση μέσα σε μόλις τρεις εβδομάδες.
Η διαφορά δεν βρίσκεται μόνο στην παραγωγή καλύτερων απαντήσεων. Το 3.7 Flash έχει σχεδιαστεί ώστε να χειρίζεται πιο πειθαρχημένα πολυσταδιακές διαδικασίες, να προσαρμόζεται όταν ένα βήμα αποτυγχάνει, να χρησιμοποιεί εργαλεία με μεγαλύτερη συνέπεια και να μειώνει τους επαναλαμβανόμενους κύκλους αποτυχίας ενός agent.
Το μοντέλο υποστηρίζει context window έως 1 εκατομμύριο tokens και μέγιστη έξοδο 64K tokens. Δέχεται κείμενο, εικόνες, ήχο και βίντεο, ενώ οι developers μπορούν να επιλέξουν διαφορετικό επίπεδο reasoning μέσω των ρυθμίσεων low, medium και high. Το medium αποτελεί την προεπιλογή, ενώ το high αυξάνει την προσπάθεια reasoning και τη χρήση εργαλείων με αντίστοιχη αύξηση στην κατανάλωση tokens.
Πρόκειται επομένως για μοντέλο που προορίζεται περισσότερο για pipelines, εφαρμογές και agents παρά για απλές σύντομες συνομιλίες.
Μεγάλο άλμα στο software engineering
Τα αποτελέσματα στο coding αποτελούν το πιο εντυπωσιακό μέρος της κυκλοφορίας.
Στο FrontierCode 1.1 Main, που αξιολογεί την ποιότητα κώδικα με κριτήριο το κατά πόσο μια αλλαγή θα μπορούσε πραγματικά να ενσωματωθεί σε ένα production repository, το Gemini 3.7 Flash φτάνει το 43,6%, από 34,4% του 3.6 Flash. Στην ίδια αξιολόγηση βρίσκεται οριακά πάνω από το Claude Sonnet 5 με 42,7% και το GPT-5.6 Terra με 41,3%.
Ακόμη μεγαλύτερη είναι η αλλαγή στο DeepSWE v1.1, ένα benchmark για μακροχρόνιες εργασίες software engineering. Το 3.7 Flash ανεβαίνει στο 65,3%, έναντι 48,6% του προηγούμενου μοντέλου. Το GPT-5.6 Terra παραμένει υψηλότερα στο συγκεκριμένο τεστ με 69,6%, γεγονός που δείχνει ότι το νέο Flash δεν κυριαρχεί σε κάθε κατηγορία.
Η ίδια εικόνα εμφανίζεται στο Terminal-bench 2.1, όπου το Gemini 3.7 Flash φτάνει το 85,8% από 78% του 3.6 Flash. Το GPT-5.6 Terra διατηρεί μικρό προβάδισμα με 87,4%.
Το σημαντικό στοιχείο δεν είναι ότι το Gemini κερδίζει κάθε benchmark. Είναι ότι ένα μοντέλο με σημαντικά χαμηλότερη τιμή έχει πλέον βρεθεί στην ίδια περιοχή απόδοσης με συστήματα που μέχρι πρόσφατα ανήκαν σε διαφορετική οικονομική κατηγορία.
Οι AI agents είναι το πραγματικό πεδίο μάχης
Η μεγαλύτερη στρατηγική αλλαγή φαίνεται στις agentic εργασίες.
Στο Terminal-bench 3.0, το 3.7 Flash φτάνει το 14,9%, σχεδόν τριπλάσιο από το 5,4% του 3.6 Flash. Παρότι το απόλυτο ποσοστό παραμένει χαμηλό και δείχνει πόσο δύσκολη εξακολουθεί να είναι η πλήρης αυτονομία, η κατεύθυνση είναι ξεκάθαρη.
Στο OSWorld-2.0, όπου ένα μοντέλο πρέπει να χρησιμοποιήσει υπολογιστικό περιβάλλον και να ολοκληρώσει πραγματικές εργασίες, η επίδοση αυξάνεται από 33,8% σε 47,9%. Το GPT-5.6 Terra βρίσκεται στο 50,2%.
Ιδιαίτερα ενδιαφέρον είναι και το AutomationBench. Το Gemini 3.7 Flash καταγράφει 30,4%, έναντι 17% του προηγούμενου Flash, 23,6% του GPT-5.6 Terra και 10,7% του Claude Sonnet 5 στο συγκεκριμένο σύνολο αξιολόγησης.
Το AutomationBench της συγκεκριμένης σύγκρισης χαρακτηρίζεται ως private set, επομένως το αποτέλεσμα χρειάζεται περισσότερη προσοχή από έναν πλήρως δημόσιο και ανεξάρτητα αναπαραγώγιμο benchmark. Παρ’ όλα αυτά, η μεγάλη διαφορά μεταξύ 3.6 και 3.7 ενισχύει την εικόνα ότι το μεγαλύτερο μέρος της προόδου έχει συγκεντρωθεί στην εκτέλεση πραγματικών workflows.
Για τις επιχειρήσεις αυτό είναι κρίσιμο. Ένας agent που χρειάζεται λιγότερα retries, αποτυγχάνει λιγότερο συχνά στις tool calls και διατηρεί καλύτερα τον στόχο του μπορεί να μειώσει τόσο το inference cost όσο και την ανάγκη ανθρώπινης επίβλεψης.
Ισχυρότερο και σε έγγραφα, long context και multimodal εργασίες
Η βελτίωση δεν περιορίζεται στον προγραμματισμό.
Στο GDP.pdf, που εξετάζει την κατανόηση απαιτητικών PDF και σύνθετων εγγράφων, το Gemini 3.7 Flash ανεβαίνει στο 34% από 22%. Στο Harvey LAB-AA για σύνθετες νομικές ροές εργασίας φτάνει το 90,7%, ενώ στο LVBench για κατανόηση μεγάλων βίντεο καταγράφει 85,4%.
Ιδιαίτερα ισχυρή παραμένει η επίδοση στο long context. Στο GDM-MRCR v2 με 128K tokens το αποτέλεσμα φτάνει το 97%, από 91,8% του 3.6 Flash και πάνω από το 93,5% του GPT-5.6 Terra.
Αυτό έχει πρακτική σημασία σε εφαρμογές που πρέπει να επεξεργαστούν μεγάλα codebases, συμβόλαια, τεχνικά εγχειρίδια, οικονομικές αναφορές ή πολύωρο multimedia περιεχόμενο χωρίς να χωρίζουν συνεχώς τα δεδομένα σε μικρότερα κομμάτια.
Παράλληλα, οι επιδόσεις δεν βελτιώνονται παντού. Στο CharXiv Reasoning χωρίς εργαλεία το αποτέλεσμα μειώνεται ελαφρά από 85,2% σε 84,5%, ενώ με εργαλεία πέφτει από 89,4% σε 88,7%. Αυτές οι μικρές υποχωρήσεις αποτελούν υπενθύμιση ότι μια νέα έκδοση δεν είναι αναγκαστικά καλύτερη σε κάθε workload.
Η τιμή μπορεί να είναι το σημαντικότερο χαρακτηριστικό
Μέχρι τις 31 Δεκεμβρίου 2026, το Gemini 3.7 Flash κοστίζει 0,75 δολάρια ανά εκατομμύριο input tokens και 3,75 δολάρια ανά εκατομμύριο output tokens.
Η ίδια προωθητική τιμή εφαρμόζεται πλέον και στο Gemini 3.6 Flash. Από την 1η Ιανουαρίου 2027, οι κανονικές τιμές προβλέπεται να αυξηθούν στα 1,50 δολάρια για input και 7,50 δολάρια για output.
Στη συγκριτική εικόνα της τρέχουσας αγοράς, το Claude Sonnet 5 εμφανίζεται στα 2 δολάρια για input και 10 δολάρια για output, ενώ το GPT-5.6 Terra στα 2 και 12 δολάρια αντίστοιχα.
Αυτό αλλάζει τον τρόπο με τον οποίο πρέπει να διαβάζονται τα benchmarks. Για έναν agent που πραγματοποιεί εκατοντάδες ή χιλιάδες model calls, η διαφορά μερικών ποσοστιαίων μονάδων στην ποιότητα μπορεί να έχει μικρότερη σημασία από μια πολλαπλάσια διαφορά στο συνολικό κόστος εκτέλεσης.
Η μάχη των μοντέλων μετακινείται έτσι από το «ποιο έχει το μεγαλύτερο benchmark score» προς το «ποιο ολοκληρώνει μια πραγματική εργασία με το καλύτερο συνδυασμό ακρίβειας, ταχύτητας και κόστους».
Το Gemini Spark αναβαθμίζεται, αλλά όχι παντού
Το Gemini 3.7 Flash χρησιμοποιείται επίσης ως νέα βάση για το Gemini Spark, τον προσωπικό agent της Google που μπορεί να εκτελεί εργασίες, να χρησιμοποιεί εφαρμογές του Google Workspace και να λειτουργεί για μεγαλύτερα χρονικά διαστήματα.
Η αναβάθμιση στοχεύει σε πιο αξιόπιστη διαχείριση αρχείων, σύνταξη emails, ενημέρωση εγγράφων και γενικότερα σε workflows που συνδυάζουν πολλές διαφορετικές δεξιότητες.
Υπάρχει όμως σημαντικός γεωγραφικός περιορισμός. Το Gemini Spark εξακολουθεί να μην είναι διαθέσιμο στον Ευρωπαϊκό Οικονομικό Χώρο, καθώς και σε ορισμένες ακόμη αγορές. Η διαθεσιμότητα του Gemini 3.7 Flash μέσω API και επιχειρηματικών προϊόντων είναι διαφορετικό θέμα και δεν πρέπει να συγχέεται με τη διαθεσιμότητα του Spark στην καταναλωτική εφαρμογή Gemini.
Νέα safeguards για cyber και CBRN
Η αύξηση των agentic και coding δυνατοτήτων συνοδεύεται από ενισχυμένα μέτρα ασφαλείας για cyber offense και κινδύνους Chemical, Biological, Radiological and Nuclear.
Στις αξιολογήσεις frontier safety, το Gemini 3.7 Flash δεν έφτασε κανένα από τα κρίσιμα capability levels που παρακολουθούνται. Στον τομέα της κυβερνοασφάλειας έφτασε σε επίπεδο alert threshold, χωρίς όμως να περάσει το αντίστοιχο critical capability level.
Το στοιχείο αυτό έχει ιδιαίτερη σημασία καθώς τα μοντέλα coding μετατρέπονται όλο και περισσότερο σε agents που μπορούν να χρησιμοποιούν terminals, browsers και πραγματικά εργαλεία. Η βελτίωση στην παραγωγικότητα σημαίνει ταυτόχρονα ότι οι μηχανισμοί ελέγχου πρέπει να εξελίσσονται με τον ίδιο ρυθμό.
Το Flash παύει να σημαίνει απλώς «γρήγορο και φθηνό»
Το Gemini 3.7 Flash αποτυπώνει μια ευρύτερη αλλαγή στην αγορά της τεχνητής νοημοσύνης. Τα λεγόμενα workhorse models δεν περιορίζονται πλέον σε απλές, μαζικές εργασίες χαμηλού κόστους. Αρχίζουν να αναλαμβάνουν coding, computer use, document analysis και πολυσταδιακούς agents που πριν απαιτούσαν τα ακριβότερα μοντέλα μιας οικογένειας.
Το 3.7 Flash δεν είναι το κορυφαίο μοντέλο σε κάθε benchmark. Σε αρκετές δύσκολες agentic και software engineering δοκιμές υπάρχουν ισχυρότερα συστήματα. Η σημασία του βρίσκεται αλλού, στο πόσο κοντά καταφέρνει να φτάσει σε αυτά με πολύ χαμηλότερο κόστος.
Αν αυτή η τάση συνεχιστεί, η επόμενη φάση του ανταγωνισμού στην AI δεν θα κριθεί μόνο από το ποιος διαθέτει το πιο ισχυρό frontier model. Θα κριθεί από το ποιος μπορεί να μετατρέψει παρόμοιες δυνατότητες σε οικονομικά βιώσιμη υποδομή για εκατομμύρια καθημερινές agentic εργασίες.












