Η xAI ανακοίνωσε το Grok 4.5, ένα νέο μοντέλο τεχνητής νοημοσύνης που φέρνει στο προσκήνιο τον προγραμματισμό, τις πολυβηματικές εργασίες agent και γενικότερα την εργασία γνώσης. Σύμφωνα με την εταιρεία, πρόκειται για το ισχυρότερο μοντέλο που έχει παρουσιάσει μέχρι σήμερα. Η διάθεση ξεκινά άμεσα μέσω του Grok Build, του Cursor και της κονσόλας SpaceXAI. Η ανακοίνωση συνοδεύεται από μετρήσεις επιδόσεων, τεχνικές λεπτομέρειες για την εκπαίδευση και συγκεκριμένη τιμολόγηση για χρήση μέσω API.
Το ενδιαφέρον της παρουσίασης δεν περιορίζεται σε έναν γενικό ισχυρισμό περί καλύτερης απόδοσης. Η xAI επιχειρεί να δείξει πού ακριβώς τοποθετεί το Grok 4.5 στην αγορά, δημοσιεύοντας συγκρίσεις σε δοκιμές που σχετίζονται με τη μηχανική λογισμικού, την επίλυση τεχνικών εργασιών και την αποδοτικότητα στην παραγωγή tokens. Αυτό έχει ιδιαίτερη σημασία σε μια περίοδο όπου τα μεγάλα μοντέλα κρίνονται όλο και περισσότερο από τη συμπεριφορά τους σε πραγματικά σενάρια και όχι μόνο από θεωρητικές μετρήσεις. Στο ίδιο πλαίσιο, η εταιρεία δίνει έμφαση τόσο στην ποιότητα του συλλογισμού όσο και στο κόστος εκτέλεσης.
Η θέση του Grok 4.5 στην οικογένεια μοντέλων της xAI
Η xAI περιγράφει το Grok 4.5 ως το πιο ικανό της μοντέλο μέχρι σήμερα, με σαφή στόχευση σε απαιτητικές τεχνικές χρήσεις. Η έμφαση δεν είναι μόνο στη συγγραφή κώδικα, αλλά και σε ροές εργασίας agent που απαιτούν πολλαπλά βήματα, συνέπεια και προσαρμογή σε σύνθετα προβλήματα. Με αυτόν τον τρόπο, η εταιρεία επιχειρεί να τοποθετήσει το μοντέλο σε μια κατηγορία όπου η αξιολόγηση γίνεται με βάση την πρακτική απόδοση. Πρόκειται για μια στρατηγική που απευθύνεται τόσο σε προγραμματιστές όσο και σε ομάδες που θέλουν να ενσωματώσουν AI σε καθημερινές ροές εργασίας.
Η αναφορά ότι το μοντέλο εκπαιδεύτηκε παράλληλα με το Cursor δείχνει επίσης ένα πλαίσιο ανάπτυξης κοντά στις πραγματικές ανάγκες του προγραμματισμού. Δεν πρόκειται απλώς για θεωρητική βελτιστοποίηση ενός γενικού μοντέλου, αλλά για προσανατολισμό σε περιβάλλοντα όπου ο χρήστης ζητά λειτουργικό αποτέλεσμα. Αυτό ενισχύει τη σημασία της ανακοίνωσης για την αγορά εργαλείων ανάπτυξης λογισμικού. Παράλληλα, η διαθεσιμότητα σε πολλαπλά κανάλια από την πρώτη ημέρα δείχνει ότι η xAI επιδιώκει άμεση υιοθέτηση.
Οι επιδόσεις στα benchmarks και τι δείχνουν
Στα στοιχεία που έδωσε η εταιρεία, το Grok 4.5 εμφανίζεται ανταγωνιστικό σε μια σειρά από benchmarks που σχετίζονται με τη μηχανική λογισμικού. Στο DeepSWE 1.0 καταγράφει 62,0%, πίσω από τα Fable και GPT 5.5, αλλά μπροστά από τα Opus 4.8 και Opus 4.7. Στο DeepSWE 1.1 η επίδοσή του είναι 53%, πάλι χαμηλότερη από ορισμένους ανταγωνιστές. Ωστόσο, στο SWE Marathon περνά στην πρώτη θέση με ποσοστό 29,0%, ξεπερνώντας τα υπόλοιπα μοντέλα που περιλαμβάνονται στη σύγκριση.
Η εικόνα γίνεται πιο σύνθετη όταν εξεταστούν και άλλες δοκιμές. Στο Terminal Bench 2.1 το Grok 4.5 φτάνει το 83,3%, πολύ κοντά στα υψηλότερα σκορ της ομάδας σύγκρισης, ενώ στο SWE Bench Pro σημειώνει 64,7%, πίσω από τα Fable και Opus 4.8 αλλά μπροστά από τα Opus 4.7, GLM 5.2 και GPT 5.5. Αυτό δείχνει ότι η xAI δεν παρουσιάζει μια εικόνα απόλυτης κυριαρχίας σε όλα τα τεστ, αλλά ένα προφίλ σταθερά ισχυρό σε διαφορετικά είδη τεχνικών αξιολογήσεων. Για όσους παρακολουθούν την αγορά, αυτή η συνέπεια έχει συχνά μεγαλύτερη αξία από μια μεμονωμένη πρωτιά.
Πώς εκπαιδεύτηκε το νέο μοντέλο
Η xAI αναφέρει ότι το Grok 4.5 εκπαιδεύτηκε σε δεκάδες χιλιάδες GPUs NVIDIA GB300, με τεχνικές σταθερότητας ειδικά σχεδιασμένες για εκπαίδευση σε μεγάλη κλίμακα. Η λεπτομέρεια αυτή έχει σημασία επειδή δείχνει το υπολογιστικό αποτύπωμα που απαιτήθηκε για το νέο μοντέλο. Παράλληλα, η εταιρεία επισημαίνει ότι δεν βασίστηκε μόνο στον όγκο δεδομένων. Έδωσε ιδιαίτερο βάρος στο φιλτράρισμα, την αποδιπλοποίηση, τη βαθμολόγηση ποιότητας και την επιλογή δεδομένων ανά τομέα.
Η περιγραφή της διαδικασίας εκπαίδευσης δείχνει επίσης μια στροφή προς την ποιότητα του συλλογισμού ανά token. Σύμφωνα με την xAI, η εκπαίδευση με reinforcement learning κάλυψε εκατοντάδες χιλιάδες εργασίες, με επίκεντρο τη μηχανική λογισμικού πολλών βημάτων και άλλες τεχνικές δραστηριότητες. Η αξιολόγηση έγινε τόσο αυτόματα όσο και με μεθόδους που βασίζονται σε μοντέλα. Επιπλέον, η εταιρεία αναφέρει ασύγχρονη στοίβα εκπαίδευσης, ώστε τα rollouts των agent να μπορούν να τρέχουν για πολλές ώρες ενώ η μάθηση συνεχίζεται ταυτόχρονα.
Έμφαση στον προγραμματισμό και στις εργασίες agent
Ένα από τα βασικά σημεία της ανακοίνωσης είναι ότι το Grok 4.5 σχεδιάστηκε για να αποδίδει σε πραγματικές εργασίες μηχανικής λογισμικού. Η xAI υποστηρίζει ότι το μοντέλο μπορεί να χειριστεί απαιτητικά προβλήματα σε Rust και C/C++, αλλά και να προχωρήσει από ένα απλό prompt έως τη δημιουργία ολόκληρης εφαρμογής. Η εταιρεία παρουσιάζει το στοιχείο αυτό ως ένδειξη ικανότητας σε ανάπτυξη από άκρο σε άκρο. Αν και η ανακοίνωση δεν δίνει αναλυτικά παραδείγματα κώδικα μέσα στο κείμενο, η τοποθέτηση είναι σαφής ως προς το κοινό στο οποίο απευθύνεται.
Ιδιαίτερη σημασία έχει και η αναφορά στις εργασίες agent, δηλαδή σε ροές όπου το μοντέλο δεν εκτελεί μία μόνο εντολή αλλά ακολουθεί αλληλουχία βημάτων. Εκεί η αποδοτικότητα του συλλογισμού παίζει καθοριστικό ρόλο, γιατί επηρεάζει τον χρόνο ολοκλήρωσης, το κόστος και τη σταθερότητα του αποτελέσματος. Η xAI συνδέει αυτή την ικανότητα με τη δομή της εκπαίδευσης και με τη δυνατότητα του μοντέλου να εργάζεται σε σύνθετα τεχνικά καθήκοντα. Με άλλα λόγια, το Grok 4.5 παρουσιάζεται ως εργαλείο παραγωγής αποτελέσματος και όχι μόνο ως σύστημα απάντησης σε ερωτήσεις.
Ταχύτητα, αποδοτικότητα και κόστος χρήσης
Η xAI αναφέρει ότι το Grok 4.5 εξυπηρετείται με ταχύτητα 80 TPS, ένα στοιχείο που συνδέει άμεσα με την πρακτική εμπειρία χρήσης. Σε περιβάλλοντα ανάπτυξης και αυτοματοποίησης, η ταχύτητα δεν είναι απλώς τεχνική λεπτομέρεια, αλλά παράγοντας που επηρεάζει την παραγωγικότητα. Η εταιρεία συνδυάζει αυτό το χαρακτηριστικό με τον ισχυρισμό ότι το μοντέλο είναι περίπου δύο φορές πιο αποδοτικό ως προς τα tokens σε συγκρίσιμες εργασίες. Αυτό σημαίνει ότι, για ορισμένα σενάρια, χρειάζεται λιγότερα βήματα για να οδηγηθεί σε λύση.
Πιο συγκεκριμένα, η xAI αναφέρει ότι στο SWE Bench Pro το Grok 4.5 επιλύει εργασίες με μέσο όρο 15.954 output tokens, περίπου 4,2 φορές λιγότερα από τα 67.020 output tokens που αποδίδονται στο Opus 4.8 στην ίδια σύγκριση. Σε επίπεδο τιμολόγησης, η εταιρεία ορίζει κόστος 2 δολάρια ανά εκατομμύριο input tokens και 6 δολάρια ανά εκατομμύριο output tokens. Ο συνδυασμός χαμηλότερης κατανάλωσης tokens και ανταγωνιστικής τιμής είναι κεντρικό στοιχείο της τοποθέτησης του προϊόντος. Για επιχειρησιακή χρήση, αυτό μπορεί να αποδειχθεί εξίσου κρίσιμο με την ακατέργαστη απόδοση στα benchmarks.
Χρήσεις σε Excel, PowerPoint και Word
Η ανακοίνωση δεν περιορίζεται στον προγραμματισμό, αλλά επεκτείνεται και στην εργασία γραφείου. Το Grok 4.5 γίνεται το προεπιλεγμένο μοντέλο στο Grok Build, όπου η xAI υποστηρίζει ότι μπορεί να δημιουργεί σύνθετα μοντέλα στο Excel, με έρευνα στον ιστό, χρήση τύπων σε πολλά φύλλα και σημειώσεις για μελλοντική αναφορά. Η περιγραφή αυτή δείχνει μια προσπάθεια επέκτασης του μοντέλου σε ρόλους που συνδυάζουν ανάλυση, τεκμηρίωση και οργάνωση. Δεν πρόκειται μόνο για δημιουργία κειμένου, αλλά για διαχείριση εργασιών με δομή.
Αντίστοιχα, για το PowerPoint και το Word, η xAI τονίζει την προσοχή στη λεπτομέρεια. Αναφέρει ότι το μοντέλο μπορεί να χρησιμοποιεί τα native σχήματα του PowerPoint για σύνθετα διαγράμματα, να οργανώνει λογικά το περιεχόμενο των διαφανειών και να γράφει καθαρό κείμενο στο Word. Αυτές οι αναφορές ενισχύουν την εικόνα ενός συστήματος που στοχεύει στην καθημερινή παραγωγικότητα και όχι αποκλειστικά στις τεχνικές ομάδες. Παραμένει, βέβαια, σημαντικό το ότι οι δυνατότητες αυτές παρουσιάζονται από την ίδια την εταιρεία και όχι μέσα από ανεξάρτητη αξιολόγηση στο κείμενο της ανακοίνωσης.
Διαθεσιμότητα και σημασία για την αγορά
Το Grok 4.5 είναι διαθέσιμο από σήμερα στο Grok Build, στο Cursor για όλα τα πλάνα και μέσω του API της SpaceXAI. Η xAI αναφέρει επίσης περιορισμένης διάρκειας δωρεάν χρήση στο Grok Build και στο Cursor, μια κίνηση που προφανώς στοχεύει στη γρήγορη δοκιμή και υιοθέτηση. Για τους προγραμματιστές και τις ομάδες προϊόντος, αυτό μειώνει το αρχικό εμπόδιο αξιολόγησης. Παράλληλα, η ύπαρξη API διευκολύνει την ενσωμάτωση σε υπάρχουσες στοίβες λογισμικού.
Σε συνολικό επίπεδο, η ανακοίνωση δείχνει ότι η xAI επιδιώκει να ανταγωνιστεί όχι μόνο στην απόλυτη ισχύ των μοντέλων, αλλά και στον συνδυασμό ταχύτητας, αποδοτικότητας και κόστους. Τα benchmarks που παρουσιάστηκαν δεν την τοποθετούν πρώτη σε κάθε μέτρηση, αλλά σκιαγραφούν ένα μοντέλο με συνεπή παρουσία σε κρίσιμες τεχνικές δοκιμές. Αν αυτή η εικόνα επιβεβαιωθεί στην πράξη, το Grok 4.5 μπορεί να αποκτήσει ρόλο σε ροές ανάπτυξης λογισμικού και στην εργασία γνώσης, όπου η σχέση απόδοσης προς κόστος είναι καθοριστική. Το επόμενο βήμα θα είναι να φανεί πώς θα αξιολογηθεί από την κοινότητα χρηστών σε πραγματικές συνθήκες.













