Η Meta Muse Glimmer φέρνει τοπικούς πράκτορες AI στις καταναλωτικές GPU
Η Meta κυκλοφορεί το Muse Glimmer υπό την άδεια Apache 2.0, επιτρέποντας την εκτέλεση τοπικών πρακτόρων AI σε καταναλωτικές GPU. Αυτή η πρωτοβουλία έρχεται από τα Superintelligence Labs της εταιρείας, τα οποία έχουν διαθέσει τα βάρη του μοντέλου των 30 δισεκατομμυρίων παραμέτρων στο Hugging Face. Η Meta δηλώνει ότι οι προγραμματιστές μπορούν να χρησιμοποιήσουν το Muse Glimmer για τοπικό κώδικα, κλήση λειτουργιών, τοπικούς πράκτορες και αξιολόγηση LLM-as-a-judge.
Η κυκλοφορία αυτή απευθύνεται σε μια επιχειρησιακή πρόκληση που αντιμετωπίζουν οι ομάδες AI: τα μοντέλα που φιλοξενούνται στο cloud χρειάζονται πρόσβαση στο δίκτυο και κεντρική υποδομή. Αντίθετα, η Meta προτείνει το Muse Glimmer για εργασίες που απαιτούν ένα μοντέλο στη συσκευή, συμπεριλαμβανομένων προσωπικών πρακτόρων με πρόσβαση σε προγράμματα, μηνύματα, αρχεία και άλλα ιδιωτικά δεδομένα.
Η Meta Muse Glimmer προηγείται σε διάφορα benchmarks πρακτόρων
Οι δοκιμές αναφοράς της Meta τοποθετούν το Muse Glimmer μπροστά από τα Gemma4-31B και Qwen3.6-27B σε πέντε από τα οκτώ γενικά benchmarks πρακτόρων. Το μοντέλο σημείωσε 75,5 στο MCP Atlas, ενώ το Gemma4-31B έφτασε το 54,2 και το Qwen3.6-27B κατέγραψε 62,5.
Η DeepSearch QA ακολουθεί παρόμοιο μοτίβο, με τη Meta να αναφέρει σκορ 74,6 για το Muse Glimmer, έναντι 61,7 για το Gemma4-31B και 71,1 για το Qwen3.6-27B. Οι δοκιμές αυτές αξιολογούν την ικανότητα του πράκτορα να λειτουργεί μέσα σε πλαίσια και να ολοκληρώνει αιτήματα πολλαπλών γύρων.
Το μοντέλο σημείωσε 23,5 στο τ²-Banking, ενώ το Gemma4-31B κατέγραψε 15,1 και το Qwen3.6-27B έφτασε το 16,7. Το Muse Glimmer επίσης σημείωσε 47,6 στο WildClawBench, μπροστά από το Gemma4-31B με 37,6 και το Qwen3.6-27B με 43,2. Το αποτέλεσμα GAIA2 έφτασε το 43,3, σε σύγκριση με 36,4 και 40,0 αντίστοιχα.
Άλλα σκορ πρακτόρων ευνοούν το Qwen3.6-27B. Ο πίνακας της Meta δίνει στο μοντέλο αυτό 1.141 στο GDPval-AA, έναντι 953 για το Muse Glimmer και 811 για το Gemma4-31B. Το Qwen3.6-27B επίσης προηγείται στο SkillsBench με Skills στο 46,6, ενώ το Muse Glimmer κατέγραψε 44,3.
Το OSWorld-Verified παρουσίασε τη μεγαλύτερη διαφορά σε αυτή την ομάδα, με τη Meta να αναφέρει 75,6 για το Qwen3.6-27B, το Muse Glimmer να φτάνει το 65,9 και το Gemma4-31B να σημειώνει 58,5.
Τα αποτελέσματα κωδικοποίησης διχάζονται μεταξύ Muse Glimmer και Qwen
Τα αποτελέσματα κωδικοποίησης του Muse Glimmer δείχνουν μια στενότερη σύγκριση. Το μοντέλο προηγείται στο SWE-Bench Pro με σκορ 51,2. Η Meta αναφέρει 36,9 για το Gemma4-31B και 50,2 για το Qwen3.6-27B.
Το SciCode παρήγαγε ένα κοντινό αποτέλεσμα, με το Muse Glimmer να σημειώνει 43,6, ελαφρώς πάνω από το Gemma4-31B με 43,4. Το Qwen3.6-27B κατέγραψε 39,8.
Το Qwen3.6-27B προηγείται σε δύο άλλες αξιολογήσεις κωδικοποίησης. Σημείωσε 77,2 στο SWE-Bench Verified, σε σύγκριση με το 76,0 του Muse Glimmer. Το TerminalBench 2.1 έδωσε στο Qwen3.6-27B σκορ 60,7, με το Muse Glimmer να φτάνει το 51,7 και το Gemma4-31B να σημειώνει 43,4.
Ένας τοπικός πράκτορας κωδικοποίησης κάνει περισσότερα από το να παράγει κώδικα. Χρειάζεται ένα πλαίσιο που αποφασίζει ποια αποθετήρια, τερματικά, περιβάλλοντα δοκιμών και εντολές μπορεί να έχει πρόσβαση το μοντέλο. Η Meta δηλώνει ότι το Muse Glimmer υποστηρίζει το OpenClaw και άλλα μοτίβα ορχήστρωσης πρακτόρων, με προσαρμοσμένα πλαίσια να καλύπτονται στην τεκμηρίωση των προγραμματιστών της.
Οι πολυτροπικές βαθμολογίες ευνοούν το Qwen στις περισσότερες δοκιμές
Το Muse Glimmer δέχεται εναλλασσόμενο κείμενο και εικόνες μέσω ενός αποκλειστικού αποκωδικοποιητή αντίληψης. Η Meta αναφέρει ότι αυτός ο σχεδιασμός επιτρέπει στους πράκτορες να ερμηνεύουν στιγμιότυπα οθόνης, γραφήματα και έγγραφα ως μέρος μιας συνομιλίας.
Ο πίνακας αναφοράς τοποθετεί το Muse Glimmer μπροστά στο Charxiv Reasoning, με σκορ 78,8, έναντι 77,7 για το Gemma4-31B και 78,4 για το Qwen3.6-27B.
Το Qwen3.6-27B προηγείται στο ScreenSpot Pro με 76,1, ενώ το Muse Glimmer κατέγραψε 75,4 και το Gemma4-31B σημείωσε 75,9. Το ίδιο μοντέλο προηγείται στο OmniDocBench v1.5 με 77,8, σε σύγκριση με το 75,8 του Muse Glimmer και το 72,5 του Gemma4-31B.
Το MMMU Pro παρήγαγε μικρότερες διαφορές, με τη Meta να καταγράφει το Muse Glimmer στο 74, το Qwen3.6-27B να φτάνει το 75 και το Gemma4-31B να σημειώνει 73.
Αυτά τα αποτελέσματα είναι σημαντικά για ομάδες που εξετάζουν πράκτορες που ενεργούν σε οπτικές διεπαφές. Ένα μοντέλο που διαβάζει στιγμιότυπα οθόνης μπορεί να ερμηνεύσει αυτό που βλέπει, αλλά οι τοπικές δοκιμές πρέπει ακόμη να καλύπτουν άδειες, διατάξεις οθόνης, μορφές εγγράφων και σφάλματα που επιστρέφουν τα συνδεδεμένα εργαλεία.
Τα στοιχεία ασφαλείας δείχνουν χαμηλότερη αναφερόμενη επιτυχία επίθεσης από το Qwen
Η Meta αναφέρει επίσης δύο αξιολογήσεις που σχετίζονται με την ασφάλεια: CI Memories και Siren AgentDojo. Ο πίνακας χρησιμοποιεί διαφορετικά μέτρα για κάθε δοκιμή.
Στο CI Memories, η Meta καταγράφει ποσοστό παραβίασης 26,4 για το Muse Glimmer και σκορ κάλυψης 64,8. Το Gemma4-31B κατέγραψε ποσοστό παραβίασης 12,1 με κάλυψη 53,0. Το Qwen3.6-27B σημείωσε ποσοστό παραβίασης 53,4 και κάλυψη 66,9.
Το αποτέλεσμα Siren AgentDojo χρησιμοποιεί ποσοστό επιτυχίας επίθεσης και χρησιμότητα. Η Meta δίνει στο Muse Glimmer ποσοστό επιτυχίας επίθεσης 28,4 και σκορ χρησιμότητας 94,2. Το Gemma4-31B σημείωσε 25,6 στο ποσοστό επιτυχίας επίθεσης, με χρησιμότητα στο 90,8. Το Qwen3.6-27B κατέγραψε 40,3 και 92,7.
Τα αποτελέσματα γενικής λογικής προσθέτουν πλαίσιο στις αξιώσεις πρακτόρων
Το Muse Glimmer προηγείται σε τέσσερις από τις έξι δοκιμές γενικών ικανοτήτων και λογικής στη σύγκριση της Meta. Σημείωσε 77,0 στο IFBench, με το Gemma4-31B να καταγράφει 76,0 και το Qwen3.6-27B να φτάνει το 70,8.
Το σκορ AIME 2026 ήταν 94,7 για το Muse Glimmer, με τη Meta να αναφέρει 89,2 για το Gemma4-31B και 94,1 για το Qwen3.6-27B. Στο AA-LCR, το Muse Glimmer έφτασε το 80,0, μπροστά από το 68,3 και το 73,3.
Το μοντέλο επίσης προηγείται στο Beam 128K με 65,1. Το Qwen3.6-27B σημείωσε 63,0 και το Gemma4-31B κατέγραψε 58,2.
Το Gemma4-31B προηγείται στο GPQA Diamond με 85,7. Το Muse Glimmer σημείωσε 83,5, ακολουθούμενο από το Qwen3.6-27B με 84,2. Το Gemma4-31B επίσης πήρε την κορυφαία βαθμολογία στο Humanity’s Last Exam, Text No Tools, με 23,6, ενώ το Muse Glimmer έφτασε το 22,0.
Ένα μοντέλο δεν προηγείται σε κάθε δοκιμή. Τα αποτελέσματα της Meta δείχνουν αντίθετα ότι το Muse Glimmer ανταγωνίζεται στενά με δύο παρόμοια μεγέθους μοντέλα σε ένα μικτό σύνολο αξιολογήσεων πρακτόρων, κωδικοποίησης, οπτικών, ασφάλειας και λογικής.
Τα όρια μνήμης διαμορφώνουν το σχεδιασμό τοπικής ανάπτυξης
Η Meta αναφέρει ότι ένα μοντέλο πλήρους ακρίβειας με 30 δισεκατομμύρια παραμέτρους θα απαιτούσε πάνω από 55 GB μνήμης. Το Muse Glimmer χρησιμοποιεί αντ’ αυτού περίπου 4-bit ποσοτικοποίηση βαρών, μειώνοντας το γλωσσικό μοντέλο σε λιγότερο από 20 GB.
Αυτή η κατανομή αφήνει μνήμη για μια κρυφή μνήμη KV. Το μοντέλο χρειάζεται επίσης χώρο για τον αποκωδικοποιητή αντίληψης και έναν συντάκτη προβλεπτικής αποκωδικοποίησης. Η Meta στοχεύει σε ένα περιβάλλον μνήμης 24 GB ή 32 GB για αυτά τα συστατικά.
Η εταιρεία αναφέρει ότι ο συντάκτης DFlash προτείνει μπλοκ τοκενών για το κύριο μοντέλο να επαληθεύσει παράλληλα. Η Meta αναφέρει ότι αυτό επιταχύνει τη δημιουργία σε σύγκριση με την τυπική παραγωγή τοκενών-ανά-τοκεν και διατηρεί την ίδια ποιότητα εξόδου. Το παρεχόμενο κείμενο δεν περιλαμβάνει αριθμούς τοκενών-ανά-δευτερόλεπτο, μεγέθη προτροπών, δεδομένα ισχύος ή αποτελέσματα ταυτόχρονης εκτέλεσης.
Η Meta δοκίμασε την έκδοση K-Quant-17GB με τον ποσοτικοποιημένο συντάκτη DFlash σε υλικό MacBook M4-Max, MacBook M5-Max και RTX-5090. Περιγράφει την εμπειρία που προκύπτει ως κατάλληλη για ρευστή συνομιλία και αλληλεπίδραση σε πραγματικό χρόνο με πράκτορες.
Τα δημόσια βάρη είναι διαθέσιμα μέσω του Hugging Face. Η Meta αναφέρει ότι οι ενσωματώσεις με το llama.cpp, το MLX και το ExecuTorch θα φτάσουν τις επόμενες ημέρες.













