Η Meta Παρουσιάζει το Μοντέλο Muse Spark 1.3 για Εκτενέστερη Εργασία με Εργαλεία
Η Meta ανακοίνωσε την κυκλοφορία του μοντέλου Muse Spark 1.3, το οποίο είναι σχεδιασμένο για εκτενέστερη εργασία που χρησιμοποιεί εξωτερικά εργαλεία. Το μοντέλο αυτό, που κυκλοφόρησε στις 2 Σεπτεμβρίου, είναι διαθέσιμο μέσω του Muse Code, του κωδικοποιητικού πράκτορα της Meta, καθώς και μέσω του Meta Model API, επιτρέποντας στις εφαρμογές να καλούν το μοντέλο. Οι τιμές παραμένουν αμετάβλητες σε σχέση με την έκδοση 1.2. Το Muse Spark 1.3 έχει σχεδιαστεί για να διατηρεί τις μεγαλύτερες εργασίες κωδικοποίησης και έρευνας σε τροχιά, να ρωτά τον χρήστη όταν οι απαιτήσεις δεν είναι σαφείς και να ζητά επιβεβαίωση πριν από σημαντικές ενέργειες.
Οι προγραμματιστές μπορούν πλέον να δοκιμάσουν το νέο μοντέλο στις δύο επιφάνειες που καθιερώθηκαν για το Muse Spark 1.2 τον Αύγουστο. Η Meta δεν έκανε διαθέσιμες όλες τις ρυθμίσεις από τον πίνακα αναφοράς της. Η ρύθμιση xhigh είναι διαθέσιμη, ενώ η πιο απαιτητική σε υπολογιστική ισχύ λειτουργία max παραμένει περιορισμένη στους συνεργάτες μέχρι να ολοκληρωθούν επιπλέον δοκιμές ασφαλείας από τη Meta.
Τι Μπορούν να Χρησιμοποιήσουν οι Προγραμματιστές Τώρα
Οι τυπικές τιμές API παραμένουν στα $1.25 ανά εκατομμύριο εισερχόμενων tokens, $0.15 ανά εκατομμύριο αποθηκευμένων εισερχόμενων tokens και $4.25 ανά εκατομμύριο εξερχόμενων tokens. Αυτές οι μονάδες αντιστοιχούν στο Muse Spark 1.2, αλλά δεν καθορίζουν την τιμή μιας ολοκληρωμένης εργασίας. Ο λογαριασμός μιας εργασίας εξακολουθεί να εξαρτάται από την εισαγωγή, την εξαγωγή, τη χρήση της προσωρινής μνήμης, την προσπάθεια συλλογισμού και τη δραστηριότητα των εργαλείων.
Το Muse Spark 1.3 διαθέτει ένα παράθυρο συνδυασμένου περιεχομένου ενός εκατομμυρίου tokens. Το μοντέλο δέχεται κείμενο, εικόνες και βίντεο ως εισαγωγή και παράγει κείμενο. Η ακριβής επιλεξιμότητα λογαριασμού και γεωγραφική περιοχή παραμένουν αδιευκρίνιστες. Το μοντέλο παραμένει ιδιόκτητο. Η Meta έχει συμπεριλάβει μια έκδοση Muse Spark με ανοιχτά βάρη στον οδικό της χάρτη, αλλά δεν έχει καθορίσει το σημείο ελέγχου, τους όρους ή την ημερομηνία.
Τι Σημαίνει η Πρακτική Εργασία Εδώ
Η Meta χρησιμοποιεί τον όρο "πρακτική" για ένα μοντέλο που μπορεί να ολοκληρώσει μια πολυβήματη εργασία χρησιμοποιώντας εργαλεία, να διατηρήσει τις απαιτήσεις κατά τη διάρκεια μιας μακράς ανταλλαγής, να συλλέξει πληροφορίες από διάφορες πηγές και να αναθεωρήσει το σχέδιό του όταν εντοπίζει ένα κενό. Το μοντέλο μπορεί επίσης να σταματήσει για να ζητήσει διευκρινίσεις ή βοήθεια από τον χρήστη και να ζητήσει επιβεβαίωση πριν από μια μη αναστρέψιμη ενέργεια.
Αυτές οι συμπεριφορές έχουν σημασία στο Muse Code επειδή το προϊόν προορίζεται να σχεδιάσει, να γράψει και να επικυρώσει αλλαγές σε ένα αποθετήριο λογισμικού. Η Meta αναφέρει ότι το μοντέλο μπορεί να ενσωματώσει μια πρόσθετη απαίτηση κατά τη διάρκεια μιας διακοπείσας εργασίας αντί να ξεκινήσει ξανά την εργασία. Η εταιρεία αναφέρει επίσης ότι εκπαίδευσε το 1.3 σε περισσότερη εργασία κωδικοποίησης μακράς διάρκειας, αλλά δεν αποκαλύπτει αρκετά για αυτές τις εργασίες εκπαίδευσης ώστε να μετατρέψει τον ισχυρισμό σχεδιασμού σε γενικό ποσοστό επιτυχίας.
Η Meta αναφέρει ότι οι μηχανικοί της είδαν περίπου 20% λιγότερες κλήσεις εργαλείων και 25% λιγότερα tokens όταν συγκρίνουν το 1.3 με το 1.2. Η εταιρεία δεν έχει δημοσιεύσει τον αριθμό των εργασιών, τη σύζευξη ακρίβειας ή την διακύμανση για αυτήν την εσωτερική σύγκριση, οπότε τα στοιχεία περιγράφουν τη δοκιμή της Meta και όχι κάθε φόρτο εργασίας κωδικοποίησης.
Ανεξάρτητες Δοκιμές Δείχνουν Μικτά Αποτελέσματα xhigh
Η Artificial Analysis μέτρησε τη διαθέσιμη λειτουργία xhigh σε σχέση με την προκάτοχό της xhigh υπό το ίδιο πλαίσιο αξιολόγησης. Στο Tau3-Bench Banking, που δοκιμάζει την ικανότητα ενός πράκτορα να ολοκληρώνει εργασίες τραπεζικής με τη μεσολάβηση εργαλείων, το ποσοστό επιτυχίας αυξήθηκε από 35% σε 47%. Στο Terminal-Bench 2.1, ένα σύνολο εργασιών γραμμής εντολών που ελέγχονται από εκτελέσιμους επαληθευτές, αυξήθηκε από 80% σε 85%. Οι ίδιες ανεξάρτητες δοκιμές βρήκαν επίσης υποχωρήσεις. Η βαθμολογία σε μια δοκιμή 100 ερωτήσεων για μακροσκελή έγγραφα έπεσε από 83% σε 79%, ενώ η ακρίβεια σε μια δοκιμή γνώσεων 6,000 ερωτήσεων μειώθηκε από 45% σε 42%. Η Artificial Analysis συνέδεσε την τελευταία μείωση με περισσότερες αποχές, οι οποίες μείωσαν τις λανθασμένες απαντήσεις που καταμετρήθηκαν από το ξεχωριστό μέτρο παραισθήσεων. Συνολικά, τα αποτελέσματα υποστηρίζουν τη βελτίωση σε επιλεγμένες εργασίες με έντονη χρήση εργαλείων, όχι μια γενική πρόοδο.
Η ευρεία συγκριτική πίνακας της Meta χρησιμοποίησε το 1.3 σε λειτουργία max αλλά το συνέκρινε με το 1.2 σε λειτουργία xhigh, και ορισμένες σειρές προήλθαν από αναφορές παρόχων ή δημόσιους πίνακες κορυφαίων αποτελεσμάτων αντί για μια κοινή δοκιμή. Αυτά τα αποτελέσματα περιγράφουν το πακέτο αξιολόγησης max της Meta, όχι τη γενικά διαθέσιμη διαμόρφωση xhigh την ημέρα κυκλοφορίας.
Οι Ισχυρισμοί Ασφάλειας Συναντούν το Όριο Κυκλοφορίας
Η Meta αναφέρει ότι το Muse Spark 1.3 είναι πιο ανθεκτικό σε εχθρικές εισαγωγές και εισαγωγές προτροπών, και καλύτερα βαθμονομημένο για ενέργειες που δεν μπορούν να αναιρεθούν. Η δημόσια κυκλοφορία δεν παρέχει συγκεκριμένα ποσοστά κυκλοφορίας, μεγέθη δειγμάτων ή ανεξάρτητες μετρήσεις ασφάλειας για αυτούς τους ισχυρισμούς. Αυτά καθορίζουν τη θέση ασφαλείας της Meta, όχι την υπεροχή έναντι άλλου μοντέλου.
Η Meta αναφέρει ότι η γενική πρόσβαση στο max θα ακολουθήσει επιπλέον δοκιμές ασφαλείας, αλλά δεν δίνει ημερομηνία ή κριτήρια ολοκλήρωσης. Μέχρι να αλλάξει αυτό, οι προγραμματιστές μπορούν να χρησιμοποιούν το xhigh ενώ η ισχυρότερη λειτουργία συλλογισμού στην κάρτα αποτελεσμάτων της κυκλοφορίας παραμένει εκτός γενικής πρόσβασης.
Η Meta παρουσιάζει το Muse Spark ως πρόοδο προς την προσωπική υπερνοημοσύνη, αλλά η κυκλοφορία της 2ας Σεπτεμβρίου είναι ένα μοντέλο για προγραμματιστές και όχι ένας προσωπικός πράκτορας ή μια νέα κυκλοφορία για καταναλωτές. Οι ίδιες τιμές μονάδας αφήνουν ένα συγκεκριμένο ερώτημα για τους προγραμματιστές: αν το 1.3 ολοκληρώνει τις δικές τους εργασίες πιο επιτυχώς χωρίς να χρησιμοποιεί αρκετά επιπλέον tokens ώστε κάθε επιτυχημένη εργασία να γίνει πιο ακριβή.












