Η συζήτηση για την αξιολόγηση των AI agents έχει αλλάξει αισθητά. Δεν αρκεί πλέον να κρίνεται αν ένα μοντέλο ακούγεται πειστικό ή αν επέλεξε σωστά μια συνάρτηση σε ένα απομονωμένο παράδειγμα. Σε πραγματικές συνθήκες, ο agent πρέπει να εκτελεί αλυσίδες ενεργειών, να χρησιμοποιεί εργαλεία, να διαχειρίζεται την κατάσταση του περιβάλλοντος και να ανακάμπτει όταν κάτι αποτυγχάνει. Αυτό είναι το κεντρικό επιχείρημα της νέας ανάλυσης της Nvidia για το πώς πρέπει να ερμηνεύονται τα σύγχρονα benchmarks.
Το βασικό κενό των παλαιότερων μεθόδων ήταν ότι σχεδιάστηκαν για στατικά προβλήματα με μία έξοδο. Όμως οι agents λειτουργούν διαφορετικά, επειδή η συμπεριφορά τους ξεδιπλώνεται σε πολλά βήματα και όχι σε μία μόνο απάντηση. Έτσι, η σωστή αξιολόγηση μετατοπίζεται από το επίπεδο της μεμονωμένης κλήσης στο επίπεδο της ολοκλήρωσης μιας εργασίας. Τα tool calls παραμένουν θεμελιώδη, αλλά αντιμετωπίζονται πλέον ως μέρος μιας ευρύτερης διαδικασίας.
Γιατί τα κλασικά benchmarks δεν αρκούν
Τα πρώτα ανοιχτά και model-agnostic frameworks αξιολόγησης είχαν χτιστεί γύρω από την υπόθεση ότι η εργασία είναι στατική και ότι το τελικό κείμενο αρκεί για να εξαχθεί συμπέρασμα. Αυτή η παραδοχή λειτούργησε ικανοποιητικά για τις πρώτες γενιές μεγάλων γλωσσικών μοντέλων. Όταν όμως ένα σύστημα πρέπει να ψάξει, να καλέσει API, να ενημερώσει την κατάσταση και να συνεχίσει έπειτα από αποτυχία, μια συμβολοσειρά εξόδου δεν περιγράφει επαρκώς τι συνέβη. Η αξιολόγηση χρειάζεται πλέον να παρακολουθεί όλη την εκτέλεση.
Χαρακτηριστικό παράδειγμα αυτής της μεταβατικής φάσης είναι το Berkeley Function-Calling Leaderboard, που μετρά την επιλογή συνάρτησης και την ορθότητα των ορισμάτων σε μονοστροφικά και πολυστροφικά σενάρια. Η συνεισφορά του είναι σημαντική, επειδή εξετάζει αν το μοντέλο χρησιμοποίησε το σωστό εργαλείο με σωστά πεδία. Παρ’ όλα αυτά, σύμφωνα με τη Nvidia, μια σωστή κλήση δεν σημαίνει απαραίτητα ότι η εργασία ολοκληρώθηκε. Αν, για παράδειγμα, παραλείφθηκαν ενδιάμεσοι έλεγχοι ή ενημερώσεις κατάστασης, η αποστολή μπορεί να έχει αποτύχει παρά τη σωστή συνάρτηση.
Από το σωστό βήμα στο σωστό αποτέλεσμα
Η πλήρης agentic αξιολόγηση απαιτεί εκτελέσιμο περιβάλλον που εφαρμόζει κάθε κλήση εργαλείου, διατηρεί την κατάσταση σε κάθε βήμα και ελέγχει στο τέλος αν ο στόχος επιτεύχθηκε. Πάνω σε αυτή τη βάση τοποθετούνται δύο επίπεδα βαθμολόγησης. Το πρώτο είναι το step-level ή process scoring, που εξετάζει αν κάθε ενέργεια ήταν έγκυρη, σχετική και χρήσιμη τη στιγμή που εκτελέστηκε. Το δεύτερο είναι το end-to-end scoring, που αγνοεί τη διαδρομή και κοιτά μόνο την τελική κατάσταση.
Η διάκριση αυτή έχει πρακτική σημασία. Το step-level δείχνει σε ποιο ακριβώς σημείο σπάει η αλυσίδα και γι’ αυτό είναι πολύτιμο για debugging και fine-tuning. Το end-to-end, αντίθετα, συμπυκνώνει όλη την εμπειρία του χρήστη σε ένα ερώτημα: αν δηλαδή το σύστημα ολοκλήρωσε ή όχι τη δουλειά. Η Nvidia σημειώνει ότι στις συνθήκες παραγωγής συνήθως η τελική έγκριση βασίζεται στο end-to-end αποτέλεσμα, ενώ το αναλυτικό ίχνος βημάτων διατηρείται από κάτω για διερεύνηση αστοχιών.
Η σημασία του trace και της ιεραρχίας μέτρησης
Κεντρική έννοια σε αυτή τη μεθοδολογία είναι το trace, δηλαδή το διατεταγμένο αρχείο μιας πλήρους προσπάθειας. Περιλαμβάνει το αρχικό μήνυμα του χρήστη, κάθε βήμα του agent και την κατάσταση του περιβάλλοντος όταν η προσπάθεια ολοκληρωθεί ή εγκαταλειφθεί. Με απλά λόγια, το process scoring βαθμολογεί τις γραμμές αυτού του ίχνους, ενώ το end-to-end βαθμολογεί την τελική του κατάσταση. Χωρίς τέτοιο αποτύπωμα, η ερμηνεία της απόδοσης μένει επιφανειακή.
Η Nvidia περιγράφει και μια σαφή ιεραρχία μέτρησης, από το benchmark έως το step. Ένα trial είναι μία πλήρης εκτέλεση του συνόλου εργασιών με σταθερή ρύθμιση, ένα task είναι ένα επιμέρους πρόβλημα, ένα turn αντιστοιχεί σε ένα όριο ανταλλαγής μηνυμάτων και ένα step είναι η επιμέρους ενέργεια μέσα σε αυτό το turn. Στην πράξη, το step είναι συχνά μια κλήση εργαλείου, αλλά μπορεί να είναι και σχέδιο δράσης ή τελικό μήνυμα. Η σωστή ανάγνωση των αποτελεσμάτων απαιτεί αυτό το roll-up με τη σωστή σειρά και όχι πρόχειρους μέσους όρους.
Ποια metrics έχουν πραγματική αξία
Σύμφωνα με το άρθρο, ένα benchmark εργαλείων εξετάζει τρία πράγματα με αυτή τη σειρά: αν το μοντέλο αποφάσισε ότι χρειάζεται εργαλείο, αν επέλεξε το σωστό και αν συμπλήρωσε σωστά τα ορίσματα. Από εκεί και πέρα, τα αποτελέσματα συνοψίζονται σε τρεις βασικούς άξονες: ακρίβεια, φλυαρία στην εκτέλεση και κόστος. Το task success rate είναι το βασικό κριτήριο κυκλοφορίας, επειδή απαντά αν το περιβάλλον έφτασε στον επιθυμητό στόχο. Όμως δεν αρκεί από μόνο του.
Ιδιαίτερη βαρύτητα δίνεται στη συνέπεια της επιτυχίας σε 3 έως 5 trials, επειδή τα στοχαστικά συστήματα δεν πρέπει να κρίνονται από ένα μόνο ποσοστό. Το tool-call precision δείχνει αν το μοντέλο κάνει περιττές ή λανθασμένες κλήσεις, ενώ το argument accuracy απομονώνει τα σφάλματα συμπλήρωσης ορισμάτων από την επιλογή λανθασμένου API. Παράλληλα, τα steps per success και cost per success δείχνουν πόσο αποτελεσματικά ολοκληρώνεται μια επιτυχημένη εργασία. Η Nvidia υπογραμμίζει επίσης ότι η παράλληλη κλήση εργαλείων μπορεί να μειώσει τα βήματα και την καθυστέρηση, όχι όμως τον συνολικό αριθμό κλήσεων.
Γιατί δύο benchmarks δεν είναι πάντα συγκρίσιμα
Δύο συστήματα μπορεί να δηλώνουν ότι μετρούν tool calling και, παρ’ όλα αυτά, τα αποτελέσματά τους να μην είναι συγκρίσιμα. Η πρώτη μεγάλη διαφορά είναι η πολυπλοκότητα των εργασιών, αν δηλαδή πρόκειται για μία απλή, μονοστροφική κλήση ή για πολυσταδιακή διαδικασία με σχεδιασμό, ανάκαμψη και διαχείριση κατάστασης. Ένα benchmark μίας κλήσης δεν αποκαλύπτει αν ο agent θα αποτύχει στο όγδοο βήμα μιας αλυσίδας δεκαπέντε ενεργειών. Γι’ αυτό οι υψηλές επιδόσεις σε απλές δοκιμές δεν μεταφράζονται αυτόματα σε επιχειρησιακή αξιοπιστία.
Η δεύτερη κρίσιμη διάσταση είναι η δυναμική διατήρηση κατάστασης του περιβάλλοντος και η τρίτη η μεθοδολογία επαλήθευσης. Τα stateful benchmarks μπορούν να αναδείξουν drift, απώλεια συμφραζομένων και αλλοίωση κατάστασης, προβλήματα που δεν εμφανίζονται σε στατικά σύνολα. Ως χρυσό πρότυπο προτείνεται η εκτελέσιμη επαλήθευση, αν δηλαδή ενημερώθηκε η βάση, πέρασαν τα tests ή έκλεισε σωστά ένα ticket. Όπου αυτό δεν είναι δυνατό, το LLM-as-a-Judge μπορεί να χρησιμοποιηθεί, αλλά η Nvidia τονίζει ότι τα ευρήματά του πρέπει να θεωρούνται προσωρινά μέχρι να ελεγχθούν έναντι ανθρώπινων αξιολογήσεων.
Το παράδειγμα του SWE-bench και η ανάγνωση ενός trace
Για να εξηγήσει τη διαφορά ανάμεσα σε σωστά βήματα και σωστό αποτέλεσμα, το άρθρο παραθέτει δημόσιο trace από πραγματική εκτέλεση στο SWE-bench Verified. Στο συγκεκριμένο task, ο agent έπρεπε να τροποποιήσει κώδικα σε αποθετήριο ώστε να λυθεί πραγματικό issue του GitHub και να περάσουν οι σχετικοί έλεγχοι. Το περιβάλλον ήταν πραγματικό filesystem με git, με εργαλεία όπως terminal, file_editor, task_tracker και finish. Η εκτέλεση δεν επέτρεπε παράλληλα tool calls και η κατάσταση του repository διατηρούνταν από turn σε turn.
Στο trace καταγράφεται μια μικρή αναποτελεσματικότητα, όταν ο agent άνοιξε ολόκληρο μεγάλο αρχείο πριν περιορίσει την αναζήτηση στις σχετικές γραμμές. Αυτή η κίνηση κρίθηκε περιττή στο step-level scoring, αλλά στη συνέχεια διορθώθηκε με πιο στοχευμένη αναζήτηση. Το αποτέλεσμα ήταν ότι ο end-to-end έλεγχος πέρασε επιτυχώς, άρα η εργασία θεωρήθηκε ολοκληρωμένη, ενώ τα επιμέρους metrics κατέγραψαν tool-call precision 3/4 και argument accuracy 4/4. Αυτό δείχνει ακριβώς γιατί μια μικρή αστοχία στη διαδρομή δεν πρέπει να συγχέεται με πλήρη αποτυχία, αλλά ούτε και να εξαφανίζεται από την ανάλυση.
Τι σημαίνει αυτό για επιχειρήσεις και μοντέλα όπως το Nemotron
Η Nvidia υποστηρίζει ότι πολλά από τα benchmarks που σήμερα θεωρούνται γενικής ικανότητας μετρούν ήδη έμμεσα τη χρήση εργαλείων, επειδή τα σύγχρονα συστήματα δεν αναπτύσσονται χωρίς αυτά. Το HumanEval, για παράδειγμα, προσφέρει εκτελέσιμη επαλήθευση μέσω unit tests, αλλά δεν περιλαμβάνει εργαλεία ή περιβάλλον δράσης. Με το SWE-bench η αλλαγή γίνεται πιο εμφανής, επειδή η επίλυση ενός πραγματικού issue απαιτεί αναζήτηση αρχείων, επεξεργασία κώδικα και επιτυχή εκτέλεση δοκιμών. Άρα η τελική βαθμολογία εκφράζει αποτέλεσμα, αλλά η διαδρομή προς αυτό αποτελείται σχεδόν εξ ολοκλήρου από tool calls.
Σε αυτό το πλαίσιο, η ανάγνωση των δημοσιευμένων μετρήσεων του Nemotron 3.5 Lightning πρέπει να γίνεται με όρους ολοκλήρωσης εργασιών και χρόνου μέχρι το αποτέλεσμα. Η Nvidia αναφέρει επιδόσεις σε διαφορετικά suites, όπως τραπεζικές συνομιλίες πολλών γύρων, το GDPval-AA v2 και το PinchBench, όπου το μοντέλο φέρεται να φτάνει σε 86% accuracy, ολοκληρώνοντας 10.000 tasks έως 30% ταχύτερα από το Qwen3.6 35B με συγκρίσιμη ακρίβεια. Ωστόσο, το ίδιο το άρθρο επιμένει ότι τα δημόσια scores δεν πρέπει να λειτουργούν ως τελικό release gate. Η ουσιαστική απόφαση πρέπει να στηρίζεται σε αξιολόγηση πάνω στα δικά σου tickets, traces, APIs και πολιτικές, με τελικό κριτήριο την πραγματική κατάσταση του περιβάλλοντος.












