Τεχνητή Νοημοσύνη – Νέα & Εργαλεία | Greek AI Network

Greek AI Network

  • Αρχική
  • Νέα
  • Εργαλεία AI
    • Για Βίντεο
    • Για Εικόνα
    • Για Εκπαιδευτικούς
    • Για Εξειδικευμένες Εφαρμογές
    • Για Ήχο
    • Για Κείμενο
  • Εφαρμογές AI
  • Βασικές έννοιες
  • Εκπαιδευτικά Προγράμματα
    • Δωρεάν σεμινάρια AI
    • Κατάρτηση AI
No Result
View All Result
Τεχνητή Νοημοσύνη – Νέα & Εργαλεία | Greek AI Network
  • Αρχική
  • Νέα
  • Εργαλεία AI
    • Για Βίντεο
    • Για Εικόνα
    • Για Εκπαιδευτικούς
    • Για Εξειδικευμένες Εφαρμογές
    • Για Ήχο
    • Για Κείμενο
  • Εφαρμογές AI
  • Βασικές έννοιες
  • Εκπαιδευτικά Προγράμματα
    • Δωρεάν σεμινάρια AI
    • Κατάρτηση AI
No Result
View All Result
Τεχνητή Νοημοσύνη – Νέα & Εργαλεία | Greek AI Network

Greek AI Network

No Result
View All Result
Home Νέα

Αξιολόγηση AI agents: από tool calls έως task completion

by Kyriakos Koutsourelis
3 Οκτωβρίου, 2026
in Νέα
0
Πώς αξιολογούνται σωστά τα AI agents στην πράξη
Share on FacebookShare on Twitter

Η συζήτηση για την αξιολόγηση των AI agents έχει αλλάξει αισθητά. Δεν αρκεί πλέον να κρίνεται αν ένα μοντέλο ακούγεται πειστικό ή αν επέλεξε σωστά μια συνάρτηση σε ένα απομονωμένο παράδειγμα. Σε πραγματικές συνθήκες, ο agent πρέπει να εκτελεί αλυσίδες ενεργειών, να χρησιμοποιεί εργαλεία, να διαχειρίζεται την κατάσταση του περιβάλλοντος και να ανακάμπτει όταν κάτι αποτυγχάνει. Αυτό είναι το κεντρικό επιχείρημα της νέας ανάλυσης της Nvidia για το πώς πρέπει να ερμηνεύονται τα σύγχρονα benchmarks.

Το βασικό κενό των παλαιότερων μεθόδων ήταν ότι σχεδιάστηκαν για στατικά προβλήματα με μία έξοδο. Όμως οι agents λειτουργούν διαφορετικά, επειδή η συμπεριφορά τους ξεδιπλώνεται σε πολλά βήματα και όχι σε μία μόνο απάντηση. Έτσι, η σωστή αξιολόγηση μετατοπίζεται από το επίπεδο της μεμονωμένης κλήσης στο επίπεδο της ολοκλήρωσης μιας εργασίας. Τα tool calls παραμένουν θεμελιώδη, αλλά αντιμετωπίζονται πλέον ως μέρος μιας ευρύτερης διαδικασίας.

Γιατί τα κλασικά benchmarks δεν αρκούν

Τα πρώτα ανοιχτά και model-agnostic frameworks αξιολόγησης είχαν χτιστεί γύρω από την υπόθεση ότι η εργασία είναι στατική και ότι το τελικό κείμενο αρκεί για να εξαχθεί συμπέρασμα. Αυτή η παραδοχή λειτούργησε ικανοποιητικά για τις πρώτες γενιές μεγάλων γλωσσικών μοντέλων. Όταν όμως ένα σύστημα πρέπει να ψάξει, να καλέσει API, να ενημερώσει την κατάσταση και να συνεχίσει έπειτα από αποτυχία, μια συμβολοσειρά εξόδου δεν περιγράφει επαρκώς τι συνέβη. Η αξιολόγηση χρειάζεται πλέον να παρακολουθεί όλη την εκτέλεση.

Χαρακτηριστικό παράδειγμα αυτής της μεταβατικής φάσης είναι το Berkeley Function-Calling Leaderboard, που μετρά την επιλογή συνάρτησης και την ορθότητα των ορισμάτων σε μονοστροφικά και πολυστροφικά σενάρια. Η συνεισφορά του είναι σημαντική, επειδή εξετάζει αν το μοντέλο χρησιμοποίησε το σωστό εργαλείο με σωστά πεδία. Παρ’ όλα αυτά, σύμφωνα με τη Nvidia, μια σωστή κλήση δεν σημαίνει απαραίτητα ότι η εργασία ολοκληρώθηκε. Αν, για παράδειγμα, παραλείφθηκαν ενδιάμεσοι έλεγχοι ή ενημερώσεις κατάστασης, η αποστολή μπορεί να έχει αποτύχει παρά τη σωστή συνάρτηση.

Από το σωστό βήμα στο σωστό αποτέλεσμα

Η πλήρης agentic αξιολόγηση απαιτεί εκτελέσιμο περιβάλλον που εφαρμόζει κάθε κλήση εργαλείου, διατηρεί την κατάσταση σε κάθε βήμα και ελέγχει στο τέλος αν ο στόχος επιτεύχθηκε. Πάνω σε αυτή τη βάση τοποθετούνται δύο επίπεδα βαθμολόγησης. Το πρώτο είναι το step-level ή process scoring, που εξετάζει αν κάθε ενέργεια ήταν έγκυρη, σχετική και χρήσιμη τη στιγμή που εκτελέστηκε. Το δεύτερο είναι το end-to-end scoring, που αγνοεί τη διαδρομή και κοιτά μόνο την τελική κατάσταση.

Η διάκριση αυτή έχει πρακτική σημασία. Το step-level δείχνει σε ποιο ακριβώς σημείο σπάει η αλυσίδα και γι’ αυτό είναι πολύτιμο για debugging και fine-tuning. Το end-to-end, αντίθετα, συμπυκνώνει όλη την εμπειρία του χρήστη σε ένα ερώτημα: αν δηλαδή το σύστημα ολοκλήρωσε ή όχι τη δουλειά. Η Nvidia σημειώνει ότι στις συνθήκες παραγωγής συνήθως η τελική έγκριση βασίζεται στο end-to-end αποτέλεσμα, ενώ το αναλυτικό ίχνος βημάτων διατηρείται από κάτω για διερεύνηση αστοχιών.

Η σημασία του trace και της ιεραρχίας μέτρησης

Κεντρική έννοια σε αυτή τη μεθοδολογία είναι το trace, δηλαδή το διατεταγμένο αρχείο μιας πλήρους προσπάθειας. Περιλαμβάνει το αρχικό μήνυμα του χρήστη, κάθε βήμα του agent και την κατάσταση του περιβάλλοντος όταν η προσπάθεια ολοκληρωθεί ή εγκαταλειφθεί. Με απλά λόγια, το process scoring βαθμολογεί τις γραμμές αυτού του ίχνους, ενώ το end-to-end βαθμολογεί την τελική του κατάσταση. Χωρίς τέτοιο αποτύπωμα, η ερμηνεία της απόδοσης μένει επιφανειακή.

Η Nvidia περιγράφει και μια σαφή ιεραρχία μέτρησης, από το benchmark έως το step. Ένα trial είναι μία πλήρης εκτέλεση του συνόλου εργασιών με σταθερή ρύθμιση, ένα task είναι ένα επιμέρους πρόβλημα, ένα turn αντιστοιχεί σε ένα όριο ανταλλαγής μηνυμάτων και ένα step είναι η επιμέρους ενέργεια μέσα σε αυτό το turn. Στην πράξη, το step είναι συχνά μια κλήση εργαλείου, αλλά μπορεί να είναι και σχέδιο δράσης ή τελικό μήνυμα. Η σωστή ανάγνωση των αποτελεσμάτων απαιτεί αυτό το roll-up με τη σωστή σειρά και όχι πρόχειρους μέσους όρους.

Ποια metrics έχουν πραγματική αξία

Σύμφωνα με το άρθρο, ένα benchmark εργαλείων εξετάζει τρία πράγματα με αυτή τη σειρά: αν το μοντέλο αποφάσισε ότι χρειάζεται εργαλείο, αν επέλεξε το σωστό και αν συμπλήρωσε σωστά τα ορίσματα. Από εκεί και πέρα, τα αποτελέσματα συνοψίζονται σε τρεις βασικούς άξονες: ακρίβεια, φλυαρία στην εκτέλεση και κόστος. Το task success rate είναι το βασικό κριτήριο κυκλοφορίας, επειδή απαντά αν το περιβάλλον έφτασε στον επιθυμητό στόχο. Όμως δεν αρκεί από μόνο του.

Ιδιαίτερη βαρύτητα δίνεται στη συνέπεια της επιτυχίας σε 3 έως 5 trials, επειδή τα στοχαστικά συστήματα δεν πρέπει να κρίνονται από ένα μόνο ποσοστό. Το tool-call precision δείχνει αν το μοντέλο κάνει περιττές ή λανθασμένες κλήσεις, ενώ το argument accuracy απομονώνει τα σφάλματα συμπλήρωσης ορισμάτων από την επιλογή λανθασμένου API. Παράλληλα, τα steps per success και cost per success δείχνουν πόσο αποτελεσματικά ολοκληρώνεται μια επιτυχημένη εργασία. Η Nvidia υπογραμμίζει επίσης ότι η παράλληλη κλήση εργαλείων μπορεί να μειώσει τα βήματα και την καθυστέρηση, όχι όμως τον συνολικό αριθμό κλήσεων.

Γιατί δύο benchmarks δεν είναι πάντα συγκρίσιμα

Δύο συστήματα μπορεί να δηλώνουν ότι μετρούν tool calling και, παρ’ όλα αυτά, τα αποτελέσματά τους να μην είναι συγκρίσιμα. Η πρώτη μεγάλη διαφορά είναι η πολυπλοκότητα των εργασιών, αν δηλαδή πρόκειται για μία απλή, μονοστροφική κλήση ή για πολυσταδιακή διαδικασία με σχεδιασμό, ανάκαμψη και διαχείριση κατάστασης. Ένα benchmark μίας κλήσης δεν αποκαλύπτει αν ο agent θα αποτύχει στο όγδοο βήμα μιας αλυσίδας δεκαπέντε ενεργειών. Γι’ αυτό οι υψηλές επιδόσεις σε απλές δοκιμές δεν μεταφράζονται αυτόματα σε επιχειρησιακή αξιοπιστία.

Η δεύτερη κρίσιμη διάσταση είναι η δυναμική διατήρηση κατάστασης του περιβάλλοντος και η τρίτη η μεθοδολογία επαλήθευσης. Τα stateful benchmarks μπορούν να αναδείξουν drift, απώλεια συμφραζομένων και αλλοίωση κατάστασης, προβλήματα που δεν εμφανίζονται σε στατικά σύνολα. Ως χρυσό πρότυπο προτείνεται η εκτελέσιμη επαλήθευση, αν δηλαδή ενημερώθηκε η βάση, πέρασαν τα tests ή έκλεισε σωστά ένα ticket. Όπου αυτό δεν είναι δυνατό, το LLM-as-a-Judge μπορεί να χρησιμοποιηθεί, αλλά η Nvidia τονίζει ότι τα ευρήματά του πρέπει να θεωρούνται προσωρινά μέχρι να ελεγχθούν έναντι ανθρώπινων αξιολογήσεων.

Το παράδειγμα του SWE-bench και η ανάγνωση ενός trace

Για να εξηγήσει τη διαφορά ανάμεσα σε σωστά βήματα και σωστό αποτέλεσμα, το άρθρο παραθέτει δημόσιο trace από πραγματική εκτέλεση στο SWE-bench Verified. Στο συγκεκριμένο task, ο agent έπρεπε να τροποποιήσει κώδικα σε αποθετήριο ώστε να λυθεί πραγματικό issue του GitHub και να περάσουν οι σχετικοί έλεγχοι. Το περιβάλλον ήταν πραγματικό filesystem με git, με εργαλεία όπως terminal, file_editor, task_tracker και finish. Η εκτέλεση δεν επέτρεπε παράλληλα tool calls και η κατάσταση του repository διατηρούνταν από turn σε turn.

Στο trace καταγράφεται μια μικρή αναποτελεσματικότητα, όταν ο agent άνοιξε ολόκληρο μεγάλο αρχείο πριν περιορίσει την αναζήτηση στις σχετικές γραμμές. Αυτή η κίνηση κρίθηκε περιττή στο step-level scoring, αλλά στη συνέχεια διορθώθηκε με πιο στοχευμένη αναζήτηση. Το αποτέλεσμα ήταν ότι ο end-to-end έλεγχος πέρασε επιτυχώς, άρα η εργασία θεωρήθηκε ολοκληρωμένη, ενώ τα επιμέρους metrics κατέγραψαν tool-call precision 3/4 και argument accuracy 4/4. Αυτό δείχνει ακριβώς γιατί μια μικρή αστοχία στη διαδρομή δεν πρέπει να συγχέεται με πλήρη αποτυχία, αλλά ούτε και να εξαφανίζεται από την ανάλυση.

Τι σημαίνει αυτό για επιχειρήσεις και μοντέλα όπως το Nemotron

Η Nvidia υποστηρίζει ότι πολλά από τα benchmarks που σήμερα θεωρούνται γενικής ικανότητας μετρούν ήδη έμμεσα τη χρήση εργαλείων, επειδή τα σύγχρονα συστήματα δεν αναπτύσσονται χωρίς αυτά. Το HumanEval, για παράδειγμα, προσφέρει εκτελέσιμη επαλήθευση μέσω unit tests, αλλά δεν περιλαμβάνει εργαλεία ή περιβάλλον δράσης. Με το SWE-bench η αλλαγή γίνεται πιο εμφανής, επειδή η επίλυση ενός πραγματικού issue απαιτεί αναζήτηση αρχείων, επεξεργασία κώδικα και επιτυχή εκτέλεση δοκιμών. Άρα η τελική βαθμολογία εκφράζει αποτέλεσμα, αλλά η διαδρομή προς αυτό αποτελείται σχεδόν εξ ολοκλήρου από tool calls.

Σε αυτό το πλαίσιο, η ανάγνωση των δημοσιευμένων μετρήσεων του Nemotron 3.5 Lightning πρέπει να γίνεται με όρους ολοκλήρωσης εργασιών και χρόνου μέχρι το αποτέλεσμα. Η Nvidia αναφέρει επιδόσεις σε διαφορετικά suites, όπως τραπεζικές συνομιλίες πολλών γύρων, το GDPval-AA v2 και το PinchBench, όπου το μοντέλο φέρεται να φτάνει σε 86% accuracy, ολοκληρώνοντας 10.000 tasks έως 30% ταχύτερα από το Qwen3.6 35B με συγκρίσιμη ακρίβεια. Ωστόσο, το ίδιο το άρθρο επιμένει ότι τα δημόσια scores δεν πρέπει να λειτουργούν ως τελικό release gate. Η ουσιαστική απόφαση πρέπει να στηρίζεται σε αξιολόγηση πάνω στα δικά σου tickets, traces, APIs και πολιτικές, με τελικό κριτήριο την πραγματική κατάσταση του περιβάλλοντος.

Πηγές

  • https://developer.nvidia.com/blog/how-to-evaluate-ai-agents-from-tool-calls-to-task-completion/
Tags: AI AgentsAI NewsMachine LearningNvidia

ΣΧΕΤΙΚΑ ΑΡΘΡΑ

Πώς το MCP αλλάζει το εταιρικό λογισμικό
Νέα

Πώς το MCP αλλάζει το εταιρικό λογισμικό

by Kyriakos Koutsourelis
2 Οκτωβρίου, 2026
Σημαντικό ρόλο στον νέο ψηφιακό πυρήνα έχουν η ενσωματωμένη τεχνητή νοημοσύνη (AI) και οι Oracle Fusion Agentic Applications. Μέσω αυτών, καθημερινές εργασίες logistics και προμηθειών μπορούν να αυτοματοποιούνται, ενώ οι εργαζόμενοι αποκτούν άμεση πρόσβαση σε ενημερωμένα επιχειρησιακά δεδομένα.
Νέα

Η Combe εκσυγχρονίζει την εφοδιαστική αλυσίδα με Oracle Fusion

by Theodoros Kostogiannis
1 Οκτωβρίου, 2026
Η παγκόσμια υιοθέτηση της AI αυξάνεται, αλλά οι ανισότητες βαθαίνουν
Νέα

AI: αυξάνεται η υιοθέτηση, μεγαλώνουν τα περιφερειακά χάσματα

by Kyriakos Koutsourelis
1 Οκτωβρίου, 2026
Η Toyota ενισχύει τη στρατηγική της στη ρομποτική και το Physical AI, εξετάζοντας την αξιοποίηση περίπου 400.000 ρομπότ στα εργοστάσια, στις εταιρείες του ομίλου και στους βασικούς προμηθευτές της. Η πιθανή επένδυση θα μπορούσε να φτάσει τα 6,4 δισ. δολάρια ετησίως από το 2028 και να καλύπτει βιομηχανικά και ανθρωποειδή ρομπότ, αυτοματοποιημένα logistics και συστήματα συνεργασίας ανθρώπων και μηχανών.
Νέα

Η Toyota αναπτύσσει physical AI για τα εργοστάσια του μέλλοντος

by Theodoros Kostogiannis
30 Σεπτεμβρίου, 2026
Η AMD και η Perplexity επεκτείνουν τις δυνατότητες του τοπικού AI στα Windows PCs, φέρνοντας το Portable Computer σε συστήματα με επεξεργαστές AMD Ryzen AI Max Series. Η υποστήριξη περιλαμβάνει και την πλατφόρμα ανάπτυξης AMD Ryzen AI Halo, επιτρέποντας στους συνδρομητές της Perplexity να εκτελούν AI εργασίες και επαναλαμβανόμενα workflows απευθείας στο δικό τους hardware. Οι Ryzen AI Max συνδυάζουν CPU και GPU με μεγάλη ποσότητα κοινόχρηστης μνήμης, δημιουργώντας τις κατάλληλες προϋποθέσεις για την τοπική εκτέλεση AI μοντέλων παράλληλα με τις καθημερινές εφαρμογές.
Νέα

AMD και Perplexity ενισχύουν τα agentic PCs με τοπική AI

by Theodoros Kostogiannis
30 Σεπτεμβρίου, 2026
Γιατί η ασφάλεια σε κάθε στάδιο είναι κρίσιμη για το Physical AI
Νέα

Physical AI και ασφάλεια: γιατί απαιτείται σε κάθε στάδιο

by Kyriakos Koutsourelis
30 Σεπτεμβρίου, 2026
Η Microsoft επεκτείνει σημαντικά τις δυνατότητες του Copilot, μετατρέποντάς το από έναν AI assistant σε μια ολοκληρωμένη πλατφόρμα εργασίας με αυτόνομους agents και δυνατότητα δημιουργίας εφαρμογών. Η νέα έκδοση οργανώνεται γύρω από τρεις βασικές ενότητες: Home, Code και Autopilot. Το Home συγκεντρώνει τις λειτουργίες συνομιλίας και συνεργασίας, ενώ ενσωματώνει εργαλεία από Word, Excel και PowerPoint. Το Code επιτρέπει στους χρήστες να περιγράφουν με φυσική γλώσσα μια εφαρμογή, ένα dashboard ή ένα automation και το Copilot να αναλαμβάνει τη δημιουργία του.
Νέα

Η Microsoft αναβαθμίζει το Copilot με μόνιμο Autopilot

by Theodoros Kostogiannis
29 Σεπτεμβρίου, 2026
Η Amazon διευρύνει την πρόσβαση των φοιτητών στην εκπαίδευση στην AI
Νέα

Amazon: διευρύνει την εκπαίδευση φοιτητών στην AI

by Kyriakos Koutsourelis
29 Σεπτεμβρίου, 2026
Η χρήση AI για τη δημιουργία κώδικα επιταχύνει σημαντικά την ανάπτυξη λογισμικού, όμως η αύξηση της παραγωγικότητας των developers φαίνεται να δημιουργεί νέα σημεία συμφόρησης στις διαδικασίες testing. Σύμφωνα με έρευνα της DeviQA σε 4.000 ειδικούς διασφάλισης ποιότητας, το 65% αναφέρει ότι τα νέα features φτάνουν γρηγορότερα στο στάδιο της επικύρωσης. Ωστόσο, το 64% βλέπει τις εργασίες να καταφθάνουν σε παράλληλες παρτίδες, επιβαρύνοντας τα delivery pipelines, ενώ το 55% καταγράφει αύξηση των testing backlogs.
Νέα

AI coding: Ταχύτερη ανάπτυξη, περισσότερα προβλήματα στο testing

by Theodoros Kostogiannis
28 Σεπτεμβρίου, 2026

Πρόσφατα Άρθρα

Πώς αξιολογούνται σωστά τα AI agents στην πράξη

Αξιολόγηση AI agents: από tool calls έως task completion

3 Οκτωβρίου, 2026
Πώς το MCP αλλάζει το εταιρικό λογισμικό

Πώς το MCP αλλάζει το εταιρικό λογισμικό

2 Οκτωβρίου, 2026
Σημαντικό ρόλο στον νέο ψηφιακό πυρήνα έχουν η ενσωματωμένη τεχνητή νοημοσύνη (AI) και οι Oracle Fusion Agentic Applications. Μέσω αυτών, καθημερινές εργασίες logistics και προμηθειών μπορούν να αυτοματοποιούνται, ενώ οι εργαζόμενοι αποκτούν άμεση πρόσβαση σε ενημερωμένα επιχειρησιακά δεδομένα.

Η Combe εκσυγχρονίζει την εφοδιαστική αλυσίδα με Oracle Fusion

1 Οκτωβρίου, 2026

Ετικέτες

Adobe AI Agents AI News AI Tools AI Ρομποτική AI στην καθημερινότητα Alibaba Amazon AMD Anthropic Apple AWS Azure AI Chatbot ChatGPT Claude Copilot Deepmind DeepSeek Gemini GenAI Google Grok Huggingface IBM Intel Llama Machine Learning Meta Microsoft Mistral Nvidia OpenAI Oracle Perplexity Physical AI Salesforce Samsung xAI Εκπαίδευση Επιχειρήσεις Ευρωπαϊκή Ένωση Ηνωμένες Πολιτείες Αμερικής Μέσα Κοινωνικής Δικτύωσης Υγεία

Μενού

  • Αρχική
  • Νέα
  • Εργαλεία AI
    • Για Βίντεο
    • Για Εικόνα
    • Για Εκπαιδευτικούς
    • Για Εξειδικευμένες Εφαρμογές
    • Για Ήχο
    • Για Κείμενο
  • Εφαρμογές AI
  • Βασικές έννοιες
  • Εκπαιδευτικά Προγράμματα
    • Δωρεάν σεμινάρια AI
    • Κατάρτηση AI
  • Σχετικά με εμάς
  • Βασικές έννοιες
  • Όροι Χρήσης
  • Ιδιωτικότητα

© 2024 Gain - Greek AI Network, all rights reserved.

No Result
View All Result
  • Αρχική
  • Νέα
  • Εργαλεία AI
    • Για Βίντεο
    • Για Εικόνα
    • Για Εκπαιδευτικούς
    • Για Εξειδικευμένες Εφαρμογές
    • Για Ήχο
    • Για Κείμενο
  • Εφαρμογές AI
  • Βασικές έννοιες
  • Εκπαιδευτικά Προγράμματα
    • Δωρεάν σεμινάρια AI
    • Κατάρτηση AI

© 2024 Gain - Greek AI Network, all rights reserved.