Ένα μοντέλο για το «εκτελεστικό» στρώμα των agents
Η NVIDIA παρουσίασε το Nemotron 3.5 Lightning ως ένα ανοικτό μοντέλο που στοχεύει σε ένα πολύ συγκεκριμένο πρόβλημα των αυτόνομων συστημάτων AI. Οι agents που λειτουργούν για μεγάλο χρονικό διάστημα δεν αφιερώνουν το μεγαλύτερο μέρος του χρόνου τους στον σύνθετο σχεδιασμό, αλλά σε επαναλαμβανόμενες ενέργειες εκτέλεσης. Σε αυτές περιλαμβάνονται οι κλήσεις εργαλείων, ο έλεγχος των αποτελεσμάτων και η ανάθεση μικρότερων εργασιών σε υπο-agents. Σύμφωνα με την NVIDIA, η χρήση ενός πολύ μεγάλου reasoning model σε κάθε βήμα αυξάνει άσκοπα τόσο το κόστος όσο και την καθυστέρηση.
Μέσα σε αυτό το πλαίσιο, το Nemotron 3.5 Lightning τοποθετείται ως το μοντέλο που αναλαμβάνει τον μεγάλο όγκο της καθημερινής εργασίας. Αντί να ανταγωνίζεται τα μεγαλύτερα μοντέλα στον στρατηγικό σχεδιασμό, προορίζεται για το επίπεδο εκτέλεσης σε συστήματα που παραμένουν συνεχώς ενεργά. Η NVIDIA το συνδέει με harnesses όπως τα OpenClaw και Hermes Agent, τα οποία υποστηρίζονται από το open source stack NVIDIA NemoClaw για ασφάλεια και διαχείριση. Η εταιρεία περιγράφει έτσι μια αρχιτεκτονική στην οποία διαφορετικά μοντέλα αναλαμβάνουν διακριτούς ρόλους μέσα στην ίδια εφαρμογή.
Η θέση του μέσα στην οικογένεια Nemotron
Το Nemotron 3.5 Lightning είναι ένα ανοικτό μοντέλο 30B mixture-of-experts, με 3B ενεργές παραμέτρους ανά βήμα inference. Η επιλογή MoE έχει πρακτική σημασία, επειδή ο δρομολογητής του μοντέλου ενεργοποιεί μόνο ένα μικρό υποσύνολο ειδικών για κάθε token. Έτσι, η αρχιτεκτονική επιχειρεί να συνδυάσει την εκφραστική ικανότητα ενός μεγαλύτερου μοντέλου με υπολογιστικό κόστος που προσεγγίζει εκείνο ενός μικρότερου. Για σενάρια υψηλού όγκου, αυτή η ισορροπία είναι κρίσιμη.
Η NVIDIA το παρουσιάζει ως το μικρότερο μέλος της οικογένειας Nemotron 3, αλλά όχι ως αποκομμένο από τις τεχνικές των μεγαλύτερων εκδόσεων. Αναφέρει ότι ενσωματώνει μεθόδους που έχουν ήδη αξιοποιηθεί στα Nemotron 3 Super και Nemotron 3 Ultra. Παράλληλα, τοποθετεί το Lightning σε ένα μοντέλο λειτουργίας όπου τα frontier reasoning models αναλαμβάνουν την ορχήστρωση και τον σύνθετο προγραμματισμό, ενώ τα πιο ελαφριά μοντέλα χειρίζονται την παραγωγική εκτέλεση. Αυτή η διάκριση παραπέμπει σε ένα οικοσύστημα πολλαπλών μοντέλων και όχι σε μία ενιαία, καθολική λύση.
Προσαρμογή και ανοικτή διάθεση
Ένα από τα βασικά στοιχεία της ανακοίνωσης είναι ότι το μοντέλο διατίθεται με ανοικτό τρόπο, όχι μόνο ως βάρη αλλά και με δεδομένα και συνταγές εκπαίδευσης, όσο αυτό είναι δυνατό στο πλαίσιο της άδειας OpenMDW-1.1. Η NVIDIA υποστηρίζει ότι αυτό διευκολύνει την προσαρμογή του σε εξειδικευμένα workloads. Επειδή πρόκειται για μικρότερο μοντέλο σε σχέση με τις frontier επιλογές, το fine-tuning αναμένεται να είναι ταχύτερο και οικονομικότερο. Αυτό έχει ιδιαίτερη σημασία για ομάδες που θέλουν να πειραματιστούν χωρίς υποδομές υπερκλίμακας.
Η εταιρεία αναφέρει ότι οι προγραμματιστές μπορούν να χρησιμοποιήσουν LoRA ή πλήρες supervised fine-tuning μέσω των NeMo Automodel και NeMo Megatron Bridge. Παράλληλα, παρέχεται δυνατότητα reinforcement learning, αξιολογήσεων και rollouts μέσω των NeMo RL και NeMo Gym. Στην ίδια έκδοση περιλαμβάνεται και το dataset Nemotron-RL Agentic Terminal Pivot, το οποίο χρησιμοποιήθηκε για μέρος των δυνατοτήτων κώδικα του μοντέλου. Η προσέγγιση αυτή δείχνει ότι η NVIDIA δεν περιορίζεται στην παροχή ενός checkpoint, αλλά επιχειρεί να χτίσει μια πλήρη αλυσίδα ανάπτυξης γύρω από αυτό.
Δρομολόγηση εργασιών με NeMo Switchyard
Κεντρικό σημείο της ανακοίνωσης είναι και το NeMo Switchyard, μια βιβλιοθήκη που αναλαμβάνει τη δρομολόγηση κάθε εργασίας στο καταλληλότερο μοντέλο. Η NVIDIA θεωρεί ότι η ωρίμανση των συστημάτων δρομολόγησης και ορχήστρωσης είναι εξίσου σημαντική με την πρόοδο των ίδιων των μοντέλων. Σε πρακτικό επίπεδο, αυτό σημαίνει ότι μια εφαρμογή δεν χρειάζεται να αναθέτει κάθε αίτημα στο πιο ισχυρό και ακριβό μοντέλο. Μπορεί να μεταφέρει μόνο τα απαιτητικά βήματα σε frontier μοντέλα και να αναθέτει τη ρουτίνα στο Lightning.
Η λογική αυτή ταιριάζει ιδιαίτερα σε agents που εκτελούν πολλές απλές αλλά αναγκαίες ενέργειες. Εργασίες όπως ένα git pull, η επικύρωση της εξόδου ενός εργαλείου ή η μορφοποίηση ενός αποτελέσματος μπορεί να μην απαιτούν βαθύ σχεδιασμό, αλλά καταναλώνουν μεγάλο μέρος του token budget. Με το Switchyard, το Nemotron 3.5 Lightning μπορεί να λειτουργεί ως στόχος δρομολόγησης δίπλα σε ανοικτά και κλειστά μοντέλα. Έτσι, η αρχιτεκτονική που προτείνει η NVIDIA στοχεύει περισσότερο στη συνολική αποδοτικότητα του συστήματος παρά στη μεμονωμένη επίδοση ενός μόνο μοντέλου.
Επιδόσεις σε ταχύτητα και ακρίβεια
Η NVIDIA αναφέρει ότι το Nemotron 3.5 Lightning βρίσκεται στο accuracy-speed Pareto frontier της κατηγορίας του στο Artificial Analysis Intelligence Index. Ο συγκεκριμένος δείκτης συνδυάζει εννέα διαφορετικές αξιολογήσεις για agentic tasks, προγραμματισμό, επιστημονικό reasoning και γενική νοημοσύνη. Σύμφωνα με τα στοιχεία της εταιρείας, το μοντέλο πετυχαίνει υψηλή ακρίβεια ενώ ταυτόχρονα προσφέρει έως και τετραπλάσια ταχύτητα εξόδου σε σχέση με αντίστοιχα μοντέλα παρόμοιου μεγέθους. Η έμφαση εδώ δεν είναι μόνο στους ακατέργαστους tokens ανά δευτερόλεπτο, αλλά στην πραγματική ολοκλήρωση χρήσιμης εργασίας.
Στο PinchBench, η NVIDIA υποστηρίζει ότι το μοντέλο φτάνει σε ακρίβεια 86% και ολοκληρώνει 10.000 εργασίες έως 30% ταχύτερα από το Qwen3.6 35B σε παρόμοιο επίπεδο ακρίβειας. Αυτή η σύγκριση υπογραμμίζει μια σημαντική διαφορά ανάμεσα στη θεωρητική απόδοση και στη λειτουργική αποτελεσματικότητα σε ροές agentic εκτέλεσης. Για always-on agents, εκείνο που έχει μεγαλύτερη αξία είναι πόσο γρήγορα ολοκληρώνεται ο ωφέλιμος όγκος εργασιών. Η NVIDIA χρησιμοποιεί αυτά τα στοιχεία για να στηρίξει τον ισχυρισμό ότι το Lightning βελτιστοποιείται για πραγματική παραγωγική χρήση και όχι μόνο για benchmarks γενικής χρήσης.
Τεχνικές που στηρίζουν τη χαμηλή καθυστέρηση
Για να πετύχει υψηλή ταχύτητα χωρίς σημαντική απώλεια ακρίβειας, το μοντέλο βασίζεται σε speculative decoding και quantization. Η NVIDIA σημειώνει ότι κατά την εκπαίδευση ενσωματώθηκε multi-token prediction, ώστε το μοντέλο να μπορεί να προτείνει πολλαπλά tokens, τα οποία στη συνέχεια ελέγχονται αποδοτικά. Μετά το βασικό στάδιο προεκπαίδευσης, ακολούθησε και ειδική φάση βελτίωσης για την ενίσχυση της ακρίβειας του MTP. Πρόκειται για μια σαφή επένδυση στην επιτάχυνση του inference και όχι μόνο στη βελτίωση της ποιότητας του μοντέλου.
Επιπλέον, η NVIDIA διαθέτει μαζί με το Lightning δύο draft models, τα DSpark και DFlash, για διαφορετικά σενάρια εξυπηρέτησης. Το DSpark προτείνεται για workloads inference σε DGX Spark και για περιβάλλοντα data center με χαμηλή ταυτόχρονη χρήση, ενώ η εταιρεία σημειώνει ότι το MTP ταιριάζει περισσότερο σε μεσαία έως υψηλή ταυτόχρονη χρήση. Στο πεδίο της ποσοτικοποίησης, το μοντέλο προσφέρεται και σε NVFP4 checkpoint, εκτός από BF16. Η ίδια μορφή, σύμφωνα με την ανακοίνωση, μπορεί να χρησιμοποιηθεί τόσο σε data center όσο και σε επιτραπέζιο DGX Spark, σε GPU NVIDIA Blackwell, Hopper και Ampere.
Τοπική ανάπτυξη και οικοσύστημα εργαλείων
Ένα ακόμη στοιχείο της ανακοίνωσης είναι η στόχευση στην τοπική ανάπτυξη agentic AI. Η NVIDIA αναφέρει ότι το Nemotron 3.5 Lightning μπορεί να αξιοποιηθεί σε συστήματα όπως τα NVIDIA Jetson, GeForce RTX 5090 και DGX Spark. Αυτό διευρύνει το πεδίο χρήσης του πέρα από τα κλασικά cloud και περιβάλλοντα data center. Για ομάδες που ενδιαφέρονται για έλεγχο κόστους, χαμηλότερη εξάρτηση από εξωτερικές υπηρεσίες ή ειδικά edge σενάρια, η τοπική εκτέλεση έχει προφανές ενδιαφέρον.
Παράλληλα, το μοντέλο υποστηρίζεται από ένα ευρύ σύνολο εργαλείων και πλατφορμών, όπως τα LM Studio, llama.cpp, Ollama και Unsloth. Η NVIDIA παραθέτει επίσης ένα εκτεταμένο οικοσύστημα συνεργατών σε post-training, inference software, agent frameworks και hosted υπηρεσίες inference. Πρακτικά, αυτό σημαίνει ότι το Nemotron 3.5 Lightning δεν παρουσιάζεται ως μεμονωμένο ερευνητικό artifact, αλλά ως στοιχείο μιας ευρύτερης στοίβας ανάπτυξης και διάθεσης. Η στρατηγική της εταιρείας δείχνει ότι το επόμενο βήμα για τους AI agents δεν είναι μόνο τα μεγαλύτερα μοντέλα, αλλά και η πιο έξυπνη κατανομή της εργασίας ανάμεσα σε εξειδικευμένα, αποδοτικά συστήματα.













