Τεχνητή Νοημοσύνη – Νέα & Εργαλεία | Greek AI Network

Greek AI Network

  • Αρχική
  • Νέα
  • Εργαλεία AI
    • Για Βίντεο
    • Για Εικόνα
    • Για Εκπαιδευτικούς
    • Για Εξειδικευμένες Εφαρμογές
    • Για Ήχο
    • Για Κείμενο
  • Εφαρμογές AI
  • Βασικές έννοιες
  • Εκπαιδευτικά Προγράμματα
    • Δωρεάν σεμινάρια AI
    • Κατάρτηση AI
No Result
View All Result
Τεχνητή Νοημοσύνη – Νέα & Εργαλεία | Greek AI Network
  • Αρχική
  • Νέα
  • Εργαλεία AI
    • Για Βίντεο
    • Για Εικόνα
    • Για Εκπαιδευτικούς
    • Για Εξειδικευμένες Εφαρμογές
    • Για Ήχο
    • Για Κείμενο
  • Εφαρμογές AI
  • Βασικές έννοιες
  • Εκπαιδευτικά Προγράμματα
    • Δωρεάν σεμινάρια AI
    • Κατάρτηση AI
No Result
View All Result
Τεχνητή Νοημοσύνη – Νέα & Εργαλεία | Greek AI Network

Greek AI Network

No Result
View All Result
Home Νέα

JAX και Transformer Engine για ταχύτερη εκπαίδευση dropless MoE

by Kyriakos Koutsourelis
23 Σεπτεμβρίου, 2026
in Νέα
0
Πώς το JAX και το Transformer Engine επιταχύνουν την εκπαίδευση dropless MoE
Share on FacebookShare on Twitter

Τα Mixture of Experts, ή MoE, έχουν εξελιχθεί σε μία από τις πιο χαρακτηριστικές αρχιτεκτονικές τάσεις στην εκπαίδευση μεγάλων μοντέλων AI. Η βασική ιδέα είναι ότι, αντί όλα τα tokens να περνούν από το ίδιο πυκνό feed-forward δίκτυο, ένα σύστημα δρομολόγησης επιλέγει δυναμικά ποιοι experts θα ενεργοποιηθούν. Έτσι, η υπολογιστική ισχύς χρησιμοποιείται πιο επιλεκτικά, χωρίς να απαιτείται η πλήρης ενεργοποίηση ολόκληρου του μοντέλου σε κάθε βήμα.

Σύμφωνα με τη NVIDIA, αυτή η προσέγγιση επιτρέπει σε μοντέλα όπως τα DeepSeek, Qwen και Mixtral να ανταγωνίζονται ή και να ξεπερνούν πυκνά μοντέλα, με χαμηλότερο κόστος εκπαίδευσης. Παρ’ όλα αυτά, η θεωρητική αποδοτικότητα δεν μεταφράζεται αυτόματα σε πραγματική απόδοση στο hardware. Το νέο τεχνικό άρθρο της εταιρείας εστιάζει ακριβώς σε αυτό το κενό, δείχνοντας πώς το JAX και το NVIDIA Transformer Engine μπορούν να βελτιώσουν ουσιαστικά την εκπαίδευση dropless MoE.

Γιατί η εκπαίδευση MoE είναι τόσο απαιτητική

Σε επίπεδο παραγωγικής κλίμακας, τα MoE εισάγουν εμπόδια που δεν εμφανίζονται με την ίδια ένταση στα dense μοντέλα. Η δρομολόγηση των tokens, η αποστολή και η συλλογή των experts, η all-to-all επικοινωνία μεταξύ GPU και οι ακανόνιστοι υπολογισμοί GEMM δημιουργούν ένα σύνθετο προφίλ φόρτου. Το πρόβλημα γίνεται ακόμη πιο έντονο επειδή ο router μαθαίνει κατά την εκπαίδευση, άρα η κατανομή των tokens στους experts αλλάζει συνεχώς.

Αυτό σημαίνει ότι δύο διαφορετικά batches δεν έχουν απαραίτητα παρόμοια κατανομή φόρτου, ενώ ακόμη και μέσα στο ίδιο batch ένας expert μπορεί να φορτωθεί πολύ περισσότερο από έναν άλλο. Το αποτέλεσμα είναι ragged tensors, δηλαδή σχήματα που δεν είναι ομοιόμορφα και ορθογώνια, όπως περιμένουν οι περισσότερες βελτιστοποιημένες βιβλιοθήκες. Αν η μεταφορά και η επανασύνθεση των tokens δεν γίνουν αποδοτικά, η επικοινωνία κυριαρχεί στον χρόνο εκτέλεσης και οι GPU μένουν ανεκμετάλλευτες.

Η διαφορά ανάμεσα σε dropless και capacity-based MoE

Η NVIDIA ξεχωρίζει δύο βασικές στρατηγικές για τη διαχείριση της δρομολόγησης των tokens: το dropless και το capacity-based MoE. Στο σενάριο dropless, κάθε token επεξεργάζεται από τον expert που του έχει ανατεθεί, ακόμη κι αν η κατανομή του φόρτου είναι άνιση. Αυτή η προσέγγιση θεωρείται ελκυστική από πλευράς ποιότητας μοντέλου, επειδή αποφεύγει να απορρίπτει δεδομένα ή να τα αλλοιώνει με τεχνητό padding.

Αντίθετα, στα capacity-based frameworks κάθε expert έχει ένα σταθερό όριο tokens. Όταν αυτό ξεπερνιέται, τα επιπλέον tokens είτε αποκόπτονται είτε προστίθεται padding, ώστε η υπολογιστική μορφή να παραμένει τακτική και φιλική προς το hardware. Το τίμημα είναι ένας άμεσος συμβιβασμός ανάμεσα στην αποδοτικότητα του συστήματος και στην πληρότητα των δεδομένων που χρησιμοποιούνται για την εκπαίδευση.

Οι βελτιστοποιήσεις που φέρνει το Transformer Engine

Η προσέγγιση dropless απαιτεί kernels που να χειρίζονται αποδοτικά μεταβλητό πλήθος tokens ανά expert, χωρίς να εξαρτώνται από σταθερά σχήματα. Επιπλέον, αυτές οι δυναμικές μορφές πρέπει να λειτουργούν χωρίς αναγκαστική εμπλοκή της CPU, ώστε να μην διακόπτονται τα CUDA graphs και να αποφεύγονται οι επαναμεταγλωττίσεις. Σε αυτό το πλαίσιο, το Transformer Engine προσφέρει τρία βασικά δομικά στοιχεία: group-aware MXFP8 quantization, grouped GEMM για expert matmuls και βελτιστοποιημένες λειτουργίες expert parallelism για dispatch και combine.

Ο συνδυασμός αυτών των στοιχείων επιτρέπει στο JAX να υλοποιεί πιο πρακτικά την εκπαίδευση MoE σε μεγάλη κλίμακα. Η λογική είναι διαχωρισμένη αλλά αλληλοσυμπληρούμενη. Το grouped GEMM αναλαμβάνει ό,τι συμβαίνει μέσα σε κάθε expert, ενώ το expert parallelism βελτιστοποιεί τη μεταφορά των tokens προς και από τους experts σε πολλαπλές GPU.

Grouped GEMM και αποδοτικότεροι υπολογισμοί

Σε ένα πυκνό FFN, όλα τα tokens περνούν από το ίδιο weight matrix, άρα η πράξη GEMM έχει ένα σταθερό και προβλέψιμο σχήμα. Στο MoE αυτό καταρρέει, επειδή οι experts λαμβάνουν διαφορετικό πλήθος tokens σε κάθε βήμα. Προηγούμενες προσεγγίσεις βασίζονταν είτε σε βρόχους με πολλαπλά GEMM kernels είτε σε batched GEMM με padding, λύσεις που είτε επιβάρυναν την κρίσιμη διαδρομή είτε σπαταλούσαν υπολογιστική ισχύ.

Η λύση grouped GEMM επιτρέπει να εκτελούνται όλες οι πράξεις των experts σε μία κλήση kernel, με βάση τον πραγματικό αριθμό tokens του καθενός. Έτσι, υπολογίζονται μόνο τα έγκυρα τμήματα και αποφεύγεται η υπερκάλυψη του δυσμενέστερου σεναρίου. Η NVIDIA αναφέρει ότι το Transformer Engine αξιοποιεί τα cuBLAS και cuBLASLt για να διατηρεί υψηλή αξιοποίηση των Tensor Cores ακόμη και με ακανόνιστα σχήματα, ενώ στις NVIDIA Blackwell GPU ανοίγει και ο δρόμος για MXFP8 block scaling στα expert matmuls.

Dispatch, combine και το βάρος της επικοινωνίας

Μετά τη δρομολόγηση των tokens από τον router, το σύστημα πρέπει να τα στείλει στις σωστές συσκευές, να εκτελέσει την επεξεργασία και στη συνέχεια να επιστρέψει τα αποτελέσματα στην αρχική τους σειρά. Αυτή η διαδικασία χωρίζεται στα στάδια dispatch και combine. Σε μια αφελή υλοποίηση, τα στάδια αυτά εκτελούνται σειριακά, με αποτέλεσμα καθυστερήσεις, πολλαπλές προσπελάσεις μνήμης και κακή επικάλυψη επικοινωνίας και υπολογισμού.

Η υλοποίηση expert parallelism του Transformer Engine ενοποιεί αυτή τη διαδρομή σε μια πιο σφιχτά συγχωνευμένη ροή kernels. Σύμφωνα με τη NVIDIA, βασίζεται στο NCCL EP, ένα backend επικοινωνίας προσαρμοσμένο ειδικά στα ακανόνιστα και ανισοβαρή μοτίβα που δημιουργεί η παράλληλη εκτέλεση experts. Περιλαμβάνει επίσης μηχανισμό deduplication των tokens, ώστε όταν ένα token αποστέλλεται σε πολλούς experts στο ίδιο rank ή σε πολλαπλά ranks σε απομακρυσμένο IB node, να διασχίζει το δίκτυο μόνο μία φορά.

Τα πρόσθετα βήματα στο JAX και η μετρημένη επίδοση

Πέρα από τα kernels του Transformer Engine, η NVIDIA αναφέρει δύο ακόμη σημαντικές βελτιώσεις στο ευρύτερο stack. Η πρώτη είναι το host offloading του JAX, που επιτρέπει ορισμένες ενδιάμεσες ενεργοποιήσεις να μεταφέρονται στη μνήμη του host αντί να παραμένουν καθ’ όλη τη διάρκεια του forward pass στη μνήμη της συσκευής. Για την εκπαίδευση του DeepSeek-V3, η εταιρεία αναφέρει ότι μεταφέρει στον host τα αποτελέσματα των query και value projections για εξοικονόμηση μνήμης.

Η δεύτερη είναι τα XLA multistreaming collectives, που επιτρέπουν στον compiler να εκτελεί ανεξάρτητες συλλογικές επικοινωνίες παράλληλα σε ξεχωριστά CUDA streams. Έτσι, οι μεταφορές μέσω InfiniBand μεταξύ κόμβων μπορούν να επικαλύπτονται με την επικοινωνία μέσω NVLink μέσα στον ίδιο κόμβο. Με αυτά τα βήματα, μαζί με cuBLAS GroupedGEMM, MXFP8 GroupQuant και το βελτιστοποιημένο EP, η NVIDIA δηλώνει ότι η απόδοση στο DeepSeek-V3 671B ανέβηκε από 103 TFLOPS/GPU σε 1.068 TFLOPS/GPU σε NVIDIA GB200, δηλαδή βελτίωση 10,4x.

Κλιμάκωση σε χιλιάδες GPUs και τα επόμενα βήματα

Η πραγματική δοκιμή τέτοιων τεχνικών δεν είναι μόνο η επίδοση σε ένα rack, αλλά η συμπεριφορά όταν το σύστημα μεγαλώνει σημαντικά. Η NVIDIA υποστηρίζει ότι με το JAX MoE stack και το Transformer Engine, η επιβάρυνση από την επικοινωνία παραμένει σχετικά ελεγχόμενη ακόμη και σε multirack ανάπτυξη. Συγκεκριμένα, αναφέρει 97% αποδοτικότητα στις 1.024 GPU, ένδειξη ότι οι βελτιστοποιήσεις στη διαδρομή επικοινωνίας διατηρούν υψηλό throughput καθώς μεγαλώνει το cluster.

Για όσους θέλουν να ξεκινήσουν με εκπαίδευση dropless MoE, οι σχετικές βελτιστοποιήσεις διατίθενται στο NVIDIA NGC MaxText container με ενσωματωμένο Transformer Engine. Η προτεινόμενη πρακτική είναι να ξεκινήσει κανείς από το reference configuration, να επιβεβαιώσει την ορθότητα σε μικρότερο μοντέλο MoE και στη συνέχεια να παρακολουθήσει μετρικές όπως step time, TFLOPS/GPU, MFU, latency του grouped GEMM και καθυστερήσεις στο dispatch και στο combine. Η εταιρεία σημειώνει επίσης ότι σχεδιάζει επιπλέον προσθήκες, όπως NVFP4, quantization fused with GEMM και A2A overlap.

Πηγές

  • https://developer.nvidia.com/blog/accelerating-dropless-moe-training-in-jax-with-nvidia-transformer-engine/

Tags: Deep LearningDeepSeekMachine LearningNvidia

ΣΧΕΤΙΚΑ ΑΡΘΡΑ

Η NVIDIA στο επίκεντρο της παγκόσμιας αγοράς των robotaxi
Νέα

NVIDIA και robotaxi: η πλατφόρμα πίσω από την κλιμάκωση

by Kyriakos Koutsourelis
22 Σεπτεμβρίου, 2026
Το Skild AI S1 μαθαίνει ρομποτικές εργασίες από βίντεο
Νέα

Skild AI S1: ρομπότ μαθαίνουν εργασίες από βίντεο

by Kyriakos Koutsourelis
20 Σεπτεμβρίου, 2026
Microsoft Discovery και προσαρμοστική AI στην επιστημονική έρευνα
Νέα

Microsoft Discovery και προσαρμοστική AI στην έρευνα

by Kyriakos Koutsourelis
19 Σεπτεμβρίου, 2026
Το άρθρο εξετάζει την αυξανόμενη ανησυχία γύρω από την ταχύτατη ανάπτυξη της Τεχνητής Νοημοσύνης (AI) και τις εκκλήσεις κορυφαίων στελεχών του κλάδου για επιβράδυνση. Προσωπικότητες όπως οι Dario Amodei (Anthropic), Sam Altman (OpenAI) και Elon Musk εκφράζουν προβληματισμό για τους πιθανούς κινδύνους των ολοένα ισχυρότερων μοντέλων AI.
Νέα

Οι ηγέτες της AI ζητούν επιβράδυνση, αλλά ποιος θα κάνει την αρχή;

by Theodoros Kostogiannis
14 Σεπτεμβρίου, 2026
Η NVIDIA χρησιμοποιεί Palantir Foundry, cuOpt και Nemotron 3.5 Lightning για βελτιστοποίηση και αυτοματοποίηση της εφοδιαστικής αλυσίδας παραγωγής AI hardware.
Νέα

Palantir και cuOpt βελτιστοποιούν την παραγωγή της NVIDIA

by Theodoros Kostogiannis
12 Σεπτεμβρίου, 2026
Η NVIDIA φέρνει το local AI πιο κοντά στους υπολογιστές με Windows
Νέα

NVIDIA: local AI και RTX Spark στην IFA 2026

by Kyriakos Koutsourelis
7 Σεπτεμβρίου, 2026
Πώς το NVIDIA Vera CPU αντιμετωπίζει τα bottlenecks του agentic AI
Νέα

NVIDIA Vera CPU για τα bottlenecks του agentic AI

by Kyriakos Koutsourelis
3 Σεπτεμβρίου, 2026
NVIDIA Vera Rubin NVL72 και το νέο μέτρο αποδοτικότητας για AI Agents
Νέα

NVIDIA Vera Rubin NVL72: νέο μέτρο αποδοτικότητας για AI Agents

by Kyriakos Koutsourelis
1 Σεπτεμβρίου, 2026
Με το Jetson Orin Nano 2, η NVIDIA επιχειρεί ουσιαστικά να κάνει την ισχυρή edge AI πιο προσιτή στους developers, επιτρέποντας σε μικρότερες και ενεργειακά αποδοτικές συσκευές να εκτελούν προηγμένα μοντέλα AI και να λαμβάνουν αποφάσεις σε πραγματικό χρόνο.
Νέα

Jetson Orin Nano 2: Ισχυρότερο AI για ρομπότ και drones

by Theodoros Kostogiannis
31 Αυγούστου, 2026

Πρόσφατα Άρθρα

Πώς το JAX και το Transformer Engine επιταχύνουν την εκπαίδευση dropless MoE

JAX και Transformer Engine για ταχύτερη εκπαίδευση dropless MoE

23 Σεπτεμβρίου, 2026
Multi-agent συστήματα τεχνητής νοημοσύνης αυτοματοποιούν λειτουργίες logistics, διαχείρισης αποθεμάτων και εφοδιαστικής αλυσίδας.

AI agents στις εφοδιαστικές αλυσίδες

22 Σεπτεμβρίου, 2026
Η NVIDIA στο επίκεντρο της παγκόσμιας αγοράς των robotaxi

NVIDIA και robotaxi: η πλατφόρμα πίσω από την κλιμάκωση

22 Σεπτεμβρίου, 2026

Ετικέτες

Adobe AI Agents AI News AI Tools AI Ρομποτική AI στην καθημερινότητα Alibaba Amazon AMD Anthropic Apple AWS Azure AI Chatbot ChatGPT Claude Copilot Deepmind DeepSeek Gemini GenAI Google Grok Huggingface IBM Intel Llama Machine Learning Meta Microsoft Mistral Nvidia OpenAI Oracle Perplexity Physical AI Salesforce Samsung xAI Εκπαίδευση Επιχειρήσεις Ευρωπαϊκή Ένωση Ηνωμένες Πολιτείες Αμερικής Μέσα Κοινωνικής Δικτύωσης Υγεία

Μενού

  • Αρχική
  • Νέα
  • Εργαλεία AI
    • Για Βίντεο
    • Για Εικόνα
    • Για Εκπαιδευτικούς
    • Για Εξειδικευμένες Εφαρμογές
    • Για Ήχο
    • Για Κείμενο
  • Εφαρμογές AI
  • Βασικές έννοιες
  • Εκπαιδευτικά Προγράμματα
    • Δωρεάν σεμινάρια AI
    • Κατάρτηση AI
  • Σχετικά με εμάς
  • Βασικές έννοιες
  • Όροι Χρήσης
  • Ιδιωτικότητα

© 2024 Gain - Greek AI Network, all rights reserved.

No Result
View All Result
  • Αρχική
  • Νέα
  • Εργαλεία AI
    • Για Βίντεο
    • Για Εικόνα
    • Για Εκπαιδευτικούς
    • Για Εξειδικευμένες Εφαρμογές
    • Για Ήχο
    • Για Κείμενο
  • Εφαρμογές AI
  • Βασικές έννοιες
  • Εκπαιδευτικά Προγράμματα
    • Δωρεάν σεμινάρια AI
    • Κατάρτηση AI

© 2024 Gain - Greek AI Network, all rights reserved.