Τεχνητή Νοημοσύνη – Νέα & Εργαλεία | Greek AI Network

Greek AI Network

  • Αρχική
  • Νέα
  • Εργαλεία AI
    • Για Βίντεο
    • Για Εικόνα
    • Για Εκπαιδευτικούς
    • Για Εξειδικευμένες Εφαρμογές
    • Για Ήχο
    • Για Κείμενο
  • Εφαρμογές AI
  • Βασικές έννοιες
  • Εκπαιδευτικά Προγράμματα
    • Δωρεάν σεμινάρια AI
    • Κατάρτηση AI
No Result
View All Result
Τεχνητή Νοημοσύνη – Νέα & Εργαλεία | Greek AI Network
  • Αρχική
  • Νέα
  • Εργαλεία AI
    • Για Βίντεο
    • Για Εικόνα
    • Για Εκπαιδευτικούς
    • Για Εξειδικευμένες Εφαρμογές
    • Για Ήχο
    • Για Κείμενο
  • Εφαρμογές AI
  • Βασικές έννοιες
  • Εκπαιδευτικά Προγράμματα
    • Δωρεάν σεμινάρια AI
    • Κατάρτηση AI
No Result
View All Result
Τεχνητή Νοημοσύνη – Νέα & Εργαλεία | Greek AI Network

Greek AI Network

No Result
View All Result
Home Νέα

AMD MI300X: καλύτερη απόδοση LLM με διαχωρισμένο serving

by Theodoros Kostogiannis
30 Μαΐου, 2026
in Νέα
0
Διάγραμμα απόδοσης LLM serving με prefill-decode disaggregation σε AMD Instinct MI300X GPUs στο Oracle Cloud Infrastructure, συγκρίνοντας aggregated και disaggregated deployments ως προς latency, throughput και GPU efficiency.
Share on FacebookShare on Twitter

Εισαγωγή: Βελτιστοποίηση της Εξυπηρέτησης Παραγωγής LLM με Διαχωρισμό Προκαταβολής-Αποκωδικοποίησης

Η εξυπηρέτηση παραγωγής των μεγάλων γλωσσικών μοντέλων (LLM) αποτελεί τελικά ένα πρόβλημα βελτιστοποίησης των στόχων επιπέδου υπηρεσίας (SLO). Οι ομάδες δεν επιδιώκουν απλώς να μεγιστοποιήσουν την ακατέργαστη απόδοση, αλλά να επιτύχουν τους σωστούς στόχους καθυστέρησης και απόκρισης με το χαμηλότερο δυνατό κόστος υποδομής. Η διαχωρισμένη εξυπηρέτηση προκαταβολής-αποκωδικοποίησης με το llm-d1 προσφέρει έναν ισχυρό τρόπο για να επιτευχθεί αυτό, αλλά η αξιοποίηση των πλεονεκτημάτων της απαιτεί μια πειθαρχημένη προσέγγιση για την αναγνώριση της σωστής διαμόρφωσης για ένα συγκεκριμένο μοντέλο, φόρτο εργασίας και στόχο υπηρεσίας. Σε αυτό το άρθρο, παρουσιάζεται μια πρακτική μεθοδολογία για τη ρύθμιση της διαχωρισμένης εξυπηρέτησης PD, ώστε να επιτευχθούν οι στόχοι SLO με αποδοτικό τρόπο σε GPU AMD Instinct™ MI300X που φιλοξενούνται σε bare-metal GPU της OCI με δίκτυο RDMA πίσω από το RoCEv2.

Ξεκινάμε με την ανεξάρτητη αξιολόγηση των κύριων φάσεων της παραγωγής: αποκωδικοποίηση, προκαταβολή και συνολική εξυπηρέτηση. Με την απομόνωση αυτών των συμπεριφορών, οι επαγγελματίες μπορούν να κατανοήσουν καλύτερα το φάσμα απόδοσης κάθε σταδίου και να εντοπίσουν διαμορφώσεις υποψηφίων που ταιριάζουν καλά στο προφίλ υπολογισμού του μοντέλου. Αντί να μαντεύουν το σχήμα του συμπλέγματος ή τις αναλογίες πόρων, αυτό παρέχει ένα θεμελιωμένο σημείο εκκίνησης για την επιλογή διαμόρφωσης.

Ανάλυση και Αξιολόγηση των Υποψηφίων Διαμορφώσεων

Από εκεί, πραγματοποιούμε μια ανάλυση Pareto σε υποψήφιες διαμορφώσεις για να αξιολογήσουμε τις ανταλλαγές μεταξύ καθυστέρησης, ταυτόχρονης εκτέλεσης και αποδοτικότητας. Αυτό καθιστά δυνατή την αναγνώριση των βέλτιστων διαμορφώσεων σε διαφορετικά επίπεδα φόρτου και πού τα οφέλη του διαχωρισμού γίνονται πιο εμφανή. Αντί για μια μοναδική “καλύτερη” διαμόρφωση, το αποτέλεσμα είναι ένα πλαίσιο απόφασης: ποια διαμόρφωση PD έχει νόημα για έναν δεδομένο στόχο ταυτόχρονης εκτέλεσης και απαίτηση SLO.

Τέλος, επικυρώνουμε την επιλεγμένη διαμόρφωση με μια εκτέλεση κλίμακας, δείχνοντας πώς η μεθοδολογία επεκτείνεται από την αξιολόγηση ενός σταδίου σε μια ρεαλιστική κατανεμημένη ανάπτυξη. Το αποτέλεσμα είναι μια επαναλαμβανόμενη διαδικασία για τη μετάβαση από δεδομένα μικροαξιολόγησης σε αρχιτεκτονική εξυπηρέτησης έτοιμη για παραγωγή, βοηθώντας τελικά τις ομάδες να χρησιμοποιήσουν το llm-d για να επιτύχουν τους στόχους SLO με την πιο αποδοτική διαμόρφωση προκαταβολής-αποκωδικοποίησης.

Πώς να Διαμορφώσετε τον Διαχωρισμό Προκαταβολής-Αποκωδικοποίησης

Ο κύριος λόγος για τη χρήση του διαχωρισμού προκαταβολής-αποκωδικοποίησης είναι ότι επιτρέπει την εξειδίκευση μεταξύ των φάσεων προκαταβολής και αποκωδικοποίησης της πρόβλεψης. Η προκαταβολή είναι υπολογιστικά βαριά, και ένα μόνο αίτημα μπορεί να αξιοποιήσει πλήρως την υπολογιστική ισχύ της GPU. Αντίθετα, η αποκωδικοποίηση απαιτεί μεγάλη κίνηση δεδομένων και χρειάζεται μεγάλο αριθμό ταυτόχρονων αιτημάτων για να κορεστεί η υπολογιστική ισχύς στα γραμμικά στρώματα ενός LLM, απαιτώντας έτσι μεγάλο χώρο για την κρυφή μνήμη KV. Με τον διαχωρισμό P/D, μπορούμε να παραλληλίσουμε τις φάσεις προκαταβολής και αποκωδικοποίησης διαφορετικά.

Αξιολόγηση των Ανταλλαγών Απόδοσης

Για να αξιολογήσουμε τις ανταλλαγές απόδοσης μεταξύ συγκεντρωτικών και διαχωρισμένων διαμορφώσεων, σχεδιάζουμε την Απόδοση ανά GPU (TPSG) έναντι της Απόδοσης ανά Χρήστη (TPSU). Το TPSU, μετρημένο σε tokens ανά δευτερόλεπτο ανά χρήστη, αντιπροσωπεύει την αλληλεπίδραση του συστήματος. Το TPSG, μετρημένο σε tokens ανά δευτερόλεπτο ανά GPU, καταγράφει την αποδοτικότητα της υποδομής. Όσο υψηλότερο είναι το TPSG σε κάποιο TPSU, τόσο καλύτερα.

Συμπεράσματα και Εφαρμογές

Αυτή η εργασία δείχνει ότι η διαχωρισμένη εξυπηρέτηση προκαταβολής-αποκωδικοποίησης με το llm-d παρέχει μια συστηματική πορεία για τη βελτιστοποίηση των SLO πρόβλεψης στην υποδομή AMD MI300X. Η ανάλυση Pareto δείχνει ότι στο μεσαίο εύρος αλληλεπίδρασης, οι διαχωρισμένες αρχιτεκτονικές έχουν σταθερά υψηλότερη αποδοτικότητα GPU σε σύγκριση με τις συγκεντρωτικές διαμορφώσεις, μεταφραζόμενη άμεσα σε μειωμένα λειτουργικά κόστη για την εξυπηρέτηση LLM σε επιχειρήσεις. Επιπλέον, το πείραμα κλιμάκωσης επιβεβαιώνει ότι αυτά τα οφέλη επεκτείνονται σε αναπτύξεις πολλαπλών κόμβων, όπου μια διαχωρισμένη διάταξη με λιγότερους κόμβους μπορεί να υπερέχει των συγκεντρωτικών διαμορφώσεων σε υψηλότερους ρυθμούς αιτήσεων, ενώ διατηρεί χαμηλότερη καθυστέρηση P99 μεταξύ των tokens.

  1. https://github.com/llm-d/llm-d
  2. https://rocm.blogs.amd.com/artificial-intelligence/quick-reduce/README.html

Tags: AI NewsAMD

ΣΧΕΤΙΚΑ ΑΡΘΡΑ

Πώς το NVIDIA Vera CPU αντιμετωπίζει τα bottlenecks του agentic AI
Νέα

NVIDIA Vera CPU για τα bottlenecks του agentic AI

by Kyriakos Koutsourelis
3 Σεπτεμβρίου, 2026
Η εφαρμογή του EU AI Act κάνει τη διαχείριση της Τεχνητής Νοημοσύνης ακόμη πιο σημαντική. Οι οργανισμοί πρέπει να αποκτήσουν μεγαλύτερη ορατότητα σχετικά με τα συστήματα AI που χρησιμοποιούνται και να εφαρμόσουν διαδικασίες διακυβέρνησης, παρακολούθησης και καταγραφής.
Νέα

EU AI Act: Γιατί το Shadow AI απειλεί τις επιχειρήσεις

by Theodoros Kostogiannis
2 Σεπτεμβρίου, 2026
Γιατί η ποιότητα της μετάφρασης παραμένει κρίσιμη στην εποχή της AI
Νέα

Ποιότητα μετάφρασης με AI: τι έχει πραγματική σημασία

by Theodoros Kostogiannis
1 Σεπτεμβρίου, 2026
NVIDIA Vera Rubin NVL72 και το νέο μέτρο αποδοτικότητας για AI Agents
Νέα

NVIDIA Vera Rubin NVL72: νέο μέτρο αποδοτικότητας για AI Agents

by Kyriakos Koutsourelis
1 Σεπτεμβρίου, 2026
Με το Jetson Orin Nano 2, η NVIDIA επιχειρεί ουσιαστικά να κάνει την ισχυρή edge AI πιο προσιτή στους developers, επιτρέποντας σε μικρότερες και ενεργειακά αποδοτικές συσκευές να εκτελούν προηγμένα μοντέλα AI και να λαμβάνουν αποφάσεις σε πραγματικό χρόνο.
Νέα

Jetson Orin Nano 2: Ισχυρότερο AI για ρομπότ και drones

by Theodoros Kostogiannis
31 Αυγούστου, 2026
Μελέτη των York University και University of Calgary, βασισμένη σε εκατοντάδες αναφορές προγραμματιστών στο Reddit, καταγράφει σημαντικούς κινδύνους ασφαλείας σε AI-assisted περιβάλλοντα ανάπτυξης. Εργαλεία όπως GitHub Copilot, Cursor, Claude Code και Codex μπορούν να αποκτούν ευρεία πρόσβαση σε αρχεία, credentials και λειτουργίες του συστήματος, με αποτέλεσμα οι παραδοσιακοί μηχανισμοί προστασίας να μην επαρκούν πάντα. Η έρευνα τονίζει την ανάγκη για καλύτερη διαχείριση permissions, sandboxing, καταγραφή ενεργειών και σαφή όρια στο τι μπορούν να διαβάζουν, να τροποποιούν ή να εκτελούν οι AI coding agents.
Νέα

Οι AI coding agents δοκιμάζουν τα όρια ασφάλειας των IDE

by Theodoros Kostogiannis
30 Αυγούστου, 2026
Η ρύθμιση της AI πέρασε στην πράξη: ΕΕ, ΗΠΑ και Κίνα ενεργοποιούν νέους κανόνες
Εφαρμογές AI

Η ρύθμιση της AI πέρασε στην πράξη: ΕΕ, ΗΠΑ και Κίνα ενεργοποιούν νέους κανόνες

by Kyriakos Koutsourelis
29 Αυγούστου, 2026
AI Safety Index 2026: Κανένα κορυφαίο εργαστήριο AI δεν ξεπερνά το C+
Νέα

AI Safety Index 2026: Κανένα κορυφαίο εργαστήριο AI δεν ξεπερνά το C+

by Kyriakos Koutsourelis
28 Αυγούστου, 2026
Το MIT δημιούργησε ένα σύστημα AI που επιχειρεί να απαντήσει σε ένα κρίσιμο ερώτημα: πώς προετοιμάζεσαι για μια φυσική καταστροφή που δεν έχει συμβεί ποτέ στο παρελθόν; Οι ερευνητές Kai Chang και Themis Sapsis ανέπτυξαν τη μέθοδο η-learning, η οποία μπορεί να δημιουργεί χάρτες ακραίων καιρικών φαινομένων πέρα από όσα υπάρχουν στα ιστορικά δεδομένα. Για παράδειγμα, μπορεί να προσομοιώσει μια στατιστικά πιθανή καταιγίδα με βροχόπτωση πολύ μεγαλύτερη από το ιστορικό ρεκόρ μιας περιοχής. Η τεχνολογία θα μπορούσε να χρησιμοποιηθεί για τη δοκιμή ηλεκτρικών δικτύων, αντιπλημμυρικών έργων και άλλων κρίσιμων υποδομών απέναντι σε πρωτοφανή ακραία φαινόμενα.
Νέα

MIT: AI «βλέπει» ακραίο καιρό που δεν έχει καταγραφεί ποτέ

by Theodoros Kostogiannis
26 Αυγούστου, 2026
Next Post
Γιατί η Google καθυστερεί το Gemini 3.5 Pro και ποντάρει στο AI Coding

Γιατί η Google καθυστερεί το Gemini 3.5 Pro και ποντάρει στο AI Coding

Λογότυπο της Anthropic και αναφορά στο νέο Claude Opus 4.8, το αναβαθμισμένο AI μοντέλο για coding, agentic workflows και reasoning.

Claude Opus 4.8: Νέα εργαλεία για agents και developers

Anthropic: Εκρηκτική Ανάπτυξη και Κερδοφορία, αλλά οι Προκλήσεις της AI Αγοράς Παραμένουν

Anthropic: Εκρηκτική Ανάπτυξη και Κερδοφορία, αλλά οι Προκλήσεις της AI Αγοράς Παραμένουν

Πρόσφατα Άρθρα

Πώς το NVIDIA Vera CPU αντιμετωπίζει τα bottlenecks του agentic AI

NVIDIA Vera CPU για τα bottlenecks του agentic AI

3 Σεπτεμβρίου, 2026
Η εφαρμογή του EU AI Act κάνει τη διαχείριση της Τεχνητής Νοημοσύνης ακόμη πιο σημαντική. Οι οργανισμοί πρέπει να αποκτήσουν μεγαλύτερη ορατότητα σχετικά με τα συστήματα AI που χρησιμοποιούνται και να εφαρμόσουν διαδικασίες διακυβέρνησης, παρακολούθησης και καταγραφής.

EU AI Act: Γιατί το Shadow AI απειλεί τις επιχειρήσεις

2 Σεπτεμβρίου, 2026
Generative AI στις επιχειρήσεις: εφαρμογές, οφέλη και υιοθέτηση

Generative AI στις επιχειρήσεις: εφαρμογές και οφέλη

2 Σεπτεμβρίου, 2026

Ετικέτες

Adobe AI Agents AI News AI Tools AI Ρομποτική AI στην καθημερινότητα Alibaba Amazon AMD Anthropic Apple AWS Azure AI Chatbot ChatGPT Claude Copilot Deepmind DeepSeek Gemini GenAI Google Grok Huggingface IBM Intel Llama Machine Learning Meta Microsoft Mistral Nvidia OpenAI Oracle Perplexity Physical AI Samsung xAI Εκπαίδευση Επιχειρήσεις Ευρωπαϊκή Ένωση Ηνωμένες Πολιτείες Αμερικής Κίνα Μέσα Κοινωνικής Δικτύωσης Υγεία

Μενού

  • Αρχική
  • Νέα
  • Εργαλεία AI
    • Για Βίντεο
    • Για Εικόνα
    • Για Εκπαιδευτικούς
    • Για Εξειδικευμένες Εφαρμογές
    • Για Ήχο
    • Για Κείμενο
  • Εφαρμογές AI
  • Βασικές έννοιες
  • Εκπαιδευτικά Προγράμματα
    • Δωρεάν σεμινάρια AI
    • Κατάρτηση AI
  • Σχετικά με εμάς
  • Βασικές έννοιες
  • Όροι Χρήσης
  • Ιδιωτικότητα

© 2024 Gain - Greek AI Network, all rights reserved.

No Result
View All Result
  • Αρχική
  • Νέα
  • Εργαλεία AI
    • Για Βίντεο
    • Για Εικόνα
    • Για Εκπαιδευτικούς
    • Για Εξειδικευμένες Εφαρμογές
    • Για Ήχο
    • Για Κείμενο
  • Εφαρμογές AI
  • Βασικές έννοιες
  • Εκπαιδευτικά Προγράμματα
    • Δωρεάν σεμινάρια AI
    • Κατάρτηση AI

© 2024 Gain - Greek AI Network, all rights reserved.