HEAL DSpace

Performance and Power Modeling of Multi-Instance GPUs

Αποθετήριο DSpace/Manakin

Εμφάνιση απλής εγγραφής

dc.contributor.author Παπαδόπουλος, Σπυρίδων el
dc.contributor.author Papadopoulos, Spyridon en
dc.date.accessioned 2026-09-01T07:16:50Z
dc.date.available 2026-09-01T07:16:50Z
dc.identifier.uri https://dspace.lib.ntua.gr/xmlui/handle/123456789/65653
dc.identifier.uri http://dx.doi.org/10.26240/heal.ntua.33347
dc.rights Default License
dc.subject GPU simulation en
dc.subject MIG en
dc.subject Accel-Sim en
dc.subject GPGPU-Sim en
dc.subject AccelWattch en
dc.subject Multi-Instance GPU en
dc.subject MPS en
dc.subject GPU partitioning en
dc.subject Performance modeling en
dc.subject Power modeling en
dc.subject NVIDIA A30 en
dc.subject Computer Programming en
dc.subject Μοντελοποίηση επιδόσεων el
dc.subject Μοντελοποίηση ισχύος el
dc.subject Κατάτμηση GPU el
dc.subject MIG el
dc.subject Προσομοίωση GPU el
dc.title Performance and Power Modeling of Multi-Instance GPUs en
dc.contributor.department Τομέας Τεχνολογίας Πληροφορικής και Υπολογιστών el
heal.type bachelorThesis
heal.classification Computer Programming en
heal.language en
heal.access free
heal.recordProvider ntua el
heal.publicationDate 2026-07-10
heal.abstract Οι σύγχρονες GPU κέντρων δεδομένων μοιράζονται ολοένα και περισσότερο μεταξύ πολλαπλών εφαρμογών και χρηστών, με τη χρήση μηχανισμών όπως το NVIDIA Multi-Process Service (MPS) και το Multi-Instance GPU (MIG), οι οποίοι κατατμούν ή συνδρομολογούν μία μοναδική συσκευή ανάμεσα σε ταυτόχρονα εκτελούμενες εργασίες. Η πλέον σύγχρονη, δημόσια διαθέσιμη υποδομή προσομοίωσης, το Accel-Sim για τη μοντελοποίηση επιδόσεων και το AccelWattch για τη μοντελοποίηση ισχύος, μοντελοποιεί την GPU σαν μία ενιαία μονολιθική συσκευή, που εκτελεί μία εργασία τη φορά. Ως αποτέλεσμα, δεν έχει υπάρξει καθιερωμένος τρόπος μελέτης, σε επίπεδο προσομοίωσης, της κατατμημένης, συνυπάρχουσας (co-resident) εκτέλεσης. Η παρούσα διπλωματική εργασία αντιμετωπίζει αυτό το κενό επεκτείνοντας τον Accel-Sim σε ένα daemonized πλαίσιο προσομοίωσης με επίγνωση της δυνατότητας κατάτμησης (partition-aware). Η εργασία αρχικά αναπτύσσει τα απαιτούμενα αρχεία διαμόρφωσης του Accel-Sim και του AccelWattch, προσαρμοσμένα για τη NVIDIA A30. Στη συνέχεια, το αρχικό πλαίσιο μίας εκτέλεσης (single-shot) επεκτείνεται ώστε να υποστηρίζει έναν μόνιμα ενεργό (persistent) προσομοιωτή, ο οποίος αρχικοποιεί το μοντέλο της GPU μία φορά και δέχεται εργασίες δυναμικά , δρομολογώντας τις υπό μια πολιτική First-Come-First-Served με επίγνωση των πόρων (resource-bound). Οι εργασίες μπορούν να ανατεθούν σε ρητά καθορισμένα τμήματα (slices) της GPU, καθένα από τα οποία κατέχει ένα ιδιωτικό σύνολο SMs και τμημάτων μνήμης. Επιπλέον, επειδή μία εργασία μπορεί επίσης να περιοριστεί σε ένα αυθαίρετο υποσύνολο SMs χωρίς να κατέχει ένα αποκλειστικό τμήμα μνήμης, ο ίδιος μηχανισμός μπορεί να προσομοιώσει και τη συνυπάρχουσα εκτέλεση τύπου MPS. Έτσι, το πλαίσιο υποστηρίζει όχι μόνο όλα τα επίσημα διαθέσιμα προφίλ τύπου MIG της A30, αλλά και αυθαίρετα καθορισμένους διαχωρισμούς της GPU σε τμήματα. Επιπλέον, συλλέγει στατιστικά επιδόσεων ανά πυρήνα (per-kernel) και ανά τμήμα (per-slice) και αποδίδει τις συνιστώσες ισχύος του AccelWattch στα ορισμένα τμήματα της GPU. Το επεκταμένο πλαίσιο επικυρώνεται τόσο έναντι του βασικού (baseline) Accel-Sim όσο και έναντι της εκτέλεσης στην πραγματική Α30, ενώ χρησιμοποιείται και για τη μελέτη προσαρμοσμένων σχημάτων κατάτμησης που δεν παρέχονται από τα επίσημα προφίλ του MIG. Τα αποτελέσματα δείχνουν ότι η προτεινόμενη υποδομή μοντελοποιεί την κατατμημένη εκτέλεση, ενώ δίνει τη δυνατότητα για νέες μελέτες τοποθέτησης εργασιών, καταλογισμού ισχύος και ασύμμετρης κατάτμησης. Έτσι, η εργασία παρέχει ένα θεμέλιο για τη διερεύνηση μελλοντικών πολιτικών διαμοιρασμού και δρομολόγησης της GPU σε επίπεδο προσομοίωσης, προτού αυτές υλοποιηθούν σε πραγματικά συστήματα. el
heal.abstract Modern datacenter GPUs are increasingly shared between multiple applications and users, using mechanisms such as NVIDIA Multi-Process Service (MPS) and Multi-Instance GPU (MIG), which partition or co-schedule a single device among concurrent workloads. The state of the art publicly available simulation infrastructure, namely Accel-Sim for performance and AccelWattch for power modeling, models a single monolithic GPU executing one workload at a time. As a result, there has been no established way to study, in simulation, the timing and power behavior of partitioned, co-resident execution on a concrete datacenter GPU. This thesis addresses this gap by extending Accel-Sim into a daemonized, partition-aware simulation framework for studying multi-instance GPU execution. The work first develops the required Accel-Sim and AccelWattch configurations calibrated for the NVIDIA A30, which is the target of this thesis and an Ampere datacenter GPU. Afterwards, the original single-shot framework is extended to support a persistent simulator that initializes the GPU model once and accepts jobs dynamically over a UNIX-domain socket, scheduling them under a resource-aware First-Come-First-Served policy. Jobs can be assigned to explicit GPU slices, each owning a private set of SMs and memory partitions, and/or to user-selected subsets. This ownership is enforced on both the compute and memory sides. Because a workload can also be confined to an arbitrary SM subset without a dedicated memory partition, the same mechanism additionally captures MPS-style co-resident execution. Thus, the framework allows for the simulation of not only all officially available A30 MIG-style profiles, but also custom partition geometries within the same infrastructure. The framework also extends observability by collecting per-kernel and per-slice performance statistics and by attributing AccelWattch power components to partitioned executions. The extended framework is validated against both baseline Accel-Sim and real A30 hardware. The evaluation examines the performance behavior for single-instance and multi-instance configurations, validates single-slice and aggregate multi-slice power estimates against hardware measurements, and uses the framework to study custom partition geometries that are not directly exposed by hardware MIG profiles. The results show that the proposed infrastructure can model partitioned GPU execution while enabling new studies of workload placement, power attribution, and asymmetric GPU partitioning. Overall, this thesis provides a foundation for exploring future GPU sharing and scheduling policies in simulation before they are implemented in real systems. en
heal.advisorName Xydis, Sotirios en
heal.committeeMemberName Σούντρης, Δημήτριος el
heal.committeeMemberName Πεκμεστζή, Κιαμάλ el
heal.academicPublisher Εθνικό Μετσόβιο Πολυτεχνείο. Σχολή Ηλεκτρολόγων Μηχανικών και Μηχανικών Υπολογιστών. Τομέας Τεχνολογίας Πληροφορικής και Υπολογιστών el
heal.academicPublisherID ntua
heal.numberOfPages 226
heal.fullTextAvailability false


Αρχεία σε αυτό το τεκμήριο

Αυτό το τεκμήριο εμφανίζεται στην ακόλουθη συλλογή(ές)

Εμφάνιση απλής εγγραφής