| dc.contributor.author |
Παπαδόπουλος, Σπυρίδων
|
el |
| dc.contributor.author |
Papadopoulos, Spyridon
|
en |
| dc.date.accessioned |
2026-09-01T07:16:50Z |
|
| dc.date.available |
2026-09-01T07:16:50Z |
|
| dc.identifier.uri |
https://dspace.lib.ntua.gr/xmlui/handle/123456789/65653 |
|
| dc.identifier.uri |
http://dx.doi.org/10.26240/heal.ntua.33347 |
|
| dc.rights |
Default License |
|
| dc.subject |
GPU simulation |
en |
| dc.subject |
MIG |
en |
| dc.subject |
Accel-Sim |
en |
| dc.subject |
GPGPU-Sim |
en |
| dc.subject |
AccelWattch |
en |
| dc.subject |
Multi-Instance GPU |
en |
| dc.subject |
MPS |
en |
| dc.subject |
GPU partitioning |
en |
| dc.subject |
Performance modeling |
en |
| dc.subject |
Power modeling |
en |
| dc.subject |
NVIDIA A30 |
en |
| dc.subject |
Computer Programming |
en |
| dc.subject |
Μοντελοποίηση επιδόσεων |
el |
| dc.subject |
Μοντελοποίηση ισχύος |
el |
| dc.subject |
Κατάτμηση GPU |
el |
| dc.subject |
MIG |
el |
| dc.subject |
Προσομοίωση GPU |
el |
| dc.title |
Performance and Power Modeling of Multi-Instance GPUs |
en |
| dc.contributor.department |
Τομέας Τεχνολογίας Πληροφορικής και Υπολογιστών |
el |
| heal.type |
bachelorThesis |
|
| heal.classification |
Computer Programming |
en |
| heal.language |
en |
|
| heal.access |
free |
|
| heal.recordProvider |
ntua |
el |
| heal.publicationDate |
2026-07-10 |
|
| heal.abstract |
Οι σύγχρονες GPU κέντρων δεδομένων μοιράζονται ολοένα και
περισσότερο μεταξύ πολλαπλών εφαρμογών και χρηστών, με τη χρήση
μηχανισμών όπως το NVIDIA Multi-Process Service (MPS) και το
Multi-Instance GPU (MIG), οι οποίοι κατατμούν ή συνδρομολογούν μία
μοναδική συσκευή ανάμεσα σε ταυτόχρονα εκτελούμενες εργασίες. Η πλέον
σύγχρονη, δημόσια διαθέσιμη υποδομή προσομοίωσης, το Accel-Sim για τη
μοντελοποίηση επιδόσεων και το AccelWattch για τη μοντελοποίηση ισχύος,
μοντελοποιεί την GPU σαν μία ενιαία μονολιθική συσκευή, που εκτελεί
μία εργασία τη φορά. Ως αποτέλεσμα, δεν έχει υπάρξει καθιερωμένος
τρόπος μελέτης, σε επίπεδο προσομοίωσης, της κατατμημένης,
συνυπάρχουσας (co-resident) εκτέλεσης.
Η παρούσα διπλωματική εργασία αντιμετωπίζει αυτό το κενό
επεκτείνοντας τον Accel-Sim σε ένα daemonized πλαίσιο προσομοίωσης
με επίγνωση της δυνατότητας κατάτμησης (partition-aware).
Η εργασία αρχικά αναπτύσσει τα απαιτούμενα αρχεία διαμόρφωσης του
Accel-Sim και του AccelWattch, προσαρμοσμένα για τη NVIDIA A30.
Στη συνέχεια, το αρχικό πλαίσιο μίας εκτέλεσης (single-shot)
επεκτείνεται ώστε να υποστηρίζει έναν μόνιμα ενεργό (persistent)
προσομοιωτή, ο οποίος αρχικοποιεί το μοντέλο της GPU μία φορά και
δέχεται εργασίες δυναμικά , δρομολογώντας τις υπό μια πολιτική
First-Come-First-Served
με επίγνωση των πόρων (resource-bound). Οι εργασίες μπορούν να
ανατεθούν σε ρητά καθορισμένα τμήματα (slices) της GPU, καθένα από τα
οποία κατέχει ένα ιδιωτικό σύνολο SMs και τμημάτων μνήμης.
Επιπλέον, επειδή μία εργασία μπορεί επίσης να περιοριστεί σε
ένα αυθαίρετο υποσύνολο SMs χωρίς να κατέχει ένα αποκλειστικό τμήμα
μνήμης, ο ίδιος μηχανισμός μπορεί να προσομοιώσει και τη συνυπάρχουσα
εκτέλεση τύπου MPS. Έτσι, το πλαίσιο υποστηρίζει όχι μόνο όλα τα
επίσημα διαθέσιμα προφίλ τύπου MIG της A30, αλλά και αυθαίρετα
καθορισμένους διαχωρισμούς της GPU σε τμήματα. Επιπλέον, συλλέγει
στατιστικά επιδόσεων ανά πυρήνα (per-kernel) και ανά τμήμα (per-slice)
και αποδίδει τις συνιστώσες ισχύος του AccelWattch στα ορισμένα
τμήματα της GPU.
Το επεκταμένο πλαίσιο επικυρώνεται τόσο έναντι του βασικού (baseline)
Accel-Sim όσο και έναντι της εκτέλεσης στην πραγματική Α30, ενώ
χρησιμοποιείται και για τη μελέτη προσαρμοσμένων σχημάτων κατάτμησης
που δεν παρέχονται από τα επίσημα προφίλ του MIG. Τα αποτελέσματα δείχνουν
ότι η προτεινόμενη υποδομή μοντελοποιεί την
κατατμημένη εκτέλεση, ενώ δίνει τη δυνατότητα για νέες μελέτες
τοποθέτησης εργασιών, καταλογισμού ισχύος και ασύμμετρης κατάτμησης.
Έτσι, η εργασία παρέχει ένα θεμέλιο για τη διερεύνηση
μελλοντικών πολιτικών διαμοιρασμού και δρομολόγησης της GPU σε επίπεδο
προσομοίωσης, προτού αυτές υλοποιηθούν σε πραγματικά συστήματα. |
el |
| heal.abstract |
Modern datacenter GPUs are increasingly shared between multiple
applications and users, using mechanisms such as
NVIDIA Multi-Process Service (MPS) and Multi-Instance GPU (MIG), which
partition or co-schedule a single device among concurrent
workloads. The state of the art publicly available simulation
infrastructure, namely Accel-Sim for performance and AccelWattch for
power modeling, models a single monolithic GPU executing one workload
at a time. As a result, there has been no established way to study, in simulation,
the timing and power behavior of partitioned, co-resident execution on
a concrete datacenter GPU.
This thesis addresses this gap by extending Accel-Sim into a
daemonized, partition-aware simulation framework for studying
multi-instance GPU execution. The work first develops the
required Accel-Sim and AccelWattch configurations calibrated
for the NVIDIA A30, which is the target of this thesis and an Ampere datacenter
GPU. Afterwards, the original single-shot framework is extended to
support a persistent simulator that initializes the GPU model once and accepts
jobs dynamically over a UNIX-domain socket, scheduling them under a
resource-aware First-Come-First-Served policy.
Jobs can be assigned to explicit GPU slices, each
owning a private set of SMs and memory partitions, and/or to user-selected
subsets. This ownership is enforced on both the compute and memory sides.
Because a workload can also be confined to an arbitrary SM subset without
a dedicated memory partition, the same mechanism additionally captures
MPS-style co-resident execution.
Thus, the framework allows for the simulation of not only all officially available
A30 MIG-style profiles, but also custom partition geometries within the same
infrastructure. The framework also extends observability
by collecting per-kernel and per-slice performance statistics and by
attributing AccelWattch power components to partitioned executions.
The extended framework is validated against both baseline Accel-Sim and real
A30 hardware. The evaluation examines the performance behavior for
single-instance and multi-instance
configurations, validates single-slice and aggregate multi-slice power
estimates against hardware measurements, and uses the framework to study custom
partition geometries
that are not directly exposed by hardware MIG profiles. The results show
that the proposed infrastructure can model partitioned GPU execution while
enabling new studies of workload placement, power attribution, and
asymmetric GPU partitioning. Overall, this thesis provides a foundation
for exploring future GPU sharing and scheduling policies in simulation
before they are implemented in real systems. |
en |
| heal.advisorName |
Xydis, Sotirios |
en |
| heal.committeeMemberName |
Σούντρης, Δημήτριος |
el |
| heal.committeeMemberName |
Πεκμεστζή, Κιαμάλ |
el |
| heal.academicPublisher |
Εθνικό Μετσόβιο Πολυτεχνείο. Σχολή Ηλεκτρολόγων Μηχανικών και Μηχανικών Υπολογιστών. Τομέας Τεχνολογίας Πληροφορικής και Υπολογιστών |
el |
| heal.academicPublisherID |
ntua |
|
| heal.numberOfPages |
226 |
|
| heal.fullTextAvailability |
false |
|