Multi-agent reinforcement learning with diffusion models

Tsilifonis, Aris; Τσιλιφώνης, Άρης

dc.contributor.advisor	Vouros, George
dc.contributor.advisor	Βούρος, Γεώργιος
dc.contributor.author	Tsilifonis, Aris
dc.contributor.author	Τσιλιφώνης, Άρης
dc.date.accessioned	2025-09-05T10:35:31Z
dc.date.available	2025-09-05T10:35:31Z
dc.date.issued	2025-06
dc.identifier.uri	https://dione.lib.unipi.gr/xmlui/handle/unipi/18088
dc.description.abstract	Τα μοντέλα διάχυσης (diffusion models) έχουν εφαρμοστεί όλο και περισσότερο στον τομέα της Ενισχυτικής Μάθησης (Reinforcement Learning, RL) για την αντιμετώπιση πολύπλοκων προβλημάτων λήψης αποφάσεων. Ωστόσο, η αποτελεσματικότητα τους στη μάθηση πολιτικών για πολλαπλούς πράκτορες δεν έχει μελετηθεί επαρκώς στη βιβλιογραφία. Η παρούσα διπλωματική εξετάζει πώς αυτά τα μοντέλα μπορούν να ενισχύσουν τις τεχνικές Πολυπρακτορικής Ενισχυτικής Μάθησης (Multi-Agent RL, MARL) σε σύνθετα περιβάλλοντα πολλαπλών πρακτόρων, εντός του διακεκριμένου πλαισίου Κεντρικοποιημένης Εκπαίδευσης με Αποκεντρωμένη Εκτέλεση (Centralized Training with Decentralized Execution-CTDE). Παρουσιάζουμε μια μέθοδο MARL, με την ονομασία Q-Diffuser, η οποία στοχεύει στον εμπνευσμένο (imaginative) σχηματισμό μηνυμάτων επικοινωνίας μεταξύ των πρακτόρων και στη χρήση των εξαγόμενων νοημάτων για τη βελτίωση της εκτίμησης της συνάρτησης Q, βασιζόμενη στον κορυφαίο αλγόριθμο MARL QMIX. Η προσέγγιση αξιοποιεί μια ευρεία γκάμα σύγχρονων τεχνικών, συμπεριλαμβανομένων των Πιθανοτικών Μοντέλων Διάχυσης με Αποθορυβοποίηση (Denoising Diffusion Probabilistic Models-DDPM), αρχιτεκτονικών μετασχηματιστών (transformers) και της ιδιότητας Ατομικό-Ολικό Μέγιστο (Individual-Global-Max -IGM). Πειραματικά, αξιολογούμε τον Q-Diffuser στο ευρέως χρησιμοποιούμενο κριτήριο αξιολόγησης απόδοσης StarCraft Multi-Agent Challenge (SMAC) και καταδεικνύουμε ανώτερη απόδοση σε σχέση με τον κλασικό QMIX σε ένα ποικίλο σύνολο απαιτητικών σεναρίων, συμπεριλαμβανομένων των δύσκολων και πολύ δύσκολων χαρτών.	el
dc.format.extent	85	el
dc.language.iso	en	el
dc.publisher	Πανεπιστήμιο Πειραιώς	el
dc.rights	Αναφορά Δημιουργού-Μη Εμπορική Χρήση-Όχι Παράγωγα Έργα 3.0 Ελλάδα	*
dc.rights.uri	http://creativecommons.org/licenses/by-nc-nd/3.0/gr/	*
dc.title	Multi-agent reinforcement learning with diffusion models	el
dc.title.alternative	Πολυπρακτορική ενισχυτική μάθηση με μοντέλα διάχυσης	el
dc.type	Master Thesis	el
dc.contributor.department	Σχολή Τεχνολογιών Πληροφορικής και Επικοινωνιών. Τμήμα Ψηφιακών Συστημάτων	el
dc.description.abstractEN	Diffusion models have been increasingly applied to Reinforcement Learning (RL) in order to deal with complex decision-making tasks. However, their effectiveness in learning multi-agent policies have not been thoroughly studied in the literature. This thesis explores how these models can enhance Multi-Agent RL (MARL) techniques in complex multi-agent environments under the celebrated CTDE schema. We present a MARL method, dubbed Q-Diffuser, which aims at inferring imaginative communication messages among agents, and further using meaningful inferred information to enhance the estimation of the Q-value function building upon the most premier MARL algorithm, called QMIX. The approach leverages a wide array of state-of-the-art techniques, including Denoising Diffusion Probabilistic Models (DDPM), transformer architectures, and the individual-global-max (IGM) property. Experimentally, we evaluate Q-Diffuser on the widely used StarCraft Multi-Agent Challenge (SMAC) benchmark and demonstrate superior performance over vanilla QMIX on a diverse set of challenging tasks, including Hard and Super-Hard maps.	el
dc.corporate.name	National Center of Scientific Research "Demokritos"	el
dc.contributor.master	Τεχνητή Νοημοσύνη - Artificial Intelligence	el
dc.subject.keyword	Deep Learning	el
dc.subject.keyword	Reinforcement Learning	el
dc.subject.keyword	Multi-agent Systems	el
dc.subject.keyword	Diffusion Models	el
dc.date.defense	2025-07-15

Αρχεία σε αυτό το τεκμήριο

Name:: Tsilifonis_mtn2323.pdf
Μέγεθος:: 9.778Mb
Τύπος:: PDF
Description:: Μεταπτυχιακή διατριβή

Προβολή/Άνοιγμα

Αυτό το τεκμήριο εμφανίζεται στις ακόλουθες συλλογές

Τμήμα Ψηφιακών Συστημάτων
Department of Digital Systems

Εμφάνιση απλής εγγραφής

Αναφορά Δημιουργού-Μη Εμπορική Χρήση-Όχι Παράγωγα Έργα 3.0 Ελλάδα

Εκτός από όπου διευκρινίζεται διαφορετικά, το τεκμήριο διανέμεται με την ακόλουθη άδεια:
Αναφορά Δημιουργού-Μη Εμπορική Χρήση-Όχι Παράγωγα Έργα 3.0 Ελλάδα