BEGIN:VCALENDAR
VERSION:2.0
PRODID:-//TUC//Events//EN
CALSCALE:GREGORIAN
BEGIN:VTIMEZONE
TZID:Europe/Athens
TZNAME:EEST
DTSTART:19700329T030000
RRULE:FREQ=YEARLY;BYDAY=-1SU;BYMONTH=3
BEGIN:STANDARD
TZOFFSETFROM:+0200
TZOFFSETTO:+0300
TZNAME:EET
DTSTART:19701025T040000
RRULE:FREQ=YEARLY;BYDAY=-1SU;BYMONTH=10
END:STANDARD
END:VTIMEZONE
BEGIN:VEVENT
CREATED:20260623T115537Z
LAST-MODIFIED:20260623T115537Z
DTSTAMP:20260719T214341Z
UID:1784486621@tuc.gr
SUMMARY:Παρουσίαση Διπλωματικής Εργασίας κ. 
 Αθανασίου Κασσελά - Σχολή ΗΜΜΥ
LOCATION:
DESCRIPTION:https://www.ece.tuc.gr/el/katalogos-
 ekdiloseon?tx_tucevents2_tuceventsdi
 splay%5Baction%5D=show&tx_tucevents2
 _tuceventsdisplay%5Bcontroller%5D=Ev
 ent&tx_tucevents2_tuceventsdisplay%5
 Bevent%5D=8491&cHash=aed4bd27134efd8
 50420b997143ca6fd\nΠΟΛΥΤΕΧΝΕΙΟ ΚΡΗΤΗ
 Σ\n Σχολή Ηλεκτρολόγων Μηχανικών και
  Μηχανικών Υπολογιστών\n Πρόγραμμα Π
 ροπτυχιακών Σπουδών\n ΠΑΡΟΥΣΙΑΣΗ ΔΙΠ
 ΛΩΜΑΤΙΚΗΣ ΕΡΓΑΣΙΑΣ\n Αθανασίου Κασσε
 λά\n με θέμα\n Βαθιά Ενισχυτική Μάθη
 ση σε Στρατηγικά Περιβάλλοντα Πραγμα
 τικού Χρόνου\n Deep Reinforcement Le
 arning in a Real Time Strategy Envir
 onment\n Εξεταστική Επιτροπή\n Καθηγ
 ητής Γεώργιος Χαλκιαδάκης (επιβλέπων
 )\n Καθηγητής Μιχαήλ Λαγουδάκης \n Κ
 αθηγητής Θρασύβουλος Σπυρόπουλος\n Π
 ερίληψη\n Τα παιχνίδια στρατηγικής σ
 ε πραγματικό χρόνο, όπως το StarCraf
 t II, ανήκουν στα πιο δύσκολα περιβά
 λλοντα για την τεχνητή νοημοσύνη. Ο 
 παίκτης πρέπει να μαζεύει πόρους, να
  χτίζει στρατό και να δίνει μάχες, ό
 λα σε πραγματικό χρόνο, ενώ βλέπει μ
 όνο το κομμάτι του χάρτη που έχουν ή
 δη επισκεφθεί οι δικές του μονάδες. 
 Η παρούσα διπλωματική εργασία μελετά
  πώς ένας τεχνητός πράκτορας μπορεί 
 να εκπαιδευτεί σε τέτοια παιχνίδια μ
 ε τη βοήθεια της βαθιάς ενισχυτικής 
 μάθησης, μιας τεχνικής στην οποία ο 
 πράκτορας βελτιώνει τη συμπεριφορά τ
 ου επιλέγοντας ενέργειες και αξιολογ
 ώντας την ανταμοιβή που λαμβάνει. \n
  Υλοποιούμε δύο τέτοιους πράκτορες, 
 έναν από καθεμία από τις δύο κύριες 
 κατηγορίες της βαθιάς ενισχυτικής μά
 θησης και τους εκπαιδεύουμε υπό τις 
 ίδιες συνθήκες σε τέσσερα σύντομα εκ
 παιδευτικά σενάρια του StarCraft II 
 που έχει δημοσιεύσει η ερευνητική μο
 νάδα γνωστής μεγάλης εταιρείας πληρο
 φορικής. Για τη διασφάλιση μιας δίκα
 ιης σύγκρισης, χρησιμοποιούμε μια πλ
 ηρέστερη αναπαράσταση της κατάστασης
  του περιβάλλοντος, προσθέτουμε μια 
 νέα δυνατότητα που επιτρέπει στον πρ
 άκτορα να επιλέγει ποια μονάδα θα ελ
 έγξει και αποφεύγουμε τη διαμόρφωση 
 της ανταμοιβής, ώστε οι πράκτορες να
  μαθαίνουν αποκλειστικά από την πρωτ
 ογενή βαθμολογία του παιχνιδιού. \n 
 Στα πιο εύκολα σενάρια οι πράκτορες 
 σημειώνουν επιδόσεις συγκρίσιμες με 
 άλλες μελέτες μικρής κλίμακας, καθώς
  επίσης χρησιμοποιούμε σημαντικά μικ
 ρότερο υπολογιστικό πόρο σε σχέση με
  μεγάλες ερευνητικές ομάδες. Στο πιο
  απαιτητικό σενάριο, όπου απαιτείται
  η ανάπτυξη οικονομίας και η παραγωγ
 ή στρατού από το μηδέν, οι πράκτορες
  δεν καταφέρνουν να αναπτύξουν μια α
 ποτελεσματική στρατηγική, κάτι που ε
 πιβεβαιώνει τη γνωστή αδυναμία της μ
 εθόδου όταν οι ανταμοιβές είναι σπάν
 ιες και ο χρονικός ορίζοντας μεγάλος
 . Το τελευταίο κεφάλαιο συζητά τους 
 περιορισμούς της υλοποίησής μας και 
 προτείνει κατευθύνσεις για μελλοντικ
 ή έρευνα, όπως ιεραρχικές μεθόδους, 
 αναδρομική μνήμη και καλύτερα σήματα
  ανταμοιβής.\n Abstract \n Real-time
  strategy games such as StarCraft II
  are difficult testbeds for artifici
 al intelligence because a player has
  to manage economy, production, move
 ment, and combat at the same time. T
 he player also acts under partial ob
 servability, seeing only the parts o
 f the map that their own units have 
 already visited. This thesis studies
  how an agent can learn to play in t
 his environment, using Deep Reinforc
 ement Learning, a learning paradigm 
 in which the agent improves by inter
 acting with the game and adapting it
 s behaviour via employing Deep Neura
 l Networks to evaluate its decision 
 policy based on reward signals it re
 ceives from the environment. \n We i
 mplement two agents from different f
 amilies of Deep Reinforcement Learni
 ng: a Deep Q-Network agent and a syn
 chronous Advantage Actor-Critic agen
 t. Both are implemented in TensorFlo
 w 2 and trained under the same condi
 tions on four short PySC2 mini-games
  released with DeepMind’s StarCraft 
 II research environment. To ensure a
  fair comparison, both agents use th
 e same two-channel screen representa
 tion, the same action-argument facto
 risation, and the same decision rate
 . We also add a unit-selection head 
 for the A2C agent and keep the rewar
 d signal unshaped, so both agents le
 arn only from the scoring rules prov
 ided by PySC2. \n On the easier scen
 arios the agents reach scores that a
 re competitive with other small-scal
 e studies on the same environment, d
 espite the much smaller compute budg
 et available for this project. On th
 e hardest scenario, the agents do no
 t learn an effective production poli
 cy. This result is consistent with a
  known limitation of flat approaches
  when rewards are rare and the time 
 horizon is long. The final chapter d
 iscusses the limitations of our impl
 ementation and suggests future resea
 rch directions, such as hierarchical
  methods, recurrent memory, and bett
 er reward signals.  \n
STATUS:CONFIRMED
ORGANIZER;RSVP=FALSE;CN=TUC;CUTYPE=TUC:mailto:webmaster@tuc.gr
DTSTART:20260709T120000
DTEND:20260709T130000
TRANSP:OPAQUE
CLASS:DEFAULT
END:VEVENT
END:VCALENDAR