BEGIN:VCALENDAR
VERSION:2.0
PRODID:-//TUC//Events//EN
CALSCALE:GREGORIAN
BEGIN:VTIMEZONE
TZID:Europe/Athens
TZNAME:EEST
DTSTART:19700329T030000
RRULE:FREQ=YEARLY;BYDAY=-1SU;BYMONTH=3
BEGIN:STANDARD
TZOFFSETFROM:+0200
TZOFFSETTO:+0300
TZNAME:EET
DTSTART:19701025T040000
RRULE:FREQ=YEARLY;BYDAY=-1SU;BYMONTH=10
END:STANDARD
END:VTIMEZONE
BEGIN:VEVENT
CREATED:20220715T124146Z
LAST-MODIFIED:20220715T124146Z
DTSTAMP:20260720T042345Z
UID:1784510625@tuc.gr
SUMMARY:Παρουσίαση Διπλωματικής Εργασίας κας
  Καραλάκου Αθανασίας - Σχολή ΗΜΜΥ
LOCATION:
DESCRIPTION:https://www.ece.tuc.gr/el/katalogos-
 ekdiloseon?tx_tucevents2_tuceventsdi
 splay%5Baction%5D=show&tx_tucevents2
 _tuceventsdisplay%5Bcontroller%5D=Ev
 ent&tx_tucevents2_tuceventsdisplay%5
 Bevent%5D=5682&cHash=e0bb688fa13bdff
 000c18ed72760fe22\nΠΟΛΥΤΕΧΝΕΙΟ ΚΡΗΤΗ
 Σ\n Σχολή Ηλεκτρολόγων Μηχανικών και
  Μηχανικών Υπολογιστών\n Πρόγραμμα Π
 ροπτυχιακών Σπουδών\n ΠΑΡΟΥΣΙΑΣΗ ΔΙΠ
 ΛΩΜΑΤΙΚΗΣ ΕΡΓΑΣΙΑΣ\n ΑΘΑΝΑΣΙΑΣ ΚΑΡΑΛ
 ΑΚΟΥ\n με θέμα\n Σχεδίαση Συναρτήσεω
 ν Ανταμοιβής Μεθόδων Βαθιάς Ενισχυτι
 κής Μάθησης για Αυτόνομη Οδήγηση χωρ
 ίς τη Χρήση Λωρίδων Κυκλοφορίας\n De
 ep Reinforcement Learning Reward Fun
 ction Design for Lane-Free Autonomou
 s Driving\n Εξεταστική Επιτροπή\n Αν
 απληρωτής Καθηγητής  Γεώργιος Χαλκια
 δάκης (επιβλέπων)\n Καθηγητής Μιχαήλ
  Γ. Λαγουδάκης\n Καθηγητής Ιωάννης Π
 απαμιχαήλ (Σχολή ΜΠΔ)\n  \n Περίληψη
 \n Η οδική κυκλοφορία σε δρόμους χωρ
 ίς λωρίδες είναι ένας νέος τομέας έρ
 ευνας με ιδιαίτερες προκλήσεις, όπου
  τα οχήματα δεν περιορίζονται από τη
 ν έννοια των λωρίδων, αλλά διαθέτουν
  τη δυνατότητα να βρίσκονται σε οποι
 αδήποτε οριζόντια θέση εντός των ορί
 ων του δρόμου.  Αυτό συνιστά έναν εν
 τελώς διαφορετικό τομέα προβλημάτων 
 για την αυτόνομη οδήγηση σε σύγκριση
  με την κυκλοφορία που βασίζεται στη
  λωρίδα κυκλοφορίας, καθώς τα οχήματ
 α λαμβάνουν υπόψη τους τον πραγματικ
 ά διαθέσιμο δισδιάστατο χώρο, ενώ κα
 ι η διαδικασία που ακολουθούν για τη
  λήψη αποφάσεων πρέπει να προσαρμοστ
 εί σε αυτήν την ιδέα. Επιπλέον, η έλ
 λειψη των «οχημάτων-οδηγών» και της 
 λειτουργίας αλλαγής κυκλοφοριακής λω
 ρίδας σε παρακείμενες λωρίδες, συνισ
 τούν αναγκαία τη σωστή προσαρμογή τω
 ν παρατηρήσεων των οχημάτων στο περι
 βάλλον χωρίς λωρίδες, δίχως να υπάρχ
 ει μεροληψία από προσεγγίσεις που βα
 σίζονται στην ύπαρξη κυκλοφοριακών λ
 ωρίδων. Ακόμα, κάθε όχημα αποσκοπεί 
 να διατηρήσει μια (διαφορετική) επιθ
 υμητή ταχύτητα, δημιουργώντας έτσι π
 ολλές καταστάσεις όπου τα οχήματα πρ
 έπει να προσπεράσουν και να αντιδράσ
 ουν κατάλληλα στη συμπεριφορά των άλ
 λων.\n Ταυτόχρονα, η Βαθιά Ενισχυτικ
 ή Μάθηση (Deep Reinforcement Learnin
 g) έχει ήδη χρησιμοποιηθεί επιτυχώς 
 σε ποίκιλες εφαρμογές, ενώ το γεγονό
 ς ότι μπορεί να χειριστεί υψηλών δια
 στάσεων χώρους καταστάσεων και ενεργ
 ειών, την καθιστά ιδιαίτερα κατάλληλ
 η για τον έλεγχο αυτόνομων οχημάτων.
  Ωστόσο, μέχρι σήμερα, δεν υπάρχουν 
 εργασίες που να έχουν αξιοποιήσει τη
 ν (Βαθιά ή μη) Ενισχυτική Μάθηση για
  την κίνηση οχημάτων σε δρόμους χωρί
 ς λωρίδες.\n \n Τούτων δοθέντων, η π
 αρούσα διπλωματική εργασία ξεκινά τη
  μελέτη της εφαρμογής της (Βαθιάς) Ε
 νισχυτικής Μάθησης σε περιβάλλοντα κ
 υκλοφορίας χωρίς λωρίδες. Για το σκο
 πό αυτό,  μοντελοποιήσαμε το πρόβλημ
 α της αυτόνομης οδήγησης χωρίς λωρίδ
 ες ως μια Μαρκοβιανή Διαδικασία Λήψη
 ς Αποφάσεων (Markov Decision Process
 ), λαμβάνοντας υπόψη όλα τα επιμέρου
 ς στοιχεία της. Εξετάσαμε την αναπαρ
 άσταση του δισδιάστατου χώρου ενεργε
 ιών, θεωρώντας τον είτε ως συνεχή εί
 τε ως διακριτό, ενώ ορίσαμε και το χ
 ώρο καταστάσεων. Το κύριο μέλημα μας
 , ωστόσο, υπήρξε η σχεδίαση μίας απο
 δοτικής συνάρτησης ανταμοιβής, καθώς
  το μοντέλο ανταμοιβής είναι ιδιαίτε
 ρης σημασίας και καθορίζει τη συνολι
 κή αποτελεσματικότητα της πολιτικής 
 που προκύπτει.\n Συγκεκριμένα, κατασ
 κευάσαμε διαφορετικές συνιστώσες συν
 αρτήσεων ανταμοιβής, οι οποίες συνδέ
 ονται με το περιβάλλον σε διάφορα επ
 ίπεδα πληροφορίας. Έπειτα, συνδυάσαμ
 ε και συγκρίναμε τις προαναφερθείσες
  συνιστώσες, με σκοπό στην εύρεση μι
 ας αποτελεσματικής συνάρτησης ανταμο
 ιβής, η οποία οδηγεί σε μια πολιτική
  που επιτυγχάνει ταυτόχρονα την μείω
 ση των συγκρούσεων με άλλα οχήματα, 
 αλλά και την διατήρηση μίας επιθυμητ
 ής ταχύτητας. \n Επιπλέον, συγκρίνου
 με δύο αρκετά δημοφιλείς και θεμελια
 κούς αλγορίθμους βαθιάς μάθησης, πιο
  συγκεκριμένα τον αλγόριθμο Deep Q-N
 etworks (DQN) εφοδιασμένο με ορισμέν
 ες ευρέως χρησιμοποιούμενες επεκτάσε
 ις, και τον αλγόριθμο Deep Determini
 stic Policy Gradient (DDPG). Tα πειρ
 αματικά μας αποτελέσματα υποδεικνύου
 ν ότι ο DDPG έχει συνολικά καλύτερη 
 απόδοση, και επιβεβαιώνουν ότι τα αυ
 τόνομα οχήματα που χρησιμοποιούν Βαθ
 ιά Ενισχυτική Μάθηση είναι σε θέση ν
 α μαθαίνουν σταδιακά όλο και πιο απο
 τελεσματικές πολιτικές, σε περιβάλλο
 ντα με διαφορετικά επίπεδα δυσκολίας
 .\n Abstract\n Lane-free traffic is 
 a novel and challenging research dom
 ain, in which vehicles do not adhere
  to the notion of lanes---but are ra
 ther able to be located at any later
 al position within the road boundari
 es. This constitutes an entirely dif
 ferent problem domain for autonomous
  driving compared to lane-based traf
 fic, as vehicles consider the entire
 ty of the two-dimensional space avai
 lable, and their decision-making nee
 ds to adapt to this concept. There i
 s no leader vehicle or lane-changing
  operation to adjacent lanes, theref
 ore the observations of the vehicles
  need to properly accommodate the la
 ne-free environment without carrying
  over bias from lane-based approache
 s. In addition, each vehicle wishes 
 to maintain a (different) desired sp
 eed, therefore creating many situati
 ons in which vehicles need to perfor
 m overtaking and react appropriately
  to the behavior of others. \n At th
 e same time, Deep Reinforcement Lear
 ning (DRL) has already been used in 
 a variety of applications, while the
  fact that it can handle high dimens
 ional state and action spaces makes 
 it suitable for controlling autonomo
 us vehicles. Existing studies, howev
 er, have not employed Reinforcement 
 Learning (deep or otherwise) in the 
 lane-free traffic domain.\n Against 
 this background, this diploma thesis
  initiates the study of the applicat
 ion of (Deep) Reinforcement Learning
  to lane-free traffic environments. 
 To this end, we put forward a Markov
  Decision Process formulation for th
 e problem of Lane-Free Autonomous Dr
 iving, by addressing all its element
 s. We consider the two-dimensional c
 ontinuous action space, along with a
  discretized form, as well as the st
 ate space. Our main focus is on desi
 gning an effective reward function, 
 as the reward model is crucial and d
 etermines the overall efficiency of 
 the resulting policy.\n Specifically
 , we construct different components 
 of reward functions tied to the envi
 ronment at various levels of informa
 tion. Then, we combine and collate t
 he aforementioned components and foc
 us on attaining a reward function th
 at results in a policy that manages 
 to both reduce the collisions among 
 vehicles, and also address their req
 uirement of maintaining a desired sp
 eed. \n Additionally, we study the p
 erformance of two quite popular DRL 
 algorithms---namely Deep Q-Networks 
 (enhanced with some commonly used ex
 tensions), and Deep Deterministic Po
 licy Gradient (DDPG). Our experiment
 al results indicate that DDPG has an
  overall better performance, and con
 firm that our DRL-employing autonomo
 us vehicles are able to gradually le
 arn effective policies in environmen
 ts with varying levels of difficulty
 .\n  \n
STATUS:CONFIRMED
ORGANIZER;RSVP=FALSE;CN=TUC;CUTYPE=TUC:mailto:webmaster@tuc.gr
DTSTART:20220722T130000
DTEND:20220722T140000
TRANSP:OPAQUE
CLASS:DEFAULT
END:VEVENT
END:VCALENDAR