BEGIN:VCALENDAR
VERSION:2.0
PRODID:-//TUC//Events//EN
CALSCALE:GREGORIAN
BEGIN:VTIMEZONE
TZID:Europe/Athens
TZNAME:EEST
DTSTART:19700329T030000
RRULE:FREQ=YEARLY;BYDAY=-1SU;BYMONTH=3
BEGIN:STANDARD
TZOFFSETFROM:+0200
TZOFFSETTO:+0300
TZNAME:EET
DTSTART:19701025T040000
RRULE:FREQ=YEARLY;BYDAY=-1SU;BYMONTH=10
END:STANDARD
END:VTIMEZONE
BEGIN:VEVENT
CREATED:20260708T143350Z
LAST-MODIFIED:20260708T143350Z
DTSTAMP:20260719T221526Z
UID:1784488526@tuc.gr
SUMMARY:Παρουσίαση διπλωματικής εργασίας κ. 
 Χαράλαμπου Χούλη - Σχολή ΗΜΜΥ
LOCATION:
DESCRIPTION:https://www.ece.tuc.gr/el/katalogos-
 ekdiloseon?tx_tucevents2_tuceventsdi
 splay%5Baction%5D=show&tx_tucevents2
 _tuceventsdisplay%5Bcontroller%5D=Ev
 ent&tx_tucevents2_tuceventsdisplay%5
 Bevent%5D=8562&cHash=71994be00befb12
 8b61c63202f812d83\nΠΟΛΥΤΕΧΝΕΙΟ ΚΡΗΤΗ
 Σ\n Σχολή Ηλεκτρολόγων Μηχανικών και
  Μηχανικών Υπολογιστών\n Πρόγραμμα Π
 ροπτυχιακών Σπουδών\n ΠΑΡΟΥΣΙΑΣΗ ΔΙΠ
 ΛΩΜΑΤΙΚΗΣ ΕΡΓΑΣΙΑΣ\n Χαράλαμπου Χούλ
 η \n με θέμα\n Αλγόριθμοι Επιγραμμικ
 ής Μάθησης για τη Βελτιστοποίηση Συσ
 τάσεων σε Περιβάλλοντα Πολυεκπομπής 
 Περιεχομένου \n Online Learning Algo
 rithms for Recommendation Optimizati
 on in Multicast Content Environments
 \n Εξεταστική Επιτροπή\n Καθηγητής Θ
 ρασύβουλος Σπυρόπουλος (επιβλέπων)\n
  Καθηγητής Μιχαήλ Γ. Λαγουδάκης\n Δρ
  Ιωάννης Πευκιανάκης, Αρχιτέκτων Ασύ
 ρματων Συστημάτων στην Apple \n Περί
 ληψη\n Το ζωντανό περιεχόμενο και το
  περιεχόμενο συνεχούς ροής αποτελούν
  έναν από τους κυρίαρχους φόρτους ερ
 γασίας των σύγχρονων υποδομών επικοι
 νωνιών. Στα συστήματα κοινόχρηστης δ
 ιανομής, σημαντικό μέρος του λειτουρ
 γικού κόστους δεν συνδέεται με τον ό
 γκο της κίνησης, αλλά με το πλήθος τ
 ων διακριτών ροών που πρέπει να διατ
 ηρούνται ενεργές: μία και μόνη ροή μ
 πορεί να μοιράζεται μεταξύ πολλών τα
 υτόχρονων θεατών, ενώ κάθε πρόσθετη 
 ενεργή ροή καταναλώνει σπάνιους πόρο
 υς, όπως η χωρητικότητα μετακωδικοπο
 ίησης (transcoding) και η αντιγραφή 
 στους εξυπηρετητές άκρης (edge repli
 cation). Τα συστήματα συστάσεων, τα 
 οποία παραδοσιακά αντιμετωπίζονται ω
 ς μηχανισμοί εξατομίκευσης προς τον 
 χρήστη, διαμορφώνουν επίσης τον τρόπ
 ο με τον οποίο κατανέμεται η ζήτηση 
 μεταξύ των ροών και λειτουργούν συνε
 πώς ως μοχλός ελέγχου του δικτύου: κ
 ατευθύνοντας έναν αφικνούμενο χρήστη
  προς ένα ήδη ενεργό κανάλι, το σύστ
 ημα συστάσεων μπορεί να συγκεντρώσει
  τη ζήτηση και να μειώσει το πλήθος 
 των ενεργών ροών, υπό την προϋπόθεση
  ότι διατηρείται η ποιότητα εμπειρία
 ς του χρήστη. Η παρούσα διπλωματική 
 εργασία μελετά το προκύπτον πρόβλημα
  συστάσεων φιλικών προς την πολυεκπο
 μπή (multicast-friendly), το οποίο δ
 ιατυπώνεται ως ελαχιστοποίηση υπό πε
 ριορισμούς του χρονικά μέσου πλήθους
  ενεργών καναλιών, με κάτω φράγμα στ
 η μέση χρησιμότητα που παρέχεται ανά
  άφιξη. Το κεντρικό ερώτημα σε όλη τ
 ην εργασία είναι κατά πόσον μια επιγ
 ραμμική (online) πολιτική με επίγνωσ
 η της κατάστασης του συστήματος μπορ
 εί να ικανοποιεί αυτό το κατώφλι ποι
 ότητας εμπειρίας, διατηρώντας ταυτόχ
 ρονα αυστηρά λιγότερα ενεργά κανάλια
  από μια ισχυρή στατική πολιτική ανα
 φοράς.\n Το πρόβλημα διατυπώνεται ως
  δεσμευμένη μαρκοβιανή διαδικασία απ
 οφάσεων (Constrained Markov Decision
  Process, CMDP) επάνω σε ένα μοντέλο
  δραστηριότητας χρηστών ON/OFF συνεχ
 ούς χρόνου, και αναπτύσσεται μια ακο
 λουθία δυναμικών πολιτικών αυξανόμεν
 ης κλίμακας έναντι δύο στατικών πολι
 τικών αναφοράς: μιας άπληστης ευρετι
 κής κάλυψης συνόλου (greedy set-cove
 r) και μιας αναλυτικά βελτιστοποιημέ
 νης πολιτικής κατωφλίου α, οι παράμε
 τροι της οποίας προκύπτουν εκτός γρα
 μμής (offline) μέσω μιας προσέγγισης
  μέσου πεδίου (mean-field). Το πρόβλ
 ημα μικρής κλίμακας επιλύεται αρχικά
  με ακρίβεια μέσω επανάληψης τιμών (
 Value Iteration), απομονώνοντας τον 
 μηχανισμό, επαναχρησιμοποίηση των εν
 εργών καναλιών και αποφυγή πρόωρων ε
 νεργοποιήσεων, μέσω του οποίου η προ
 νοητικότητα μειώνει το κόστος. Για τ
 ην επίτευξη ρεαλιστικών κλιμάκων, η 
 πινακοποιημένη λύση αντικαθίσταται α
 πό ένα βαθύ δίκτυο Q (Deep Q-Network
 , DQN) που εκπαιδεύεται απευθείας στ
 η δυναμική της δραστηριότητας των χρ
 ηστών, με τον περιορισμό ποιότητας ε
 μπειρίας να επιβάλλεται εντός του αλ
 γορίθμου μάθησης μέσω λαγκρανζιανής,
  βελτιστοποιούμενης με δυϊκή ανάβαση
  (dual ascent). Σημαντικό μέρος της 
 εργασίας είναι διαγνωστικό: στο ομοι
 ογενές, συμμετρικό καθεστώς αποδεικν
 ύεται ότι υπάρχει εφικτή μαθημένη (l
 earned)  πολιτική που υπερτερεί της 
 στατικής πολιτικής αναφοράς και ότι 
 είναι αναπαραστάσιμη από το δίκτυο, 
 ωστόσο η εκπαίδευση από ψυχρή εκκίνη
 ση (cold start) αδυνατεί να τη φθάσε
 ι. Το εμπόδιο αυτό εντοπίζεται, δι' 
 αποκλεισμού, στην κλάση των ντετερμι
 νιστικών πολιτικών argmax, η οποία δ
 εν μπορεί να διατηρήσει τη μεικτή πο
 λιτική που απαιτεί το βέλτιστο σημεί
 ο μείωσης κόστους επάνω σε εναλλάξιμ
 ες καταστάσεις. Η άρση αυτής της ενα
 λλαξιμότητας μέσω ετερογένειας στους
  ρυθμούς δραστηριότητας, σε συνδυασμ
 ό με μια αρχιτεκτονική ανά κανάλι (c
 hannel-wise architecture) αναλλοίωτη
  σε μεταθέσεις, ένα χαρακτηριστικό ε
 πιμονής (persistence) ανά κανάλι και
  έναν διαβαθμισμένο περιορισμό, επιτ
 ρέπει στη μαθημένη πολιτική να βελτι
 ώνει αυστηρά τη στατική πολιτική ανα
 φοράς, παραμένοντας εφικτή από ψυχρή
  εκκίνηση. Μια ανάλυση ανά απόφαση α
 ποδίδει το κέρδος στην εξαρτώμενη απ
 ό την κατάληψη επαναχρησιμοποίηση μα
 κρόβιων καναλιών, την οποία ο στατικ
 ός κανόνας δεν μπορεί να αναπαραστήσ
 ει, χωρίς καμία θυσία στη χρησιμότητ
 α του χρήστη. Ένας έλεγχος με μυωπικ
 ή πολιτική δείχνει ότι το πλεονέκτημ
 α διατηρείται και με μηδενικό συντελ
 εστή έκπτωσης, εντοπίζοντάς το στην 
 αναπαράσταση της κατάστασης και όχι 
 στο βάθος σχεδιασμού. Το πλεονέκτημα
  είναι υπό συνθήκη και όχι καθολικό:
  φέρεται από την ετερογένεια των ρυθ
 μών δραστηριότητας, μια δομή που η σ
 τατική πολιτική αναφοράς δεν μπορεί 
 να αναπαραστήσει αλλά η μαθημένη πολ
 ιτική μπορεί να εκμεταλλευθεί, ενώ η
  ασυμμετρία δημοτικότητας απορροφάτα
 ι απευθείας στο βέλτιστο της ίδιας τ
 ης πολιτικής αναφοράς. Η εργασία, συ
 νεπώς, τεκμηριώνει ότι ένα μαθημένο 
 σύστημα συστάσεων που σέβεται τον πε
 ριορισμό μπορεί να υπερτερεί μιας ισ
 χυρής στατικής πολιτικής αναφοράς, κ
 αι προσδιορίζει την αναπαραστατική α
 συμμετρία που απαιτεί αυτή η βελτίωσ
 η.\n Abstract \n Live and streamed c
 ontent constitutes one of the domina
 nt workloads of modern communication
  infrastructure. In shared delivery 
 systems a substantial part of the op
 erating cost is tied not to the volu
 me of traffic but to the number of d
 istinct streams that must be kept ac
 tive: a single stream can be shared 
 across many co-viewers while each ad
 ditional active stream draws on scar
 ce resources such as transcoding cap
 acity and edge replication. Recommen
 dation systems, traditionally treate
 d as user-facing personalisation mec
 hanisms, also shape how demand is di
 stributed across streams and therefo
 re act as a network-control lever: b
 y steering an arriving user toward a
 n already-active channel, the recomm
 ender can consolidate demand and red
 uce the number of active streams, pr
 ovided the user's quality of experie
 nce is preserved. This thesis studie
 s the resulting multicast-friendly r
 ecommendation problem, formalised as
  the constrained minimisation of the
  time-averaged number of active chan
 nels subject to a lower bound on the
  mean utility delivered per arrival.
  The central question throughout is 
 whether an online, state-aware polic
 y can meet this\n quality-of-experie
 nce floor while sustaining strictly 
 fewer active channels than a strong 
 static benchmark.\n The problem is c
 ast as a constrained Markov decision
  process over a continuous-time ON/O
 FF user-activity model, and a sequen
 ce of dynamic policies of increasing
  scale is developed against two stat
 ic baselines: a greedy set-cover heu
 ristic and an analytically optimised
  α-threshold policy whose parameters
  are derived offline through a mean-
 field approximation. The small-scale
  problem is first solved exactly by 
 value iteration, isolating the mecha
 nism, reuse of active channels and a
 voidance of premature activations, b
 y which foresight reduces cost. To r
 each realistic scales the tabular so
 lution is replaced by a deep Q-netwo
 rk trained directly against the acti
 vity dynamics, with the quality-of-e
 xperience constraint enforced inside
  the learner through a Lagrangian re
 laxation optimised by dual ascent. A
  substantial part of the work is dia
 gnostic: in the homogeneous, symmetr
 ic regime a feasible learned policy 
 that beats the static benchmark is s
 hown to exist and to be representabl
 e by the network, but cold-start tra
 ining cannot reach it, and this obst
 ruction is traced by elimination to 
 a deterministic-argmax policy class 
 that cannot hold the mixing policy t
 he cost-improving optimum requires o
 ver exchangeable states. Breaking th
 is exchangeability through activity-
 rate heterogeneity, together with a 
 permutation-invariant channel-wise a
 rchitecture, a per-channel persisten
 ce feature, and a graded constraint,
  enables the learned policy to stric
 tly improve on the static benchmark 
 while remaining feasible from a cold
  start. A per-decision analysis attr
 ibutes the gain to occupancy-conditi
 oned reuse of long-lived channels th
 at the static rule cannot represent,
  delivered without any sacrifice in 
 user utility. A myopic-policy contro
 l shows the advantage survives with 
 the discount removed, locating it in
  the state representation rather tha
 n planning depth. The advantage is c
 onditional rather than universal: it
  is carried by activity-rate heterog
 eneity, a structure the static bench
 mark cannot represent but the learne
 d policy can exploit, whereas popula
 rity skew is absorbed directly into 
 the benchmark's own optimum. The the
 sis therefore establishes that a lea
 rned, constraint-respecting recommen
 der can outperform a strong static b
 enchmark  and identifies the represe
 ntational asymmetry that this improv
 ement requires.\n Meeting ID: 921872
 41010\n Password: 457753\n
STATUS:CONFIRMED
ORGANIZER;RSVP=FALSE;CN=TUC;CUTYPE=TUC:mailto:webmaster@tuc.gr
DTSTART:20260710T133000
DTEND:20260710T143000
TRANSP:OPAQUE
CLASS:DEFAULT
END:VEVENT
END:VCALENDAR