10
Ιουλ

10/07/2026 17:30 - 18:30
Σύνδεσμος τηλεδιάσκεψης: https://tuc-gr.zoom.us/j/92187241010?pwd=0H1Ix9nt5Ec7LRueYkZayUTkKTwaMb.1 ΠΟΛΥΤΕΧΝΕΙΟ ΚΡΗΤΗΣ
Σχολή Ηλεκτρολόγων Μηχανικών και Μηχανικών Υπολογιστών
Πρόγραμμα Προπτυχιακών Σπουδών
ΠΑΡΟΥΣΙΑΣΗ ΔΙΠΛΩΜΑΤΙΚΗΣ ΕΡΓΑΣΙΑΣ
Γεωργίου Συντυχάκη
με θέμα
Έλεγχος Γραμμών Παραγωγής με Ζήτηση Ενδιάμεσων και Τελικών Προϊόντων μέσω Τεχνικών Ενισχυτικής Μάθησης
Control of Production Lines with Demand for Intermediate and Final Products through Reinforcement Learning Techniques
Εξεταστική Επιτροπή
Καθηγητής Μιχαήλ Γ. Λαγουδάκης (Σχολή ΗΜΜΥ, Επιβλέπων)
Καθηγητής Γεώργιος Χαλκιαδάκης (Σχολή ΗΜΜΥ)
Αναπληρωτής Καθηγητής Ευστράτιος Ιωαννίδης (Σχολή ΜΠΔ)
Περίληψη
Μια σημαντική πρόκληση στον χώρο της βιομηχανικής παραγωγής αποτελεί η αποδοτική διαχείριση και ο έλεγχος των γραμμών παραγωγής σε περιβάλλοντα με δυναμική ζήτηση. Στην παρούσα διπλωματική εργασία, αναπτύσσεται μια μεθοδολογία βασισμένη στον Q-learning, ο οποίος αποτελεί έναν αλγόριθμο ενισχυτικής μάθησης, για τον έλεγχο γραμμών παραγωγής που εξυπηρετούν την ζήτηση τόσο ενδιάμεσων όσο και τελικών προϊόντων. Δεδομένου ότι οι αφίξεις των πελατών είναι τυχαίες και ακολουθούν την κατανομή Poisson, ενώ οι χρόνοι παραγωγής είναι εκθετικά κατανεμημένοι, το σύστημα παραγωγής μοντελοποιείται ως Μαρκοβιανή Διαδικασία Αποφάσεων (Markov Decision Process). Ο πράκτορας ελέγχου εκπαιδεύεται με σκοπό την προσέγγιση μιας βέλτιστης πολιτικής ελέγχου παραγωγής, η οποία ελαχιστοποιεί το κόστος λειτουργίας του συστήματος, λαμβάνοντας υπόψη παραμέτρους, όπως η διαθεσιμότητα προϊόντων και η κάλυψη της ζήτησης. Οι ανταμοιβές (rewards) που λαμβάνει το σύστημα καθορίζονται από την ικανοποίηση της ζήτησης, τον χρόνο παραμονής προϊόντων σε απόθεμα, καθώς και τον χρόνο κατά τον οποίο παραμένει μια παραγγελία τελικού προϊόντος εκκρεμής. Μέσω εκτεταμένων προσομοιώσεων, εξετάζεται η αποτελεσματικότητα του προτεινόμενου συστήματος. Επίσης, υπολογίζεται το μέσο κόστος της εκάστοτε πολιτικής και συγκρίνεται με αποτελέσματα βέλτιστων πολιτικών, οι οποίες προκύπτουν από την εφαρμογή τεχνικών δυναμικού προγραμματισμού.
Abstract
A significant challenge in the field of industrial production is the efficient management and control of production lines in environments with dynamic demand. In this diploma thesis, a methodology based on Q-learning, which is a reinforcement learning algorithm, is developed for controlling production lines that serve the demand for both intermediate and final products. Given that customer arrivals follow a Poisson distribution and production times are exponentially distributed, the production system is modeled as a Markov Decision Process (MDP). The control agent is trained to approximate an optimal production control policy, which minimizes system operational costs, while considering factors, such as product availability and demand fulfillment. The rewards received by the system are determined by demand satisfaction, product inventory holding time, and the time a final product order remains pending. Through extensive simulations, the effectiveness of the proposed system is evaluated. Additionally, the average cost of each policy is calculated and compared with the optimal policy results of dynamic programming techniques.
Meeting ID: 92187241010
Password: 457753