BEGIN:VCALENDAR
VERSION:2.0
PRODID:-//TUC//Events//EN
CALSCALE:GREGORIAN
BEGIN:VTIMEZONE
TZID:Europe/Athens
TZNAME:EEST
DTSTART:19700329T030000
RRULE:FREQ=YEARLY;BYDAY=-1SU;BYMONTH=3
BEGIN:STANDARD
TZOFFSETFROM:+0200
TZOFFSETTO:+0300
TZNAME:EET
DTSTART:19701025T040000
RRULE:FREQ=YEARLY;BYDAY=-1SU;BYMONTH=10
END:STANDARD
END:VTIMEZONE
BEGIN:VEVENT
CREATED:20251007T113245Z
LAST-MODIFIED:20251007T113245Z
DTSTAMP:20260817T230325Z
UID:1786997005@tuc.gr
SUMMARY:Παρουσίαση διπλωματικής εργασίας κ. 
 Ευαγγέλου Αθανασάκη - Σχολή ΗΜΜΥ
LOCATION:
DESCRIPTION:https://www.ece.tuc.gr/el/katalogos-
 ekdiloseon?tx_tucevents2_tuceventsdi
 splay%5Baction%5D=show&tx_tucevents2
 _tuceventsdisplay%5Bcontroller%5D=Ev
 ent&tx_tucevents2_tuceventsdisplay%5
 Bevent%5D=8134&cHash=3c51d279dcd4ee2
 1984d6d4bf9d30f23\nΠΟΛΥΤΕΧΝΕΙΟ ΚΡΗΤΗ
 Σ\n Σχολή Ηλεκτρολόγων Μηχανικών και
  Μηχανικών Υπολογιστών\n Πρόγραμμα Π
 ροπτυχιακών Σπουδών\n ΠΑΡΟΥΣΙΑΣΗ ΔΙΠ
 ΛΩΜΑΤΙΚΗΣ ΕΡΓΑΣΙΑΣ\n Ευαγγέλου Αθανα
 σάκη\n με θέμα\n Βελτιστοποίηση Επιχ
 ειρησιακών Ροών Εργασίας μέσω Αυτομα
 τοποιημένης Εξαγωγής Πληροφορίας από
  Αρχεία PDF με χρήση Μεγάλων Γλωσσικ
 ών Μοντέλων\n Optimization of Enterp
 rise Workflows through Automated Inf
 ormation Extraction from PDF Files u
 sing Large Language Models\n Εξεταστ
 ική Επιτροπή\n Καθηγητής Μιχαήλ Γ. Λ
 αγουδάκης (Σχολή ΗΜΜΥ, Επιβλέπων)\n 
 Καθηγητής Θρασύβουλος Σπυρόπουλος (Σ
 χολή ΗΜΜΥ)\n Δρ. Βασίλειος Διακολουκ
 άς (Σχολή ΗΜΜΥ)\n Περίληψη\n Οι μεγά
 λοι όγκοι αρχείων που διακινούνται σ
 τις σύγχρονες επιχειρησιακές ροές έχ
 ουν ωθήσει την ανάπτυξη μεθόδων που 
 βασίζονται σε τεχνικές Τεχνητής Νοημ
 οσύνης για αυτοματοποιημένη εξαγωγή,
  ανάκτηση και σύνοψη πληροφοριών. Στ
 ην παρούσα διπλωματική εργασία μελετ
 ώνται και υλοποιούνται μέθοδοι επεξε
 ργασίας και εξαγωγής δεδομένων από η
 μιδομημένα έγγραφα PDF με χρήση Μεγά
 λων Γλωσσικών Μοντέλων (Large Langua
 ge Models – LLMs). Η εργασία αναπτύσ
 σεται σε δύο διακριτά μέρη. Στο πρώτ
 ο μέρος, το πεδίο μελέτης επικεντρών
 εται στην ανάκτηση πληροφοριών από α
 ναλύσεις Ελληνικών εδαφών, οι οποίες
  χαρακτηρίζονται από ετερογένεια στη
  δομή και τη μορφοποίησή τους. Εξετά
 ζονται διάφορες τεχνικές εξαγωγής κε
 ιμένου, τόσο από εγγενώς ψηφιακά, όσ
 ο και από σκαναρισμένα, έγγραφα με χ
 ρήση Οπτικής Αναγνώρισης Χαρακτήρων 
 (Optical Character Recognition – OCR
 ). Στη συνέχεια, εξετάζεται η συνεισ
 φορά επιμέρους υπομονάδων της ροής ε
 πεξεργασίας, όπως post-processing γι
 α διόρθωση λαθών κατά την εξαγωγή το
 υ κειμένου και μετάφραση από Ελληνικ
 ά σε Αγγλικά, στην ακρίβεια και την 
 αποδοτικότητα της συνολικής δομής. Σ
 τη συνέχεια, συγκρίνονται διάφορες τ
 εχνικές ανάκτησης πληροφορίας, όπως 
 η προσέγγιση πλήρων συμφραζομένων (f
 ull-context prompting) και η ανάκτησ
 η υποβοηθούμενη από γνώση (Retrieval
 -Augmented Generation – RAG), με στό
 χο την αξιολόγηση της αποδοτικότητας
  κάθε ροής επεξεργασίας. Στο δεύτερο
  μέρος, η μεθοδολογία γενικεύεται, ώ
 στε να μπορεί να εφαρμοστεί σε έγγρα
 φα PDF από κάθε πεδίο εφαρμογής. Για
  τον σκοπό αυτόν αναπτύσσονται τρείς
  πράκτορες (agents): Ο Πράκτορας Ανί
 χνευσης Πεδίων εντοπίζει υποψήφια πε
 δία, ο Πράκτορας Μετα-Επεξεργασίας φ
 ιλτράρει και κανονικοποιεί τα αποτελ
 έσματα, ενώ ο Πράκτορας Δημιουργίας 
 Prompts κατασκευάζει δυναμικά prompt
 s για τη φάση ανάκτησης πληροφορίας.
  Εξετάζονται διαφορετικές αρχιτεκτον
 ικές που δημιουργούνται από αυτούς τ
 ους πράκτορες για την εξαγωγή των ον
 ομάτων των πεδίων που μπορούν να ανα
 κτηθούν από το έγγραφο. Στην συνέχει
 α, αξιολογείται εκ νέου η αποδοτικότ
 ητα της καλύτερης μεθόδου ανάκτησης 
 πληροφορίας που προέκυψε από το πρώτ
 ο μέρος, καθώς και παραλλαγές της πρ
 οσέγγισης πλήρων συμφραζομένων. H πρ
 οτεινόμενη προσέγγιση επιτρέπει την 
 αυτόματη, προσαρμοστική και αποδοτικ
 ή εξαγωγή πληροφορίας από ποικίλα κε
 ίμενα προερχόμενα από διαφορετικούς 
 τομείς. Συνολικά, η εργασία συμβάλλε
 ι τόσο στην αξιολόγηση και βελτίωση 
 διαφορετικών ροών επεξεργασίας για τ
 ην εξαγωγή δεδομένων από αναλύσεις Ε
 λληνικών εδαφών, όσο και στην ανάπτυ
 ξη μίας γενικής και επεκτάσιμης σε κ
 άθε τομέα, πολυπρακτορικής αρχιτεκτο
 νικής. Η προτεινόμενη υποδομή μπορεί
  να εφαρμοστεί σε ποικίλα πεδία εφαρ
 μογής, ενισχύοντας την αυτοματοποίησ
 η και την ακρίβεια στην εξαγωγή πληρ
 οφοριών από αρχεία PDF.\n Abstract\n
  The large volumes of files circulat
 ed in today’s enterprise workflows h
 ave prompted the development of meth
 ods based on Artificial Intelligence
  (AI) techniques for automated infor
 mation extraction, retrieval, and su
 mmarization. In this diploma thesis,
  methods for processing and extracti
 ng data from semi-structured Portabl
 e Document Format (PDF) documents ar
 e studied and implemented using Larg
 e Language Models (LLMs). The projec
 t is divided into two distinct parts
 . In the first part, the study focus
 es on information retrieval from Gre
 ek soil analyses, which are characte
 rized by their heterogeneous structu
 re and formatting. Various text extr
 action techniques are examined, both
  from natively digital and scanned d
 ocuments using Optical Character Rec
 ognition (OCR). The contribution of 
 individual sub-modules in the proces
 sing pipeline, such as post-processi
 ng for text extraction error correct
 ion and translation from Greek to En
 glish, is then investigated to the a
 ccuracy and efficiency of the overal
 l structure. Various information ret
 rieval techniques are then compared,
  including the full-context promptin
 g approach and Retrieval-Augmented G
 eneration (RAG), with the goal of ev
 aluating the efficiency of each proc
 essing flow. In the second part, the
  methodology is generalized to be ap
 plicable to PDF documents from any d
 omain. To this end, three agents are
  developed: The Field Detection Agen
 t identifies candidate fields, the P
 ost-Processing Agent filters and nor
 malizes the results, and the Prompt 
 Builder Agent dynamically constructs
  prompts for the information retriev
 al phase. Different architectures cr
 eated by these agents are examined f
 or extracting the names of fields th
 at can be retrieved from the documen
 t. The efficiency and accuracy of th
 e best information retrieval method 
 from the first part is then re-evalu
 ated, along with a variation of the 
 full-context prompting approach. The
  proposed approach allows for automa
 tic, adaptive, and efficient informa
 tion extraction from a variety of te
 xts. Overall, the thesis contributes
  to both the evaluation and improvem
 ent of different processing flows fo
 r data extraction from Greek soil an
 alyses and the development of a gene
 ral and scalable multi-agent archite
 cture for any domain. The proposed f
 ramework can be applied to various f
 ields, enhancing the automation and 
 accuracy of information extraction f
 rom PDF files.\n Meeting ID: 9861130
 0947\n Password: 258009\n
STATUS:CONFIRMED
ORGANIZER;RSVP=FALSE;CN=TUC;CUTYPE=TUC:mailto:webmaster@tuc.gr
DTSTART:20251008T150000
DTEND:20251008T160000
TRANSP:OPAQUE
CLASS:DEFAULT
END:VEVENT
END:VCALENDAR