Development of a system for medical knowledge retrieval and generation from clinical studies based on deep learning and RAG architecture
Ανάπτυξη συστήματος ανάκτησης και παραγωγής ιατρικών γνώσεων με χρήση τεχνικών deep learning και RAG αρχιτεκτονικής
Bachelor Dissertation
Συγγραφέας
Gerolymos, Christos
Γερόλυμος, Χρήστος
Ημερομηνία
2026-09Προβολή/ Άνοιγμα
Λέξεις κλειδιά
Retrieval-augmented generation ; Clinical trials ; Natural language processing ; Information retrieval ; Large language models ; Vector search ; ChromaDB ; LLaMA ; ClinicalTrials.gov ; BM25Περίληψη
Οι κλινικές δοκιμές αποτελούν τον κύριο μηχανισμό αξιολόγησης νέων ιατρικών
παρεμβάσεων, και το μητρώο ClinicalTrials.gov — το μεγαλύτερο παγκοσμίως αρχείο
κλινικών μελετών με περισσότερες από 500.000 εγγεγραμμένες μελέτες — παρέχει δημόσια πρόσβαση σε λεπτομερή πρωτόκολλα, κριτήρια επιλεξιμότητας, παρεμβάσεις και
στατιστικά αποτελέσματα. Παρά τη διαθεσιμότητά τους, η αποτελεσματική πρόσβαση
σε αυτές τις πληροφορίες παραμένει πρόκληση: τα αρχεία δοκιμών είναι γραμμένα σε
πυκνή ιατρική ορολογία και δεν υποστηρίζουν αναζήτηση με φυσική γλώσσα.
Η παρούσα διπλωματική εργασία παρουσιάζει τον σχεδιασμό, την υλοποίηση και
αξιολόγηση ενός ανοιχτού συστήματος Ανάκτησης-Επαυξημένης Παραγωγής (RAG) για
απάντηση ερωτημάτων φυσικής γλώσσας σε αρχεία κλινικών δοκιμών. Το σύστημα
επιτρέπει στους χρήστες να επιλέξουν οποιαδήποτε κλινική δοκιμή και να υποβάλλουν
ερωτήματα που απαντώνται με παραπομπές σε συγκεκριμένα αποσπάσματα. Όλη η
επεξεργασία εκτελείται τοπικά σε GPU χαμηλού κόστους με ανοιχτού κώδικα μοντέλα.
Η κύρια τεχνική συνεισφορά είναι μία τμηματοποίηση σε ιεραρχικά επίπεδα που αξιοποιεί
τη δομημένη ιεραρχία των εγγραφών JSON του ClinicalTrials.gov v2, παράγοντας 80–400
σημασιολογικά συνεκτικά τμήματα ανά δοκιμή. Το σύστημα ανάκτησης συνδυάζει ανάκτηση BM25 και πυκνή ανάκτηση BGE-M3 μέσω Αμοιβαίας Ταξινόμησης Συχνοτήτων, ακολουθούμενη από επαναταξινόμηση cross-encoder. Η αξιολόγηση σε δύο δομικά διαφορετικές δοκιμές έδειξε ότι κανένας κωδικοποιητής δεν υπερτερεί καθολικά: ο βιοϊατρικός MedCPT υπερτερεί σε ολοκληρωμένη δοκιμή με αποτελέσματα (nDCG@10 = 0.394), ενώ ο γενικός BGE-M3 υπερτερεί
σε δοκιμή σε φάση στρατολόγησης (nDCG@10 = 0.508). Η πιστότητα απαντήσεων ήταν 0.862, επιβεβαιώνοντας χαμηλά ποσοστά ψευδαίσθησης με συμπαγές ανοιχτό μοντέλο.


