Μεγάλα γλωσσικά μοντέλα με χρήση RAG για την αντιστοίχιση υποψηφίων με θέσεις εργασίας
RAG-based LLMs for job matching tasks
Bachelor Dissertation
Συγγραφέας
Συρίγου, Στυλιανή
Ημερομηνία
2026-09Επιβλέπων
Σωτηρόπουλος, ΔιονύσιοςΠροβολή/ Άνοιγμα
Λέξεις κλειδιά
Αξιολόγηση βιογραφικών ; Κατάταξη υποψηφίων ; Περιγραφή θέσης εργασίας ; Διανυσματική βάση δεδομένων ; Τοπικό γλωσσικό μοντέλο ; Αναγνώριση κειμένουΠερίληψη
Η παρούσα εργασία πραγματεύεται τον σχεδιασμό και την υλοποίηση ενός καινοτόμου, αυτοματοποιημένου συστήματος αξιολόγησης και κατάταξης βιογραφικών σημειωμάτων με τη χρήση τεχνολογιών Τεχνητής Νοημοσύνης (AI). Βασικός στόχος της εφαρμογής είναι η αυτοματοποίηση της διαδικασίας επιλογής προσωπικού (Recruitment), μέσω της μέτρησης του βαθμού συνάφειας μεταξύ των προσόντων των υποψηφίων και των απαιτήσεων μιας συγκεκριμένης θέσης εργασίας (Job Description).
Το σύστημα αναπτύχθηκε σε περιβάλλον Python (Streamlit UI) και υποστηρίζει την πολυτροπική εισαγωγή δεδομένων, επεξεργαζόμενο αρχεία μορφής PDF, εικόνων (JPG/PNG), καθώς και μαζικών αρχείων ZIP. Για την εξαγωγή κειμένου από οπτικά έγγραφα ενσωματώθηκε η τεχνολογία Οπτικής Αναγνώρισης Χαρακτήρων EasyOCR.
Η αρχιτεκτονική του συστήματος βασίζεται στην προηγμένη τεχνική RAG (Retrieval-Augmented Generation), η οποία επιτρέπει στο Μεγάλο Γλωσσικό Μοντέλο Phi-3 (της Microsoft) να αναλύει δυναμικά και σε πραγματικό χρόνο τα δεδομένα. Η ανάκτηση των πληροφοριών πραγματοποιείται μέσω της διανυσματικής βάσης δεδομένων ChromaDB, όπου τα βιογραφικά έχουν μετατραπεί σε μαθηματικά διανύσματα (Embeddings) για την επίτευξη σημασιολογικής αναζήτησης (Semantic Search). Ο συντονισμός και η διασύνδεση των υποσυστημάτων πραγματοποιείται μέσω του πλαισίου LangChain.
Το τελικό περιβάλλον εργασίας προσφέρει στον διαχειριστή HR μια διπλή οπτική σύγκριση: στην αριστερή πλευρά κατατάσσονται οι νεοεισαχθέντες υποψήφιοι, ενώ στη δεξιά πλευρά ανακτώνται οι βέλτιστοι υποψήφιοι από τη διανυσματική βάση, η οποία δημιουργείται μέσω της διαδικασίας ingestion από δημόσιο σύνολο δεδομένων 962 βιογραφικών [40]. Η κατάταξη γίνεται αυτόματα σε φθίνουσα σειρά βάσει ενός ποσοστιαίου δείκτη καταλληλότητας (Score 0-100%). Παράλληλα, το σύστημα παράγει μια ποιοτική σύνοψη για κάθε υποψήφιο και προτείνει τρεις εξειδικευμένες ερωτήσεις συνέντευξης, εστιάζοντας στα εντοπισμένα κενά ή τις αδυναμίες του βιογραφικού. Λόγω της τοπικής εκτέλεσης του μοντέλου μέσω της πλατφόρμας Ollama, διασφαλίζεται πλήρως η ιδιωτικότητα και η ασφάλεια των ευαίσθητων προσωπικών δεδομένων.

