| dc.contributor.advisor | Ανδρουλάκης, Εμμανουήλ | |
| dc.contributor.author | Σγουρός, Νικόλαος | |
| dc.date.accessioned | 2026-09-29T10:24:12Z | |
| dc.date.available | 2026-09-29T10:24:12Z | |
| dc.date.issued | 2026-09 | |
| dc.identifier.uri | https://dione.lib.unipi.gr/xmlui/handle/unipi/19803 | |
| dc.description.abstract | Η ανάλυση δεδομένων επιβίωσης υψηλής διάστασης αποτελεί ιδιαίτερα απαιτητικό στατιστικό πρόβλημα, καθώς ο αριθμός των διαθέσιμων επεξηγηματικών μεταβλητών μπορεί να είναι πολύ μεγαλύτερος από το μέγεθος του δείγματος, ενώ παράλληλα πρέπει να λαμβάνεται υπόψη η παρουσία λογοκριμένων παρατηρήσεων. Σε τέτοια περιβάλλοντα, η επιλογή των μεταβλητών με ουσιαστική προγνωστική πληροφορία και η ανάπτυξη μοντέλων με όσο το δυνατόν καλύτερη ικανότητα γενίκευσης αποτελούν βασικές προκλήσεις. Στην παρούσα διπλωματική εργασία παρουσιάζονται αρχικά οι βασικές έννοιες και τα κλασικά μοντέλα της Ανάλυσης Επιβίωσης και στη συνέχεια εξετάζονται σύγχρονες μέθοδοι για δεδομένα υψηλής διάστασης.
Σε περιβάλλοντα υψηλής διαστατικότητας (𝑝≫𝑛), όπου η υπερπροσαρμογή και η πολυσυγγραμμικότητα περιορίζουν την προγνωστική ισχύ, προτείνεται μια στρατηγική δύο σταδίων, που περιλαμβάνει αρχικά μείωση της διάστασης μέσω feature screening (π.χ. RMST) και στη συνέχεια εφαρμογή ποινικοποιημένης παλινδρόμησης (regularization), όπως Broken Adaptive Ridge, Improved Adaptive Lasso, κ.α., για την ταυτόχρονη εκτίμηση και επιλογή μεταβλητών. Εξετάζονται επίσης σύγχρονες τεχνικές με εσωτερικούς μηχανισμούς ποινικοποίησης που εξασφαλίζουν αραιά (sparse) και ερμηνεύσιμα αποτελέσματα έχοντας υψηλής διάστασης δεδομένα επιβίωσης. Επιπλέον, εξετάζονται προηγμένες τεχνικές Μηχανικής Μάθησης για την ανίχνευση σύνθετων μη γραμμικών σχέσεων όπως Δέντρα Επιβίωσης (OST, OSST), Πλάγια Τυχαία Δάση Επιβίωσης (Oblique RSF), αλγόριθμοι Boosting, Survival SVM και προσεγγίσεις με σταθμισμένα βάρη Kaplan – Meier.
Η εργασία ολοκληρώνεται με την εφαρμογή επιλεγμένων τεχνικών σε ένα πραγματικό σύνολο δεδομένων επιβίωσης υψηλής διαστατικότητας, με στόχο τη δημιουργία βέλτιστου προγνωστικού μοντέλου βάσει του δείκτη συμφωνίας C – Index και την επιλογή των σημαντικότερων γονιδίων που συσχετίζονται με το χρόνο επιβίωσης.
Συνολικά, η εργασία αναδεικνύει τη σημασία της κατάλληλης επιλογής μεταβλητών, της ορθής διαδικασίας επικύρωσης και της συνδυαστικής αξιοποίησης στατιστικών και υπολογιστικών μεθόδων για την ανάπτυξη αξιόπιστων προγνωστικών μοντέλων σε δεδομένα επιβίωσης υψηλής διάστασης. | el |
| dc.format.extent | 160 | el |
| dc.language.iso | el | el |
| dc.publisher | Πανεπιστήμιο Πειραιώς | el |
| dc.rights | Αναφορά Δημιουργού-Μη Εμπορική Χρήση-Όχι Παράγωγα Έργα 3.0 Ελλάδα | * |
| dc.rights.uri | http://creativecommons.org/licenses/by-nc-nd/3.0/gr/ | * |
| dc.title | Σύγχρονες μέθοδοι ανάλυσης δεδομένων επιβίωσης υψηλής διάστασης : επιλογή μεταβλητών και μοντέλα πρόβλεψης | el |
| dc.title.alternative | Modern methods for high - dimensional survival data analysis : variable selection and predictive models | el |
| dc.type | Master Thesis | el |
| dc.contributor.department | Σχολή Χρηματοοικονομικής και Στατιστικής. Τμήμα Στατιστικής και Ασφαλιστικής Επιστήμης | el |
| dc.description.abstractEN | The analysis of high – dimensional survival data constitutes a particularly challenging statistical problem, as the number of available explanatory variables can be far greater than the sample size, while the presence of censored observations must also be taken into account. In such settings, selecting variables with substantial prognostic information and developing models with the best possible generalization capability are key challenges. This thesis presents the fundamental concepts and classical models of Survival Analysis, and subsequently examines modern methods for high – dimensional data.
In high – dimensional environments (𝑝≫𝑛), where overfitting and multicollinearity limit predictive performance, a two – stage strategy is proposed. This approach initially reduces dimensionality through feature screening (e.g., RMST), followed by the application of penalized regression (regularization) such as Broken Adaptive Ridge, Improved Adaptive Lasso, for simultaneous parameter estimation and variable selection. Modern techniques incorporating internal regularization mechanisms that produce sparse and interpretable results in high – dimensional survival data are also examined. Furthermore, advanced Machine Learning techniques are considered for detecting complex nonlinear relationships, including Survival Trees (OST, OSST), Oblique Random Survival Forests (Oblique RSF), Boosting algorithms, Survival SVM and approaches based on Kaplan – Meier weighted schemes.
The thesis concludes with the application of selected techniques to a real high – dimensional survival dataset, aiming to develop an optimal predictive model based on the Concordance Index (C-index) and identifies the most important genes associated with survival time.
Overall, this work highlights the importance of appropriate variable selection, proper validation procedures, and the combined utilization of statistical and computational methods to develop reliable prognostic models for high – dimensional survival data. | el |
| dc.contributor.master | Εφαρμοσμένη Στατιστική | el |
| dc.subject.keyword | Ανάλυση επιβίωσης | el |
| dc.subject.keyword | Επιλογή μεταβλητών | el |
| dc.subject.keyword | Μοντέλα πρόβλεψης | el |
| dc.subject.keyword | Ποινικοποίηση | el |
| dc.subject.keyword | Δεδομένα υψηλής διάστασης | el |
| dc.subject.keyword | Μηχανική μάθηση | el |
| dc.date.defense | 2026-09-23 | |