A unified taxonomy of adversarial attacks and defenses in few-shot learning

Master Thesis
Συγγραφέας
Leontaridis, Alexios
Λεονταρίδης, Αλέξης
Ημερομηνία
2026-06Επιβλέπων
Xenakis, ChristosΞενάκης, Χρήστος
Προβολή/ Άνοιγμα
Λέξεις κλειδιά
Few-shot learning ; Adversarial machine learning ; Adversarial attacks and defenses ; Threat model and taxonomy ; Prototypical networks ; Adversarial robustness ; Computer visionΠερίληψη
Η Μάθηση με Λίγα Δείγματα (Few-Shot Learning, FSL) επιτρέπει σε ένα μοντέλο να αναγνωρίζει νέες κλάσεις από ελάχιστα μόνο επισημασμένα παραδείγματα ανά κλάση, αντί για τα μεγάλα σύνολα δεδομένων που χρειάζονται τα παραδοσιακά μοντέλα βαθιάς μάθησης (deep learning). Χρησιμοποιείται ήδη σε τομείς όπως η ιατρική απεικόνιση, η αναγνώριση προσώπου, η ταξινόμηση σπάνιων ειδών και η κυβερνοασφάλεια, όπου η συλλογή πολλών δειγμάτων είναι δύσκολη ή και αδύνατη. Το πρόβλημα είναι ότι τα ίδια στοιχεία που καθιστούν χρήσιμη την FSL, δηλαδή το μικρό σύνολο υποστήριξης (support set), η επεισοδιακή εκπαίδευση (episodic training) και η ταχεία προσαρμογή σε νέες εργασίες, δημιουργούν παράλληλα αδύναμα σημεία που δεν υπάρχουν στα συμβατικά μοντέλα βαθιάς μάθησης. Η ανταγωνιστική μηχανική μάθηση (adversarial machine learning) έχει μελετηθεί εκτενώς, και η ευρωστία των μοντέλων FSL αρχίζει επίσης να προσελκύει περισσότερο ενδιαφέρον· ωστόσο, η υπάρχουσα βιβλιογραφία είναι διάσπαρτη και ανοργάνωτη και δεν υπάρχει ακόμη μια ενιαία ταξινομία αφιερωμένη ειδικά στις επιθέσεις και τις άμυνες στο πλαίσιο της μάθησης με λίγα δείγματα. Η παρούσα διπλωματική εργασία επιχειρεί να καλύψει αυτό το κενό προτείνοντας μια ενοποιημένη ταξινομία ανταγωνιστικών επιθέσεων και αμυνών για μοντέλα FSL στην όραση υπολογιστών (computer vision). Η ανάλυση βασίζεται σε ένα μοντέλο απειλής τεσσάρων διαστάσεων: την επιφάνεια επίθεσης, τη γνώση που διαθέτει ο αντίπαλος, τον στόχο που επιδιώκει και τη χρονική στιγμή της επίθεσης. Με βάση αυτές τις τέσσερις διαστάσεις, οι επιθέσεις κατηγοριοποιούνται σε έξι οικογένειες (επιθέσεις διαφυγής στο σύνολο ερωτημάτων, δηλητηρίαση του συνόλου υποστήριξης, δηλητηρίαση καθαρής ετικέτας, επιθέσεις κερκόπορτας/backdoor, καθολικές ανταγωνιστικές διαταραχές και επιθέσεις στον χώρο ενσωμάτωσης), ενώ οι άμυνες ομαδοποιούνται σε τέσσερις κατηγορίες (ανταγωνιστική εκπαίδευση, πιστοποιημένες άμυνες, μέθοδοι βασισμένες στην ανίχνευση και άμυνες ειδικά για επιθέσεις backdoor). Η ταξινομία αναδεικνύει ορισμένα μοτίβα. Σχεδόν κάθε επίθεση προϋποθέτει πρόσβαση τύπου white-box, στοχεύει στην ακεραιότητα του μοντέλου και πραγματοποιείται κατά τον χρόνο εξαγωγής συμπερασμάτων (inference time), ενώ οι επιθέσεις τύπου gray-box και αυστηρού black-box, καθώς και η δηλητηρίαση κατά τη μετα-εκπαίδευση (metatraining), σχεδόν δεν καλύπτονται στη βιβλιογραφία. Οι άμυνες είναι επίσης ανομοιόμορφες: ελάχιστες προστατεύουν το σύνολο υποστήριξης, σχεδόν καμία δεν αντιμετωπίζει τις χειραγωγήσεις στον χώρο ενσωμάτωσης, και δεν υπάρχει ουσιαστική άμυνα έναντι των backdoor επιθέσεων που είναι ειδικές για την FSL. Για να συνδεθεί η ανάλυση με την πράξη, υλοποιείται μια απόδειξη ιδέας (proof-of-concept) στο CIFAR-FS και miniImageNet με Prototypical Networks με δύο backbone, Conv4 και ResNet-12, αξιολογώντας το μοντέλο απέναντι στις επιθέσεις FGSM, Adversarial Support Poisoning (ASP) και FAMF, με και χωρίς Adversarial Querying. Τα αποτελέσματα επιβεβαιώνουν ότι η αδυναμία στα FSL εξαρτάται σε μεγάλο βαθμό τόσο από την οικογένεια της επίθεσης
όσο και από το backbone, και ότι μια άμυνα σχεδιασμένη για την κλασική βαθιά μάθηση δεν μεταφέρεται καθαρά στο πλαίσιο της μάθησης με λίγα δείγματα.


