| dc.contributor.advisor | Maglogiannis, Ilias | |
| dc.contributor.advisor | Μαγκλογιάννης, Ηλίας | |
| dc.contributor.author | Georgopoulos, Ioannis | |
| dc.contributor.author | Γεωργόπουλος, Ιωάννης | |
| dc.date.accessioned | 2026-09-30T09:44:11Z | |
| dc.date.available | 2026-09-30T09:44:11Z | |
| dc.date.issued | 2026-03 | |
| dc.identifier.uri | https://dione.lib.unipi.gr/xmlui/handle/unipi/19808 | |
| dc.description.abstract | Η διπλωματική εργασία ερευνά το πρόβλημα της αυτόματης αναγνώρισης σημάτων
διαιτητών καλαθοσφαίρισης από τηλεοπτικό υλικό αγώνων. Σε αντίθεση με τις κλασικές έρευνες
αναγνώρισης αντικειμένων, τα σήματα των διαιτητών εκφράζονται μέσω μικρών διαφοροποιήσεων
στη στάση του σώματος και στη διάταξη των άκρων, γεγονός που καθιστά την αναγνώρισή τους
ιδιαίτερα απαιτητική σε ρεαλιστικές συνθήκες μετάδοσης, όπου παρατηρούνται διαφορετικές γωνίες
κάμερας, διάφορες παρεμβολές, μέτρια ανάλυση μετάδοσης, μεταβολές της οπτικής κλίμακας και
ισχυρή επιρροή του γενικότερου οπτικού πλαισίου. Για την αντιμετώπιση των προκλήσεων αυτών
προτείνεται μια αρχιτεκτονική τριών σταδίων, με επίκεντρο τον διαιτητή. Η προσέγγισή της εργασίας,
είναι η διάσπαση του προβλήματος σε τρία διαδοχικά στάδια. Αρχικά, ο εντοπισμός των διαιτητών σε
πλήρη καρέ μετάδοσης. Στη συνέχεια, δυαδική ταξινόμηση για διάκριση μεταξύ σήματος και μη
σήματος, ενώ τέλος, αναγνώριση και ταξινόμηση του συγκεκριμένου τύπου σήματος. Η προσέγγιση
αξιολογείται σε σύγκριση με ένα μοντέλο άμεσης ταξινόμησης ολόκληρων καρέ, αποδεικνύοντας ότι
το γενικότερο οπτικό πλαίσιο ενός αγώνα μπορεί να οδηγήσει σε φαινομενικά υψηλή ακρίβεια, αλλά
με περιορισμένη ικανότητα γενίκευσης. Κατασκευάστηκαν προσαρμοσμένα σύνολα δεδομένων από
πλήρεις αγώνες υπό ρεαλιστικές συνθήκες μετάδοσης. Τα πειραματικά αποτελέσματα δείχνουν ότι η
αρχιτεκτονική εντοπισμού των διαιτητών βελτιώνει την ανθεκτικότητα του συστήματος, ενώ το
μέγεθος του συνόλου δεδομένων, η ισορροπία μεταξύ των κλάσεων και οι στρατηγικές αύξησης του
συνόλου δεδομένων, επηρεάζουν καθοριστικά τη δυνατότητα γενίκευσης. Επιπλέον,
ενσωματώνονται μηχανισμοί χρονικής εξομάλυνσης για τη βελτίωση της σταθερότητας των
προβλέψεων σε βίντεο, χωρίς την ανάγκη υπολογιστικά απαιτητικών μοντέλων μάθησης σε επίπεδο
βίντεο. | el |
| dc.format.extent | 89 | el |
| dc.language.iso | en | el |
| dc.publisher | Πανεπιστήμιο Πειραιώς | el |
| dc.rights | Αναφορά Δημιουργού-Μη Εμπορική Χρήση-Όχι Παράγωγα Έργα 3.0 Ελλάδα | * |
| dc.rights.uri | http://creativecommons.org/licenses/by-nc-nd/3.0/gr/ | * |
| dc.title | Recognition of basketball referee signals using machine learning and computer vision | el |
| dc.type | Master Thesis | el |
| dc.contributor.department | Σχολή Τεχνολογιών Πληροφορικής και Επικοινωνιών. Τμήμα Ψηφιακών Συστημάτων | el |
| dc.description.abstractEN | This thesis investigates the problem of automatic basketball referee signal recognition from
broadcast video footage. Unlike conventional object recognition tasks, referee signals are expressed
through subtle variations in human pose and hands configuration, making them challenging to detect
under realistic broadcast conditions characterized by camera motion, resolution, occlusions, scale
variation, and contextual bias. To address these challenges, a referee centric, multistage computer
vision pipeline is proposed. The system decomposes the task into three sequential components. First,
referee detection from full broadcast frames. Second, binary classification to distinguish signal from
non-signal gestures and third, multi-class classification to recognize specific signal types. The approach
is evaluated against a direct broadcast frame classification baseline, demonstrating that context driven
models achieve high apparent accuracy but fail to generalize reliably. Custom datasets were
constructed from full game recordings under realistic conditions. Experimental results show that
detection-first architectures improve robustness, while dataset scale, class balance, and augmentation
strategy critically influence generalization performance. Furthermore, lightweight temporal
aggregation mechanisms are integrated to enhance prediction stability during video inference without
requiring computationally intensive end to end video models. The findings highlight the importance of
architectural decomposition and domain dataset construction in gesture recognition systems
operating in real world broadcast environments. The proposed framework provides both
methodological insights and practical guidelines for developing structured recognition systems in
sports analytics. | el |
| dc.contributor.master | Πληροφοριακά Συστήματα και Υπηρεσίες | el |
| dc.subject.keyword | Computer vision | el |
| dc.subject.keyword | Deep learning | el |
| dc.subject.keyword | Basketball referee signal recognition | el |
| dc.subject.keyword | Gesture recognition | el |
| dc.subject.keyword | YOLOv8 | el |
| dc.subject.keyword | Video analysis | el |
| dc.date.defense | 2026-06-10 | |