Recognition of basketball referee signals using machine learning and computer vision

Master Thesis
Συγγραφέας
Georgopoulos, Ioannis
Γεωργόπουλος, Ιωάννης
Ημερομηνία
2026-03Επιβλέπων
Maglogiannis, IliasΜαγκλογιάννης, Ηλίας
Προβολή/ Άνοιγμα
Λέξεις κλειδιά
Computer vision ; Deep learning ; Basketball referee signal recognition ; Gesture recognition ; YOLOv8 ; Video analysisΠερίληψη
Η διπλωματική εργασία ερευνά το πρόβλημα της αυτόματης αναγνώρισης σημάτων
διαιτητών καλαθοσφαίρισης από τηλεοπτικό υλικό αγώνων. Σε αντίθεση με τις κλασικές έρευνες
αναγνώρισης αντικειμένων, τα σήματα των διαιτητών εκφράζονται μέσω μικρών διαφοροποιήσεων
στη στάση του σώματος και στη διάταξη των άκρων, γεγονός που καθιστά την αναγνώρισή τους
ιδιαίτερα απαιτητική σε ρεαλιστικές συνθήκες μετάδοσης, όπου παρατηρούνται διαφορετικές γωνίες
κάμερας, διάφορες παρεμβολές, μέτρια ανάλυση μετάδοσης, μεταβολές της οπτικής κλίμακας και
ισχυρή επιρροή του γενικότερου οπτικού πλαισίου. Για την αντιμετώπιση των προκλήσεων αυτών
προτείνεται μια αρχιτεκτονική τριών σταδίων, με επίκεντρο τον διαιτητή. Η προσέγγισή της εργασίας,
είναι η διάσπαση του προβλήματος σε τρία διαδοχικά στάδια. Αρχικά, ο εντοπισμός των διαιτητών σε
πλήρη καρέ μετάδοσης. Στη συνέχεια, δυαδική ταξινόμηση για διάκριση μεταξύ σήματος και μη
σήματος, ενώ τέλος, αναγνώριση και ταξινόμηση του συγκεκριμένου τύπου σήματος. Η προσέγγιση
αξιολογείται σε σύγκριση με ένα μοντέλο άμεσης ταξινόμησης ολόκληρων καρέ, αποδεικνύοντας ότι
το γενικότερο οπτικό πλαίσιο ενός αγώνα μπορεί να οδηγήσει σε φαινομενικά υψηλή ακρίβεια, αλλά
με περιορισμένη ικανότητα γενίκευσης. Κατασκευάστηκαν προσαρμοσμένα σύνολα δεδομένων από
πλήρεις αγώνες υπό ρεαλιστικές συνθήκες μετάδοσης. Τα πειραματικά αποτελέσματα δείχνουν ότι η
αρχιτεκτονική εντοπισμού των διαιτητών βελτιώνει την ανθεκτικότητα του συστήματος, ενώ το
μέγεθος του συνόλου δεδομένων, η ισορροπία μεταξύ των κλάσεων και οι στρατηγικές αύξησης του
συνόλου δεδομένων, επηρεάζουν καθοριστικά τη δυνατότητα γενίκευσης. Επιπλέον,
ενσωματώνονται μηχανισμοί χρονικής εξομάλυνσης για τη βελτίωση της σταθερότητας των
προβλέψεων σε βίντεο, χωρίς την ανάγκη υπολογιστικά απαιτητικών μοντέλων μάθησης σε επίπεδο
βίντεο.


