Show simple item record

VisionAI : μια εφαρμογή Android πολλαπλών λειτουργιών υπολογιστικής όρασης εντός συσκευής, με ανίχνευση αντικειμένων σε πραγματικό χρόνο, αναγνώριση κειμένου, και γεωχωρική ανάλυση

dc.contributor.advisorΑλέπης, Ευθύμιος
dc.contributor.authorΤομάζος, Γρηγόριος
dc.date.accessioned2026-07-23T12:28:45Z
dc.date.available2026-07-23T12:28:45Z
dc.date.issued2026-07
dc.identifier.urihttps://dione.lib.unipi.gr/xmlui/handle/unipi/19622
dc.description.abstractΤα smartphones έχουν καταστεί πανταχού παρούσες πλατφόρμες αισθητήρων, ωστόσο οι περισσότερες υπάρχουσες εφαρμογές αξιοποιούν μόνο ένα κλάσμα των αντιληπτικών τους δυνατοτήτων. Η εφαρμογή VisionAI καλύπτει αυτό το κενό προσφέροντας μια ολοκληρωμένη σουίτα υπολογιστικής όρασης εξ ολοκλήρου στη συσκευή (on-device), χωρίς να απαιτείται σύνδεση με το cloud για τη βασική της λειτουργικότητα. Η εφαρμογή ενσωματώνει ένα κβαντισμένο νευρωνικό δίκτυο YOLOv8 Nano (YOLOv8n) μέσω του TensorFlow Lite, ώστε να εκτελεί ανίχνευση αντικειμένων σε πραγματικό χρόνο, έως και 30 καρέ ανά δευτερόλεπτο, σε Android συσκευές μεσαίας κατηγορίας. Πέρα από την ανίχνευση αντικειμένων, το VisionAI ενσωματώνει το Google ML Kit για οπτική αναγνώριση χαρακτήρων (OCR), λήψη τμήματος οθόνης μέσω MediaProjection, καθώς και ανάλυση βίντεο καρέ-προς-καρέ με χρήση του ExoPlayer. Τα αποτελέσματα ανίχνευσης αποθηκεύονται στο Google Cloud Firestore, επισημαίνονται με συντεταγμένες GPS που λαμβάνονται από τον Fused Location Provider, και απεικονίζονται σε επίπεδο χάρτη OpenStreetMap. Ένας πίνακας στατιστικών συγκεντρώνει την εβδομαδιαία δραστηριότητα, τις τάσεις εμπιστοσύνης (confidence) και τις πιο συχνές κατηγορίες αντικειμένων. Η εφαρμογή έχει αναπτυχθεί σε Kotlin, με χρήση Jetpack Compose, ακολουθώντας αυστηρά την αρχιτεκτονική MVVM. Υποστηρίζει πέντε φυσικές γλώσσες (Αγγλικά, Ελληνικά, Γερμανικά, Γαλλικά, Ισπανικά) και ένα πλήρως δυναμικό σύστημα θεματοποίησης σκοτεινής/φωτεινής εμφάνισης. Το παρόν κείμενο περιγράφει τα κίνητρα πίσω από το VisionAI, ανασκοπεί τη σχετική βιβλιογραφία, αναλύει κάθε αρχιτεκτονική και υλοποιητική απόφαση, συζητά τον σχεδιασμό της εμπειρίας χρήστη, αξιολογεί την απόδοση του συστήματος και παρουσιάζει το ευρύ φάσμα πραγματικών περιπτώσεων χρήσης που καθιστά δυνατές — από τεχνολογίες υποβοήθησης για άτομα με προβλήματα όρασης έως έξυπνη συλλογή πεδίου για ερευνητές και εκπαιδευτικούς.el
dc.format.extent73el
dc.language.isoelel
dc.publisherΠανεπιστήμιο Πειραιώςel
dc.titleVisionAI : μια εφαρμογή Android πολλαπλών λειτουργιών υπολογιστικής όρασης εντός συσκευής, με ανίχνευση αντικειμένων σε πραγματικό χρόνο, αναγνώριση κειμένου, και γεωχωρική ανάλυσηel
dc.title.alternativeVisionAI : a multi-function on-device computer vision Android application with real-time object detection, text recognition, and geospatial analysisel
dc.typeBachelor Dissertationel
dc.contributor.departmentΣχολή Τεχνολογιών Πληροφορικής και Επικοινωνιών. Τμήμα Πληροφορικήςel
dc.description.abstractENSmartphones have become ubiquitous sensor platforms, yet most existing applications exploit only a fraction of their perceptual capabilities. VisionAI closes this gap by offering a complete on-device computer vision suite that requires no cloud connection for its core functionality. The application embeds a quantized YOLOv8 Nano (YOLOv8n) neural network via TensorFlow Lite to perform real-time object detection at up to 30 frames per second on mid-range Android devices. Beyond object detection, VisionAI integrates Google ML Kit for optical character recognition (OCR), screen-region capture via MediaProjection, and frame-by-frame video analysis using ExoPlayer. Detection results are stored in Google Cloud Firestore, tagged with GPS coordinates obtained from the Fused Location Provider, and rendered on an OpenStreetMap map layer. A statistics dashboard aggregates weekly activity, confidence trends, and the most frequent object categories. The application is built in Kotlin using Jetpack Compose, strictly following the MVVM architecture. It supports five natural languages (English, Greek, German, French, Spanish) and a fully dynamic dark/light theming system. This text describes the motivation behind VisionAI, reviews the relevant literature, analyses every architectural and implementation decision, discusses the user-experience design, evaluates system performance, and presents the broad range of real-world use cases it enables — from assistive technology for visually impaired users to smart field data collection for researchers and educators.el
dc.subject.keywordAndroidel
dc.subject.keywordΑνίχνευση αντικειμένωνel
dc.subject.keywordYOLOv8el
dc.subject.keywordTensorFlow Liteel
dc.subject.keywordJetpack composeel
dc.subject.keywordOCRel
dc.subject.keywordML Kitel
dc.subject.keywordFirebaseel
dc.subject.keywordΥπολογιστική όρασηel
dc.subject.keywordMVVMel
dc.date.defense2026-07-15


Files in this item

Thumbnail

This item appears in the following Collection(s)

Show simple item record


Βιβλιοθήκη Πανεπιστημίου Πειραιώς
Contact Us
Send Feedback
Created by ELiDOC
Η δημιουργία κι ο εμπλουτισμός του Ιδρυματικού Αποθετηρίου "Διώνη", έγιναν στο πλαίσιο του Έργου «Υπηρεσία Ιδρυματικού Αποθετηρίου και Ψηφιακής Βιβλιοθήκης» της πράξης «Ψηφιακές υπηρεσίες ανοιχτής πρόσβασης της βιβλιοθήκης του Πανεπιστημίου Πειραιώς»