VisionAI : μια εφαρμογή Android πολλαπλών λειτουργιών υπολογιστικής όρασης εντός συσκευής, με ανίχνευση αντικειμένων σε πραγματικό χρόνο, αναγνώριση κειμένου, και γεωχωρική ανάλυση
VisionAI : a multi-function on-device computer vision Android application with real-time object detection, text recognition, and geospatial analysis

Προβολή/ Άνοιγμα
Λέξεις κλειδιά
Android ; Ανίχνευση αντικειμένων ; YOLOv8 ; TensorFlow Lite ; Jetpack compose ; OCR ; ML Kit ; Firebase ; Υπολογιστική όραση ; MVVMΠερίληψη
Τα smartphones έχουν καταστεί πανταχού παρούσες πλατφόρμες αισθητήρων, ωστόσο οι περισσότερες υπάρχουσες εφαρμογές αξιοποιούν μόνο ένα κλάσμα των αντιληπτικών τους δυνατοτήτων. Η εφαρμογή VisionAI καλύπτει αυτό το κενό προσφέροντας μια ολοκληρωμένη σουίτα υπολογιστικής όρασης εξ ολοκλήρου στη συσκευή (on-device), χωρίς να απαιτείται σύνδεση με το cloud για τη βασική της λειτουργικότητα. Η εφαρμογή ενσωματώνει ένα κβαντισμένο νευρωνικό δίκτυο YOLOv8 Nano (YOLOv8n) μέσω του TensorFlow Lite, ώστε να εκτελεί ανίχνευση αντικειμένων σε πραγματικό χρόνο, έως και 30 καρέ ανά δευτερόλεπτο, σε Android συσκευές μεσαίας κατηγορίας. Πέρα από την ανίχνευση αντικειμένων, το VisionAI ενσωματώνει το Google ML Kit για οπτική αναγνώριση χαρακτήρων (OCR), λήψη τμήματος οθόνης μέσω MediaProjection, καθώς και ανάλυση βίντεο καρέ-προς-καρέ με χρήση του ExoPlayer.
Τα αποτελέσματα ανίχνευσης αποθηκεύονται στο Google Cloud Firestore, επισημαίνονται με συντεταγμένες GPS που λαμβάνονται από τον Fused Location Provider, και απεικονίζονται σε επίπεδο χάρτη OpenStreetMap. Ένας πίνακας στατιστικών συγκεντρώνει την εβδομαδιαία δραστηριότητα, τις τάσεις εμπιστοσύνης (confidence) και τις πιο συχνές κατηγορίες αντικειμένων. Η εφαρμογή έχει αναπτυχθεί σε Kotlin, με χρήση Jetpack Compose, ακολουθώντας αυστηρά την αρχιτεκτονική MVVM. Υποστηρίζει πέντε φυσικές γλώσσες (Αγγλικά, Ελληνικά, Γερμανικά, Γαλλικά, Ισπανικά) και ένα πλήρως δυναμικό σύστημα θεματοποίησης σκοτεινής/φωτεινής εμφάνισης.
Το παρόν κείμενο περιγράφει τα κίνητρα πίσω από το VisionAI, ανασκοπεί τη σχετική βιβλιογραφία, αναλύει κάθε αρχιτεκτονική και υλοποιητική απόφαση, συζητά τον σχεδιασμό της εμπειρίας χρήστη, αξιολογεί την απόδοση του συστήματος και παρουσιάζει το ευρύ φάσμα πραγματικών περιπτώσεων χρήσης που καθιστά δυνατές — από τεχνολογίες υποβοήθησης για άτομα με προβλήματα όρασης έως έξυπνη συλλογή πεδίου για ερευνητές και εκπαιδευτικούς.

