Περίληψη
Ο κύριος στόχος αυτής της διατριβής είναι η ανάπτυξη βελτιωμένων τεχνικών εκτίμησης κίνησης και κατάτμησης που ανταποκρίνονται στις απαιτήσεις επεξεργασίας εικόνας της βιομηχανίας μεταπαραγωγής (post-production). Ξεκινώντας με μια αυστηρή ταξινόμηση των υπαρχουσών τεχνικών κατάτμησης εικόνας, προχωράμε εστιάζοντας στην εκτίμηση κίνησης μέσω του υπολογισμού της οπτικής ροής. Αναπτύσσεται μια μέθοδος βασισμένη σε παραμετρικό μοντέλο κίνησης για την εκτίμηση πεδίων οπτικής ροής σε τρία διαδοχικά πλαίσια (frames) και δοκιμάζεται σε έναν αριθμό έγχρωμων πραγματικών ακολουθιών. Οι αρχικές εκτιμήσεις βελτιώνονται με εύρωστο τρόπο (robustly) σε ένα επαναληπτικό σχήμα και ενισχύονται από πληροφορίες κατανομής πιθανότητας χρώματος, ώστε να καταστεί δυνατή η κατάτμηση προσκηνίου/παρασκηνίου (foreground/background) σε ένα σχήμα ταξινόμησης εικονοστοιχείων (pixels) μέγιστης εκ των υστέρων πιθανότητας (maximum a posteriori). Τα πειράματα δείχνουν τη σημαντική συνεισφορά του χρωματικού τμήματος προς ...
Ο κύριος στόχος αυτής της διατριβής είναι η ανάπτυξη βελτιωμένων τεχνικών εκτίμησης κίνησης και κατάτμησης που ανταποκρίνονται στις απαιτήσεις επεξεργασίας εικόνας της βιομηχανίας μεταπαραγωγής (post-production). Ξεκινώντας με μια αυστηρή ταξινόμηση των υπαρχουσών τεχνικών κατάτμησης εικόνας, προχωράμε εστιάζοντας στην εκτίμηση κίνησης μέσω του υπολογισμού της οπτικής ροής. Αναπτύσσεται μια μέθοδος βασισμένη σε παραμετρικό μοντέλο κίνησης για την εκτίμηση πεδίων οπτικής ροής σε τρία διαδοχικά πλαίσια (frames) και δοκιμάζεται σε έναν αριθμό έγχρωμων πραγματικών ακολουθιών. Οι αρχικές εκτιμήσεις βελτιώνονται με εύρωστο τρόπο (robustly) σε ένα επαναληπτικό σχήμα και ενισχύονται από πληροφορίες κατανομής πιθανότητας χρώματος, ώστε να καταστεί δυνατή η κατάτμηση προσκηνίου/παρασκηνίου (foreground/background) σε ένα σχήμα ταξινόμησης εικονοστοιχείων (pixels) μέγιστης εκ των υστέρων πιθανότητας (maximum a posteriori). Τα πειράματα δείχνουν τη σημαντική συνεισφορά του χρωματικού τμήματος προς μια καλά κατατμημένη εικόνα. Επιπλέον, μια πολύ ακριβής μεταβολική (variational) μέθοδος υπολογισμού οπτικής ροής —βασισμένη σε περιορισμούς σταθερότητας φωτεινότητας, σταθερότητας βαθμίδας (gradient) και χωροχρονικής ομαλότητας— τροποποιείται και υλοποιείται έτσι ώστε να μπορεί να εκτιμήσει με εύρωστο τρόπο την καθολική (global) κίνηση σε τρία διαδοχικά πλαίσια. Η κίνηση ενισχύεται από χρωματικά τεκμήρια με παρόμοιο τρόπο και η μέθοδος υιοθετεί την ίδια πιθανοτική διαδικασία σήμανσης (labelling). Μετά από μια σύγκριση των δύο μεθόδων στις ίδιες έγχρωμες ακολουθίες, υλοποιείται μια τρίτη μέθοδος βασισμένη σε νευρωνικά δίκτυα, η οποία αρχικά εκτιμά την κίνηση χρησιμοποιώντας δύο κυψελωτά νευρωνικά δίκτυα (Cellular Neural Networks - CNN) υπολογισμού οπτικής ροής δίδυμου στρώματος (twin-layer) και προχωρά με παρόμοιο τρόπο (ενσωματώνοντας χρωματική πληροφορία και ταξινομώντας πιθανοτικά τα εικονοστοιχεία), οδηγώντας σε παρόμοια ή βελτιωμένα ποιοτικά αποτελέσματα με το πρόσθετο πλεονέκτημα της σημαντικά επιταχυνόμενης απόδοσης. Επιπλέον, ένα άλλο CNN επιστρατεύεται με σκοπό να προσφέρει υποστήριξη περιορισμών χωρικής και χρονικής συμβατότητας εικονοστοιχείων, βελτιώνοντας περαιτέρω την ποιότητα των κατατμημένων εικόνων. Χρησιμοποιούνται βάρη για τον έλεγχο των αντίστοιχων όρων συνεισφοράς, επιτρέποντας τη βελτιστοποίηση των αποτελεσμάτων κατάτμησης για κάθε ακολουθία ξεχωριστά. Τέλος, ως μελέτη περίπτωσης (case study) της υλοποίησης CNN σε υλικό (FPGA), αξιοποιείται η χρήση της Handel-C, μιας παράλληλης γλώσσας περιγραφής υλικού υψηλού επιπέδου που μοιάζει με τη C, ώστε να επιτραπεί η ταχεία μετάφραση των αλγορίθμων μας σε αποδοτικό υλικό.
περισσότερα
Περίληψη σε άλλη γλώσσα
The principal objective of this thesis is to develop improved motion estimation and segmentation techniques that meet the image-processing requirements of the post-production industry. Starting with a rigorous taxonomy of existing image segmentation techniques, we proceed by focusing on motion estimation by means of optical flow calculation. A parametric motion model based method to estimate optical flow fields on three consecutive frames is developed and tested on a number of colour real sequences. Initial estimates are robustly refined in an iterative scheme and are enhanced by colour probability distribution information to enable foreground/background segmentation in a maximum a posteriori pixel classification scheme. Experiments show the significant contribution of the colour part towards a well-segmented image. Additionally, a very accurate variational optical flow computation method based on brightness constancy, gradient constancy and spatiotemporal smoothness constraints is mod ...
The principal objective of this thesis is to develop improved motion estimation and segmentation techniques that meet the image-processing requirements of the post-production industry. Starting with a rigorous taxonomy of existing image segmentation techniques, we proceed by focusing on motion estimation by means of optical flow calculation. A parametric motion model based method to estimate optical flow fields on three consecutive frames is developed and tested on a number of colour real sequences. Initial estimates are robustly refined in an iterative scheme and are enhanced by colour probability distribution information to enable foreground/background segmentation in a maximum a posteriori pixel classification scheme. Experiments show the significant contribution of the colour part towards a well-segmented image. Additionally, a very accurate variational optical flow computation method based on brightness constancy, gradient constancy and spatiotemporal smoothness constraints is modified and implemented so that it can robustly estimate global motion over three consecutive frames. Motion is enhanced by colour evidence in a similar manner and the method adopts the same probabilistic labelling procedure. After a comparison of the two methods on the same colour sequences, a third neural network based method is implemented, which initially estimates motion by employing two twin-layer optical flow calculating Cellular Neural Networks and proceeds in a similar manner (incorporating colour information and probabilistically classifying pixels), leading to similar or improved quality results with the added advantage of significantly accelerated performance. Moreover, another CNN is employed with the task of offering spatial and temporal pixel compatibility constraint support, further improving the quality of the segmented images. Weights are used to control the respective contributing terms enabling optimization of the segmentation results for each sequence individually. Finally, as a case study of CNN implementation in hardware (FPGA), the use of Handel-C, a C-like, high-level, parallel, hardware description language, is exploited to allow for rapid translation of our algorithms to efficient hardware.
περισσότερα