Περίληψη
Η παρούσα Διδακτορική Διατριβή επικεντρώνεται στην ανίχνευση ακραίων τιμών σε χρονοσειρές, δηλαδή στην εύρεση συμβάντων ή παρατηρήσεων που δεν συμφωνούν με ένα αναμενόμενο πρότυπο σε σχέση με το σύνολο των δεδομένων. Η έγκαιρη αναγνώρισή τους μπορεί να συμβάλει τόσο στην κατανόηση των δεδομένων όσο και στην πρόβλεψη μελλοντικών εξελίξεων. Στο πρώτο μέρος της Διατριβής προτείνονται τρεις νέοι αλγόριθμοι ανίχνευσης ακραίων τιμών σε μονοδιάστατες χρονοσειρές, οι οποίοι βασίζονται στη μετατροπή των δεδομένων σε γράφημα και στη μελέτη των γωνιών που σχηματίζονται μεταξύ διαδοχικών τιμών. Οι προτεινόμενοι αλγόριθμοι (Angles_Per, Angles_Lim και Angles_Graph) αξιολογήθηκαν σε συνθετικά και πραγματικά σύνολα δεδομένων, παρουσιάζοντας υψηλή ακρίβεια, σημαντική μείωση των ψευδώς θετικών αποτελεσμάτων και ανταγωνιστική ή καλύτερη απόδοση σε σχέση με υπάρχουσες γνωστές μεθόδους. Η εφαρμογή των προτεινόμενων μεθόδων σε δεδομένα ανθρώπινου δυναμικού αναδεικνύει τη σημασία της ανίχνευσης ακραίων τιμών ...
Η παρούσα Διδακτορική Διατριβή επικεντρώνεται στην ανίχνευση ακραίων τιμών σε χρονοσειρές, δηλαδή στην εύρεση συμβάντων ή παρατηρήσεων που δεν συμφωνούν με ένα αναμενόμενο πρότυπο σε σχέση με το σύνολο των δεδομένων. Η έγκαιρη αναγνώρισή τους μπορεί να συμβάλει τόσο στην κατανόηση των δεδομένων όσο και στην πρόβλεψη μελλοντικών εξελίξεων. Στο πρώτο μέρος της Διατριβής προτείνονται τρεις νέοι αλγόριθμοι ανίχνευσης ακραίων τιμών σε μονοδιάστατες χρονοσειρές, οι οποίοι βασίζονται στη μετατροπή των δεδομένων σε γράφημα και στη μελέτη των γωνιών που σχηματίζονται μεταξύ διαδοχικών τιμών. Οι προτεινόμενοι αλγόριθμοι (Angles_Per, Angles_Lim και Angles_Graph) αξιολογήθηκαν σε συνθετικά και πραγματικά σύνολα δεδομένων, παρουσιάζοντας υψηλή ακρίβεια, σημαντική μείωση των ψευδώς θετικών αποτελεσμάτων και ανταγωνιστική ή καλύτερη απόδοση σε σχέση με υπάρχουσες γνωστές μεθόδους. Η εφαρμογή των προτεινόμενων μεθόδων σε δεδομένα ανθρώπινου δυναμικού αναδεικνύει τη σημασία της ανίχνευσης ακραίων τιμών σε μεταβλητές όπως οι απουσίες εργαζομένων ή οι ώρες εργασίας. Η ανίχνευση τέτοιου είδους ακραίων τιμών μπορεί να λειτουργήσει ως δείκτης οργανωτικών κινδύνων, όπως η επαγγελματική εξουθένωση ή η άνιση κατανομή φόρτου εργασίας προσφέροντας ένα εργαλείο έγκαιρης προειδοποίησης για τη διοίκηση. Με τον τρόπο αυτό, η ανίχνευση ακραίων τιμών συνδέεται άμεσα με τη διαδικασία λήψης αποφάσεων. Στη συνέχεια, η ανάλυση επεκτείνεται πέρα από τη μεμονωμένη ανίχνευση ακραίων τιμών, προτείνοντας μία μεθοδολογία εξαγωγής συσχετίσεων μεταξύ ακραίων τιμών που εμφανίζονται σε διαφορετικές χρονοσειρές. Η μεθοδολογία βασίζεται στην ανίχνευση και ομαδοποίηση των ακραίων τιμών αναλόγως με την παρουσία ή την απουσία τους ανά χρονικό διάστημα και στην εφαρμογή του αλγορίθμου Apriori για την εξαγωγή κανόνων συσχέτισης. Οι κανόνες αυτοί αξιοποιούνται για την εύρεση συνδέσεων μεταξύ των χρονοσειρών αλλά και τη βραχυπρόθεσμη πρόβλεψη ακραίων τιμών σε μία χρονοσειρά. Τέλος, προτείνεται μία μεθοδολογία εύρεσης μελλοντικών μοτίβων σε χρονοσειρές που βασίζεται στη συμβολική αναπαράσταση των δεδομένων. Μέσω της μετατροπής των αριθμητικών τιμών και των διαφορών τους σε συμβολικές ακολουθίες καθίσταται δυνατή η αναγνώριση επαναλαμβανόμενων δομών, οι οποίες αξιοποιούνται για την πρόβλεψη μελλοντικών μοτίβων. Τα πειραματικά αποτελέσματα σε πραγματικά δεδομένα διαφορετικών πεδίων επιβεβαιώνουν την υψηλή ακρίβεια της προτεινόμενης μεθόδου.
περισσότερα
Περίληψη σε άλλη γλώσσα
The present thesis focuses on the detection of outliers in time series, that is, the identification of events or observations that do not conform to an expected pattern relative to the overall dataset. Their timely identification can contribute both to the understanding of the data and to the prediction of future developments. In the first part of the thesis, three new algorithms for outlier detection in univariate time series are proposed, which are based on transforming the data into graphs and studying the angles formed between successive values. The proposed algorithms (Angles_Per, Angles_Lim, and Angles_Graph) were evaluated on synthetic and real datasets, demonstrating high accuracy, a significant reduction in false positive results, and competitive or superior performance compared to existing well-known methods. The application of the proposed methods to human resources data highlights the importance of outlier detection in variables such as employee absences or working hours. D ...
The present thesis focuses on the detection of outliers in time series, that is, the identification of events or observations that do not conform to an expected pattern relative to the overall dataset. Their timely identification can contribute both to the understanding of the data and to the prediction of future developments. In the first part of the thesis, three new algorithms for outlier detection in univariate time series are proposed, which are based on transforming the data into graphs and studying the angles formed between successive values. The proposed algorithms (Angles_Per, Angles_Lim, and Angles_Graph) were evaluated on synthetic and real datasets, demonstrating high accuracy, a significant reduction in false positive results, and competitive or superior performance compared to existing well-known methods. The application of the proposed methods to human resources data highlights the importance of outlier detection in variables such as employee absences or working hours. Detecting such outliers can serve as an indicator of organizational risks, such as burnout or unequal workload distribution, providing an early warning tool for management. In this way, outlier detection is directly linked to the decision-making process. Subsequently, the analysis extends beyond the individual detection of outliers, proposing a methodology for extracting associations between outliers that occur in different time series. The methodology is based on detecting and grouping outliers according to their presence or absence within a time interval and on applying the Apriori algorithm to extract association rules. These rules are utilized to identify connections between time series as well as for the short-term prediction of outliers in a time series. Finally, a methodology for discovering future patterns in time series is proposed, based on the symbolic representation of data. Through the transformation of numerical values and their differences into symbolic sequences, it becomes possible to identify recurring structures, which are then utilized for the prediction of future patterns. The experimental results on real datasets from different domains confirm the high accuracy of the proposed method.
περισσότερα