Περίληψη
Η ραγδαία εξέλιξη των τεχνολογιών υψηλής απόδοσης στην εποχή της γονιδιωματικής έχει οδηγήσειστη δημιουργία και διάθεση τεράστιων όγκων βιολογικών δεδομένων, τα οποία εκτείνονται από μελέτες γονιδιακής έκφρασης, έως συνοπτικά στατιστικά (summary statistics) μεγάλων μελετών γενετικής συσχέτισης (GWAS). Η ουσιαστική αξιοποίηση αυτών των δεδομένων, με στόχο την εξαγωγή έγκυρων και γενικών συμπερασμάτων, προϋποθέτει την ύπαρξη αποδοτικών υπολογιστικών μεθοδολογιών που χαρακτηρίζονται τόσο από ακρίβεια, όσο και ταχύτητα. Παρά τη σημαντική πρόοδο των τελευταίων ετών, εξακολουθεί να παραμένει ένα κενό ανάμεσα στη μεθοδολογική ανάπτυξη και στα πρακτικά εργαλεία που είναι διαθέσιμα στην ερευνητική κοινότητα, ιδίως σε ό,τι αφορά τη μετα-ανάλυση δεδομένων γονιδιακής έκφρασης και μελετών γενετικής συσχέτισης, καθώς και την αξιοποίηση συνοπτικών στατιστικών (summary statistics). H παρούσα διδακτορική διατριβή εντάσσεται στο ευρύτερο πλαίσιο της Βιοπληροφορικής και της Υπολογιστικής Βιολογίας, με κε ...
Η ραγδαία εξέλιξη των τεχνολογιών υψηλής απόδοσης στην εποχή της γονιδιωματικής έχει οδηγήσειστη δημιουργία και διάθεση τεράστιων όγκων βιολογικών δεδομένων, τα οποία εκτείνονται από μελέτες γονιδιακής έκφρασης, έως συνοπτικά στατιστικά (summary statistics) μεγάλων μελετών γενετικής συσχέτισης (GWAS). Η ουσιαστική αξιοποίηση αυτών των δεδομένων, με στόχο την εξαγωγή έγκυρων και γενικών συμπερασμάτων, προϋποθέτει την ύπαρξη αποδοτικών υπολογιστικών μεθοδολογιών που χαρακτηρίζονται τόσο από ακρίβεια, όσο και ταχύτητα. Παρά τη σημαντική πρόοδο των τελευταίων ετών, εξακολουθεί να παραμένει ένα κενό ανάμεσα στη μεθοδολογική ανάπτυξη και στα πρακτικά εργαλεία που είναι διαθέσιμα στην ερευνητική κοινότητα, ιδίως σε ό,τι αφορά τη μετα-ανάλυση δεδομένων γονιδιακής έκφρασης και μελετών γενετικής συσχέτισης, καθώς και την αξιοποίηση συνοπτικών στατιστικών (summary statistics). H παρούσα διδακτορική διατριβή εντάσσεται στο ευρύτερο πλαίσιο της Βιοπληροφορικής και της Υπολογιστικής Βιολογίας, με κεντρικό άξονα την ανάπτυξη και υλοποίηση υπολογιστικών μεθόδων για την ανάλυση και τη μετα-ανάλυση δεδομένων γονιδιακής έκφρασης και μελετών γενετικής συσχέτισης. Αφετηρία της διατριβής υπήρξε η διαπίστωση ότι παρότι υπάρχουν πολυάριθμα λογισμικά εργαλεία, απουσιάζουν ολοκληρωμένα μεθοδολογικά πλαίσια που να επιτρέπουν την ευέλικτη εφαρμογή τόσο κλασικών όσο και πιο σύγχρονων προσεγγίσεων ανάλυσης, με τρόπο που να είναι ταυτόχρονα υπολογιστικά αποδοτικός και προσαρμόσιμος στις ιδιαιτερότητες των δεδομένων. Κεντρικός στόχος της διατριβής είναι η κάλυψη αυτού του κενού μέσω της ανάπτυξης νέων αλγορίθμων και λογισμικών για τη μετα-ανάλυση τόσο δεδομένων γονιδιακής έκφρασης όσο και μελετών γενετικής συσχέτισης, με ιδιαίτερη έμφαση στην αξιοποίηση των συνοπτικών στατιστικών. Ιδιαίτερη βαρύτητα δίνεται στην ενσωμάτωση μεθόδων που παρά τη θεωρητική τους αξία, δεν είχαν μέχρι σήμερα βρει ευρεία εφαρμογή σε υπάρχοντα εργαλεία, όπως είναι οι Μπεϋζιανές προσεγγίσεις μετα-ανάλυσης, αλλά και στην υποστήριξη πολλαπλών σεναρίων ανάλυσης, που αντικατοπτρίζουν τις συνθήκες ετερογένειας και πολυπλοκότητας των δεδομένων. Παράλληλα, η διατριβή προσεγγίζει το ζήτημα της αναπλήρωσης μη-γονοτυπημένων πολυμορφισμών σε συνοπτικά στατιστικά (summarystatistics imputation), λαμβάνοντας υπόψη την πληροφορία της ανισορροπίας σύνδεσης από πολλαπλά reference panels, με στόχο τη βελτίωση της κάλυψης και της αξιοπιστίας των συμπερασμάτων. Πέρα από τη θεμελίωση ενός ολοκληρωμένου μεθοδολογικού πλαισίου, ένας εξίσου σημαντικός στόχος είναι η αλγοριθμική βελτιστοποίηση των προτεινόμενων προσεγγίσεων. Η ανάγκη αυτή προκύπτει από το γεγονός ότι τα σύγχρονα δεδομένα, είτε πρόκειται για μεγάλα consortia με εκατοντάδες χιλιάδες συμμετέχοντες σε μελέτες γενετικής συσχέτισης, είτε για εκτεταμένα σύνολα δεδομένων γονιδιακής έκφρασης, καθιστούν τις παραδοσιακές υλοποιήσεις μεθόδων περιορισμένες στην εφαρμογή τους. Η διατριβή, επομένως, εστιάζει και στην επιτάχυνση των διαδικασιών μετα-ανάλυσης αναπλήρωσης μη-γονοτυπημένων πολυμορφισμών, ώστε αυτές να μπορούν να εκτελεστούνσε εύλογους χρόνους σε σύγχρονα υπολογιστικά περιβάλλοντα, καθώς και στην αύξηση της ακρίβειαςτων στατιστικών εκτιμήσεων υπό ρεαλιστικές συνθήκες ετερογένειας και σε σενάρια πολυμεταβλητής ανάλυσης.Μια σημαντική πτυχή της παρούσας εργασίας αποτελεί και η προσβασιμότητα των μεθόδων στην ερευνητική κοινότητα. Από τα πρώτα στάδια της διατριβής, κατέστη σαφές ότι η χρησιμότητα μιας μεθοδολογικής συνεισφοράς κρίνεται όχι μόνο από την καινοτομία ή την ακρίβειά της, αλλά και από τον βαθμό στον οποίο μπορεί να εφαρμοστεί από την ερευνητική κοινότητα. Για τον λόγο αυτό, οι προτεινόμενες μέθοδοι υλοποιούνται ως λογισμικά ανοικτού κώδικα (open-source), διαθέσιμα μέσω της πλατφόρμας του GitHub σε αποθετήρια. Ακόμη, τα εργαλεία που συνοδεύουν την παρούσα διατριβή είναι διαθέσιμα και ως διαδικτυακές εφαρμογές (web servers) που επιτρέπουν τη χρήση των μεθόδων ακόμη και από ερευνητές ανεξαρτήτως προγραμματιστικής εμπειρίας. Εν κατακλείδι, η παρούσα διδακτορική διατριβή εκπληρώνει τον στόχο της μέσω της ανάπτυξης και διάθεσης πέντε (5) εξειδικευμένων υπολογιστικών μεθόδων για την ανάλυση μελετών γενετικής συσχέτισης και μελετών γονιδιακής έκφρασης. Με τα εργαλεία αυτά, η εργασία αυτή επιδιώκει να συμβάλει στην αποτελεσματικότερη αξιοποίηση των μοριακών δεδομένων, προωθώντας πιο αξιόπιστες και αποδοτικές αναλύσεις στο πεδίο της σύγχρονης βιοϊατρικής έρευνας.
περισσότερα
Περίληψη σε άλλη γλώσσα
The rapid advancement of high-throughput technologies in the genomics era has driven the generation and availability of vast volumes of biological data, ranging from gene expression studies to summary statistics from large-scale Genome-Wide Association Studies (GWAS). The effective utilization of this data to derive valid and generalizable conclusions requires efficient computational methodologies characterized by both accuracy and speed. Despite significant progress in recent years, a gap between methodological development and the practical tools available to the research community remains, particularly regarding the meta-analysis of gene expression data and genetic association studies, as well as the utilization of summary statistics. The present PhD thesis falls within the broader framework of Bioinformatics and Computational Biology, focusing on the development and implementation of computational methods for the analysis and meta-analysis of gene expression data and GWAS. The thesi ...
The rapid advancement of high-throughput technologies in the genomics era has driven the generation and availability of vast volumes of biological data, ranging from gene expression studies to summary statistics from large-scale Genome-Wide Association Studies (GWAS). The effective utilization of this data to derive valid and generalizable conclusions requires efficient computational methodologies characterized by both accuracy and speed. Despite significant progress in recent years, a gap between methodological development and the practical tools available to the research community remains, particularly regarding the meta-analysis of gene expression data and genetic association studies, as well as the utilization of summary statistics. The present PhD thesis falls within the broader framework of Bioinformatics and Computational Biology, focusing on the development and implementation of computational methods for the analysis and meta-analysis of gene expression data and GWAS. The thesis was motivated by the observation that, while numerous software tools exist, there remains a lack of comprehensive methodological frameworks that allow researchers to flexibly apply both traditional and modern approaches in a computationally efficient manner, while adapting them to the specific characteristics of each dataset.Primarily, this thesis aims to bridge this gap through the development of new algorithms and software for the meta-analysis of both gene expression data and genome wide association studies, with particular emphasis on leveraging summary statistics. Significant weight is placed on integrating methods that, despite their theoretical value, have not yet found widespread application in existing tools, such as Bayesian meta-analysis approaches. It also focuses on supporting multiple analysis scenarios that reflect the heterogeneity and complexity of the data. In parallel, the thesis addresses the issue of summary statistics imputation, explicitly accounting for linkage disequilibrium information from multiple reference panels, aiming to improve coverage and the reliability of conclusions. Beyond establishing a comprehensive methodological framework, an equally important objective is the algorithmic optimization of the proposed approaches. This need arises from the fact that modern data, whether from large consortia with hundreds of thousands of participants in genome wide association studies or extensive gene expression datasets, renders traditional method implementations limited in their application. Therefore, the thesis also focuses on accelerating metaanalysis and imputation processes so they can be executed within reasonable timeframes in modern computational environments, as well as on increasing the precision of statistical estimates underrealistic conditions of heterogeneity and in multivariate analysis scenarios. Another aspect of this work is these methods’ accessibility to the research community. From the early stages of the thesis, it became clear that the utility of a methodological contribution is judged not only by its innovation or accuracy but also by the extent to which it can be applied by the community. For this reason, the proposed methods are implemented as open-source software, available via repositories on the GitHub platform. Furthermore, the tools accompanying this thesis are also available as web applications (web servers), enabling the use of these methods by researchers regardless of their programming experience. In conclusion, the present doctoral dissertation fulfills its objective through the development and dissemination of five (5) specialized computational methods for the analysis of gene expression studies and genome-wide association studies. By developing these tools, this work seeks to contribute to the more effective utilization of molecular data, promoting more reliable and efficient analyses in the field of modern biomedical research.
περισσότερα