Στατιστική εκτίμηση γονοτύπων για pipelines Μηχανικής Μάθησης

Genomic Data Imputations for ML pipelines (english)

  1. MSc thesis
  2. ΜΑΡΙΑ ΝΙΚΟΛΟΥΔΑΚΗ
  3. Βιοπληροφορική και Νευροπληροφορική (ΒΝΠ)
  4. 18 July 2026
  5. Ελληνικά
  6. 69
  7. ΧΑΡΙΔΗΜΟΣ ΚΟΝΔΥΛΑΚΗΣ
  8. Φαρμακογονιδιωματική | Στατιστική Εκτίμηση Γονοτύπων | Imputation | Star Allele Calling | Μηχανική Μάθηση
  9. Βιοπληροφορική
  10. 2
  11. 20
    • Η στροφή προς την ιατρική ακριβείας βασίζεται σε μεγάλο βαθμό στην αξιοποίηση
      γονιδιωματικών δεδομένων, τα οποία μας βοηθούν να κατανοήσουμε γιατί κάθε ασθενής
      αντιδρά διαφορετικά στην ίδια φαρμακευτική αγωγή. Ωστόσο, η ανάλυση των
      φαρμακογονιδίων παραμένει μια πρόκληση λόγω της πολυπλοκότητάς τους και των συχνών
      κενών στις διαθέσιμες πληροφορίες. Η παρούσα εργασία αντιμετωπίζει αυτό το ζήτημα
      αναπτύσσοντας ένα pipeline με δεδομένα από τη βάση δεδομένων UK Biobank. Στόχος είναι
      η δημιουργία ενός ολοκληρωμένου πλαισίου για τη μελέτη των γονιδίων που ρυθμίζουν τον
      μεταβολισμό των φαρμάκων.
      Στο πρώτο στάδιο, χρησιμοποιήθηκε το λογισμικό Beagle για την εφαρμογή στατιστικής
      εκτίμησης γονοτύπων (imputation). Η μέθοδος αυτή αποδείχθηκε καθοριστική, καθώς
      επέτρεψε τη συμπλήρωση των κενών στους γενετικούς δείκτες, αναβαθμίζοντας την
      ποιότητα των δεδομένων και διασφαλίζοντας τη συνέχεια της πληροφορίας σε κρίσιμες
      γονιδιακές περιοχές. Στη συνέχεια, έγινε προσδιορισμός των αλληλομόρφων (star allele
      calling) με το εξειδικευμένο εργαλείο Aldy. Η επιλογή του Aldy βασίστηκε στην ικανότητά
      του να επιλύει σύνθετες δομικές παραλλαγές, προσφέροντας έναν ακριβή χαρακτηρισμό των
      φαρμακογονιδίων σύμφωνα με τη διεθνή ονοματολογία.
      Η μελέτη κατέγραψε την κατανομή των κυριότερων διπλοτύπων (Major Diplotypes) για 16
      κλινικά σημαντικά φαρμακογονίδια, προσφέροντας μια λεπτομερή εικόνα της γενετικής
      μεταβλητότητας σε ένα δείγμα 500.000 ατόμων. Μέσα από τη δειγματοληπτική συγκριτική
      αξιολόγηση, διαπιστώθηκε ότι η προηγούμενη χρήση του Beagle βελτίωσε τα ποσοστά
      επιτυχούς προσδιορισμού των αλληλόμορφων και την αξιοπιστία των αποτελεσμάτων του
      Aldy, σε σύγκριση με την ανάλυση των αρχικών, μη επεξεργασμένων δεδομένων.
      Συμπερασματικά, η συνδυαστική αυτή προσέγγιση προσφέρει ένα ισχυρό εργαλείο για την
      εξαγωγή χαρακτηριστικών, το οποίο μπορεί να τροφοδοτήσει μοντέλα μηχανικής μάθησης
      για την πρόβλεψη φαινοτύπων και την ουσιαστική βελτίωση της εξατομικευμένης κλινικής
      φροντίδας.

    • The shift towards personalized medicine relies heavily on the analysis of large-scale genomic
      data, which helps us understand why patients respond differently to the same pharmaceutical
      treatments. However, pharmacogene analysis remains a significant challenge due to their
      inherent structural complexity and the frequent presence of missing information in available
      datasets. This thesis addresses these issues by developing an automated and reliable
      computational pipeline using data from the UK Biobank, aiming to create a comprehensive
      framework for studying genes involved in drug metabolism.
      Firstly,statistical genotype imputation was performed by the Beagle software. This method
      proved to be critical, as it allowed us to fill gaps in genetic markers, thereby upgrading data
      quality and ensuring information continuity across crucial gene regions. Afterwards, we
      proceeded with star allele calling using the specialized tool Aldy. The choice of Aldy was
      based on its unique ability to resolve complex structural variations, offering an accurate
      characterization of pharmacogenes according to international nomenclature.
      The study recorded the distribution of Major Diplotypes for 16 clinically significant
      pharmacogenes, providing a detailed map of genetic variability within a sample of 500,000
      individual sampless. Through comparative evaluation, it was demonstrated that the prior use
      of Beagle improved the calling rates and the overall reliability of Aldy’s results compared to
      analyzing raw, unimputed data. In conclusion, this combined approach offers a powerful tool
      for feature extraction, capable of feeding machine learning models for phenotype prediction
      and substantially improving individualized clinical care

  12. Hellenic Open University
  13. Attribution-NonCommercial-NoDerivatives 4.0 Διεθνές