- MSc thesis
- Μεταπτυχιακή Εξειδίκευση στα Πληροφοριακά Συστήματα (ΠΛΣ)
- 26 Σεπτεμβρίου 2026
- Ελληνικά
- 156
- ΓΕΩΡΓΙΟΣ ΜΑΥΡΟΜΜΑΤΗΣ
- ΑΝΔΡΕΑΣ ΚΑΝΑΒΟΣ | ΜΟΥΤΑΦΗΣ ΠΑΝΑΓΙΩΤΗΣ
- Εξαγωγή λέξεων φράσεων κλειδιών, Ανάκτηση πληροφορίας, Επεξεργασία φυσικής γλώσσας, TΕXTRANK, KEYBERT, Μη επιβλεπόμενη μάθηση
- ΤΕΧΝΗΤΗ ΝΟΗΜΟΣΥΝΗ
- 15
- 33
- Περιέχει πίνακες διαγράμματα αποσπάσματα κώδικα
-
-
Στην παρούσα διπλωματική εργασία συγκρίθηκαν και αξιολογήθηκαν αλγόριθμοι μη
επιβλεπόμενης μάθησης για την εξαγωγή λέξεων-φράσεων κλειδιών από επιστημονικά
άρθρα γραμμένα στην αγγλική γλώσσα με σκοπό να χρησιμοποιηθούν σε εφαρμογές
ανάκτησης πληροφορίας. Οι αλγόριθμοι που εξετάστηκαν ήταν οι TF-IDF, TEXTRANK,
RAKE, YAKE και KEYBERT. Επίσης εξετάστηκε και μια παραλλαγή του TF-IDF, ο
αλγόριθμος ΤF-ISF.
Οι αλγόριθμοι εφαρμόστηκαν με stemming και χωρίς stemming και για αριθμό n-
grams. Mέσω της χρήσης συλλογών κατάλληλων δεδομένων (δημοσιευμένα άρθρα) οι
παραπάνω αλγόριθμοι αξιολογήθηκαν αρχικά στο να κατατάσσουν υψηλότερα τις λέξεις
κλειδιά του συγγραφέα ενός άρθρου με τη χρήση των μετρικών P@k, R@k, MAP, MRR και
nDCG και ακολούθως στο να προβλέπουν το περιοδικό και το επιστημονικό πεδίο του
περιοδικού που ένα συγκεκριμένο άρθρο είναι δημοσιευμένο, με τη χρήση της μετρικής
MRR.
Ως προς την πρόβλεψη των λέξεων κλειδιών του συγγραφέα την καλύτερη επίδοση
την είχε ο TEXTRANK, αν και όλοι οι αλγόριθμοι κατάφεραν να κατατάξουν το 70% και
το 100% των λέξεων φράσεων κλειδιών του συγγραφέα σε θέσεις που αντιστοιχούν στο
10% και 60% των πιο αντιπροσωπευτικών όρων αντίστοιχα. To stemming ή ο αριθμός n-
grams δεν επηρέασε τα αποτελέσματα των μετρικών.
Ως προς την πρόβλεψη του επιστημονικού περιοδικού που είναι δημοσιευμένο ένα
άρθρο ο KEYBERT είχε μια υπεροχή σε σχέση με τους υπόλοιπους αλγορίθμους καθώς
προέβλεψε το περιοδικό στην 9η θέση κατά μέσο όρο σε αντίθεση με τους υπόλοιπους
αλγόριθμους που κατέτασσαν το περιοδικό μεταξύ 10ης και 37ης θέσης. Ωστόσο ο
KEYBERT ήταν ο πλέον αργός αλγόριθμος. Αναφορικά με τον αλγόριθμο TF-ISF έδωσε
παρόμοια αποτελέσματα με τον TF-IDF αλλά σε πολύ χαμηλότερο χρόνο εκτέλεσης.
Ακολούθως έλαβε χώρα ανάπτυξη μιας εφαρμογής συστάσεων περιοδικών προς
δημοσίευση η οποία παραμετροποιήθηκε έτσι ώστε να λειτουργεί με οποιοδήποτε από τους
παραπάνω αλγόριθμους με stemming ή χωρίς stemming και για οποιοδήποτε αριθμό n-
grams. H εφαρμογή αναπτύχθηκε σε γλώσσα προγραμματισμού Python στο framework
streamlit.
-
In the present thesis, unsupervised algorithms for extracting keyphrases from scientific articles written in English were compared and evaluated, with the aim of applying them to information retrieval systems. The algorithms examined include TF-IDF, TEXTRANK, RAKE, YAKE, and KEYBERT. In addition, a variation of TF-IDF, namely TF-ISF, was also investigated.
The algorithms were applied both with and without stemming, and for different n-gram configurations. Using appropriate datasets consisting of published scientific articles, the algorithms were initially evaluated based on their ability to rank the authors’ keywords of each article higher. The evaluation metrics used, were P@k, R@k, MAP, MRR and nDCG. Subsequently, the performance of the algorithms was assessed in predicting the journal and the scientific field in which a given article was published, by using the MRR metric. Regarding the prediction of authors’ keywords, TEXTRANK achieved the best performance. However, all algorithms managed to rank approximately 70% and 100% of the authors’ keyphrases within the top 10% and 60% of the most representative terms, respectively. The use of stemming and the choice of n-gram size did not significantly affectthe evaluation metrics. In terms of predicting the journal in which an article was published, KEYBERT outperformed the other algorithms, ranking the correct journal at an average position of 9th, compared to the other algorithms, which ranked it between the 10th and 37th positions. All algorithms however, managed to predict the field of science of the suggested journal within the top two ranking positions. KEYBERT was the slowest algorithm in terms of execution time. As for TF-ISF, it produced results comparable to TF-IDF but with significantly lower computational cost. Finally, a journal recommendation system was developed in Python Streamlit framework, which was parameterized to operate with any of the aforementioned algorithms, with or without stemming, and for any n-gram configuration
-
- Hellenic Open University
- Attribution-NonCommercial-NoDerivatives 4.0 Διεθνές
Σύγκριση Αλγορίθμων Μη Επιβλεπόμενης Μάθησης για Εξαγωγή Λέξεων-Κλειδιών και Ανάπτυξη Πιλοτικής Εφαρμογής Σύστασης Περιοδικών
Comparative assessment of unsupervised keyword extraction algorithms and development of a pilot application for recommending publication journals (Αγγλική)
Κύρια Αρχεία Διατριβής
VVagias_MscThesis_JUNE_26.pdf
Περιγραφή: VVagias_MscThesis_JUNE_26.pdf (pdf) Book Reader
Μέγεθος: 7.1 MB

