Περίληψη
Η εκθετική ανάπτυξη των μέσων κοινωνικής δικτύωσης έχει οδηγήσει στη δημιουργία ενός πρωτοφανούς όγκου αδόμητου, παραγόμενου από χρήστες περιεχομένου — ανεπίσημου, θορυβώδους και πλούσιου σε αργκό, συντομογραφίες, εικονίδια (emoji) και αποσπασματικές διατυπώσεις. Η εξαγωγή σημαντικής πληροφορίας από το εν λόγω περιεχόμενο σε μεγάλη κλίμακα αποτελεί μείζον τεχνολογικό πρόβλημα. Τα υφιστάμενα συστήματα αυτόματης περίληψης έχουν σχεδιαστεί κατά κύριο λόγο για επίσημα κείμενα — όπως ειδησεογραφικά άρθρα, επιστημονικές εργασίες και νομικά έγγραφα — και αδυνατούν να διαχειριστούν τις γλωσσικές ανωμαλίες, την πλεοναστικότητα και τα ειδικά χαρακτηριστικά των πλατφορμών κοινωνικής δικτύωσης. Παράλληλα, δεν υπήρχε μέχρι σήμερα σύστημα εξειδικευμένο στη δημιουργία περιλήψεων από σύνολα σχολίων χρηστών σε αναρτήσεις κοινωνικής δικτύωσης — δηλαδή το πλήθος απαντήσεων και αντιδράσεων που συσσωρεύονται υπό μία ανάρτηση — σε αντίθεση με την περίληψη μεμονωμένων αναρτήσεων ή ειδησεογραφικών άρθρων. Το ...
Η εκθετική ανάπτυξη των μέσων κοινωνικής δικτύωσης έχει οδηγήσει στη δημιουργία ενός πρωτοφανούς όγκου αδόμητου, παραγόμενου από χρήστες περιεχομένου — ανεπίσημου, θορυβώδους και πλούσιου σε αργκό, συντομογραφίες, εικονίδια (emoji) και αποσπασματικές διατυπώσεις. Η εξαγωγή σημαντικής πληροφορίας από το εν λόγω περιεχόμενο σε μεγάλη κλίμακα αποτελεί μείζον τεχνολογικό πρόβλημα. Τα υφιστάμενα συστήματα αυτόματης περίληψης έχουν σχεδιαστεί κατά κύριο λόγο για επίσημα κείμενα — όπως ειδησεογραφικά άρθρα, επιστημονικές εργασίες και νομικά έγγραφα — και αδυνατούν να διαχειριστούν τις γλωσσικές ανωμαλίες, την πλεοναστικότητα και τα ειδικά χαρακτηριστικά των πλατφορμών κοινωνικής δικτύωσης. Παράλληλα, δεν υπήρχε μέχρι σήμερα σύστημα εξειδικευμένο στη δημιουργία περιλήψεων από σύνολα σχολίων χρηστών σε αναρτήσεις κοινωνικής δικτύωσης — δηλαδή το πλήθος απαντήσεων και αντιδράσεων που συσσωρεύονται υπό μία ανάρτηση — σε αντίθεση με την περίληψη μεμονωμένων αναρτήσεων ή ειδησεογραφικών άρθρων. Το ανωτέρω κενό αποτελεί τόσο το ερευνητικό πρόβλημα όσο και την πρωταρχική κινητήρια δύναμη της παρούσας διδακτορικής διατριβής. Στόχος της παρούσας μελέτης είναι ο σχεδιασμός, η υλοποίηση και η αξιολόγηση του πρώτου εξειδικευμένου συστήματος αφαιρετικής περίληψης συνόλων σχολίων από μέσα κοινωνικής δικτύωσης. Το σύστημα αποσκοπεί στο να είναι ανθεκτικό στον θόρυβο των μέσων κοινωνικής δικτύωσης, υπολογιστικά αποδοτικό για πραγματικές εφαρμογές και ικανό να παράγει περιλήψεις που είναι συνεκτικές, περιεκτικές και σημασιολογικά πιστές ως προς τις πηγαίες συζητήσεις. Δευτερεύων στόχος αποτελεί η θεμελίωση ενός πολυδιάστατου πλαισίου αξιολόγησης που υπερβαίνει τις παραδοσιακές λεξιλογικές μετρικές και αποτυπώνει το πλήρες προφίλ ποιότητας των παραγόμενων περιλήψεων. Το προτεινόμενο σύστημα βασίζεται στην αρχιτεκτονική Text-to-Text Transfer Transformer (T5), και συγκεκριμένα στην παραλλαγή T5-Small (76,9 εκατομμύρια παράμετροι), η οποία επιλέχθηκε ώστε να επιτευχθεί βέλτιστη ισορροπία μεταξύ απόδοσης και υπολογιστικής εφικτότητας. Η μεθοδολογία περιλαμβάνει τέσσερις κύριες συνιστώσες. Πρώτον, αναπτύχθηκε εξειδικευμένη αγωγός προεπεξεργασίας (domain-specific pre-processing pipeline) για την κανονικοποίηση του θορύβου των κοινωνικών μέσων, η οποία περιλαμβάνει μετατροπή emoji σε κείμενο, κατάτμηση hashtag, κανονικοποίηση επαναλαμβανόμενων χαρακτήρων και δομημένη τοκενοποίηση νημάτων σχολίων μέσω ειδικών διαχωριστικών συμβόλων ([COMMENT], [REPLY]). Δεύτερον, εισήχθησαν τρεις στοχευμένες αρχιτεκτονικές βελτιώσεις στο βασικό μοντέλο T5: (i) ένας μηχανισμός προσαρμοστικής κλιμάκωσης προσοχής (adaptive attention scaling), ο οποίος ρυθμίζει τη θερμοκρασία προσοχής βάσει του μήκους της ακολουθίας, αποτρέποντας την υπέρμετρη διασπορά της προσοχής σε σύντομες αναρτήσεις· (ii) μια μάσκα προσοχής ανθεκτική στον θόρυβο (noise-aware attention mask), η οποία καταστέλλει διακριτικά (tokens) υψηλής εντροπίας — όπως επαναλαμβανόμενα σημεία στίξης και ακολουθίες hashtag — από την επίδρασή τους στα βάρη προσοχής· και (iii) ένα σχήμα κωδικοποίησης θέσης ευαίσθητο στο συγκείμενο (context-aware positional encoding) με εκπαιδεύσιμη παράμετρο συχνότητας τ, το οποίο μειώνει την ευαισθησία θέσης για περιεχόμενο πλούσιο σε hashtag και ανεξάρτητο διάταξης. Τρίτον, ο στόχος εκπαίδευσης εμπλουτίστηκε με έναν όρο κάλυψης απωλειών (coverage loss term), με σκοπό την τιμωρία της επαναλαμβανόμενης προσοχής σε ήδη περιληφθείσες περιοχές εισόδου, αντιμετωπίζοντας άμεσα την πλεοναστικότητα που χαρακτηρίζει τα σύνολα σχολίων κοινωνικής δικτύωσης. Τέταρτον, το μοντέλο υποβλήθηκε σε λεπτορύθμιση (fine-tuning) σε ειδικά κατασκευασμένο σύνολο δεδομένων 15.000 ζευγών ανάρτησης–συνόλου σχολίων από το Facebook (12.000 εκπαίδευσης / 1.500 επικύρωσης / 1.500 ελέγχου), εμπλουτισμένο με περιλήψεις αναφοράς γραμμένες από ανθρώπους, με συμφωνία μεταξύ αξιολογητών κ = 0,78 (kappa Fleiss). Τα πειραματικά αποτελέσματα καταδεικνύουν ότι το προτεινόμενο μοντέλο επιτυγχάνει υψηλή απόδοση βάσει μετρικών αναφοράς. Στο τελικό σύνολο ελέγχου (Πείραμα 3, T5-Small), το μοντέλο επιτυγχάνει ROUGE-1 F1 = 0,3292, ROUGE-L F1 = 0,1841 και ROUGE-Lsum F1 = 0,1835. Οι τιμές αυτές αντικατοπτρίζουν την εγγενή δυσκολία της περίληψης περιεχομένου κοινωνικής δικτύωσης — όπου το ανεπίσημο και αποσπασματικό κείμενο πηγής περιορίζει την επικάλυψη n-gram με επίσημες περιλήψεις αναφοράς — και είναι συνεπείς με τα αποτελέσματα της σύγχρονης βιβλιογραφίας σε συγκρίσιμα έργα. Σε άμεση σύγκριση με το ChatGPT 4.0 στο ίδιο σύνολο δεδομένων, το προτεινόμενο μοντέλο επιτυγχάνει ανώτερα αποτελέσματα F1 σε όλες τις παραλλαγές ROUGE (ROUGE-1: 0,3292 έναντι 0,2739· ROUGE-L: 0,1841 έναντι 0,1528), αντανακλώντας υψηλότερη ακρίβεια (precision) (0,3921 έναντι 0,2557 για ROUGE-1), παρά το γεγονός ότι το ChatGPT 4.0 επιτυγχάνει υψηλότερη ανάκληση (recall). Το πλεονέκτημα αυτό στην ακρίβεια — βελτίωση κατά 20,5% στο ROUGE-L — υποδηλώνει ότι το προτεινόμενο μοντέλο παράγει πιο εστιασμένες περιλήψεις με λιγότερα άσχετα διακριτικά. Το πολυδιάστατο πλαίσιο αξιολόγησης επιβεβαιώνει την υπεροχή του μοντέλου σε ευρύτερο φάσμα ποιοτικών κριτηρίων. Στις μετρικές χωρίς αναφορά (reference-free), το προτεινόμενο μοντέλο υπερτερεί του ChatGPT 4.0 ως προς την Συνέπεια Shannon (0,9512 έναντι 0,9447), τη Συνοχή Shannon (0,9519 έναντι 0,9471), τον Δείκτη Σημασιολογικής Απόκλισης SDC (0,5746 έναντι 0,2646 — βελτίωση 117% στη σημασιολογική ποικιλομορφία) και το SUPERT (0,9990 έναντι 0,9977). Στις ανθρωποκεντρικές μετρικές, η Συνέπεια (Consistency) ανέρχεται σε 0,5627 (έναντι 0,2490 για το ChatGPT 4.0, βελτίωση 126%), η Λεξιλογική Ποικιλότητα σε 0,7787 (έναντι 0,6927), και το ROUGE-WE (σημασιολογική επικάλυψη με χρήση ενσωματώσεων λέξεων) σε 0,9568 έναντι 0,9495. Τα αποτελέσματα αυτά είναι στατιστικά σημαντικά (paired t-test, p < 0,01) και επιβεβαιώνουν ότι η εξειδικευμένη λεπτορύθμιση ενός συμπαγούς μοντέλου κωδικοποιητή-αποκωδικοποιητή αποδίδει ανώτερη τομεακή επίδοση έναντι ενός γενικής χρήσης μεγάλου γλωσσικού μοντέλου με άνω του 1 τρισεκατομμυρίου παραμέτρων. Οι κύριες συνεισφορές της παρούσας έρευνας συνοψίζονται ως εξής. (i) Πρωτοτυπία συστήματος: Σχεδιάστηκε και αναπτύχθηκε το πρώτο εξειδικευμένο σύστημα αφαιρετικής περίληψης συνόλων σχολίων κοινωνικής δικτύωσης, αξιολογημένο σε 15.000 ζεύγη ανάρτησης–σχολίων από το Facebook. (ii) Αρχιτεκτονικές καινοτομίες: Εισήχθησαν τρεις νέες βελτιώσεις στους μηχανισμούς προσοχής και κωδικοποίησης θέσης του μετασχηματιστή, καθεμία εκ των οποίων υποκινείται από τις ιδιότητες του κειμένου κοινωνικής δικτύωσης και επικυρώνεται με ποσοτικά στοιχεία αφαιρετικής ανάλυσης (ablation). (iii) Στόχος εκπαίδευσης εμπλουτισμένος με κάλυψη: Διαμορφώθηκε συνάρτηση απωλειών κάλυψης που μειώνει άμεσα την πλεοναστικότητα στις παραγόμενες περιλήψεις και βελτιώνει τους δείκτες συνέπειας κατά 126% σε σχέση με το ChatGPT 4.0. (iv) Πολυδιάστατο πλαίσιο αξιολόγησης: Αναπτύχθηκε μεθοδολογία αξιολόγησης που συνδυάζει ROUGE, ROUGE-WE, SUPERT, μετρικές εντροπίας Shannon, SDC και έξι ανθρωποκεντρικά κριτήρια (συνέπεια, συνοχή, σημασιολογική συνοχή, λεξιλογική ποικιλότητα, ευχέρεια και αναγνωσιμότητα), παρέχοντας επαναχρησιμοποιήσιμο πρότυπο αξιολόγησης για την περίληψη περιεχομένου κοινωνικής δικτύωσης. (v) Εμπειρική απόδειξη αποδοτικότητας τομεακής προσαρμογής: Αποδείχθηκε ότι ένα λεπτορυθμισμένο μοντέλο 76,9 εκατομμυρίων παραμέτρων υπερτερεί έναντι ενός γενικής χρήσης μοντέλου 1 τρισεκατομμυρίου παραμέτρων (ChatGPT 4.0) σε εξειδικευμένο έργο, με πρακτικές συνέπειες για την οικονομικά αποδοτική ανάπτυξη συστημάτων περίληψης.
περισσότερα
Περίληψη σε άλλη γλώσσα
The exponential growth of social media has produced an unprecedented volume of unstructured, user-generated content—informal, noisy, and rich in slang, abbreviations, emojis, and fragmented discourse. Extracting meaningful information from this content at scale is a critical challenge. Existing automatic summarization systems are primarily designed for formal text (news articles, academic papers, legal documents) and fail to handle the linguistic irregularities, redundancy, and platform-specific features that characterize social media interactions. At the same time, no purpose-built system existed for summarizing collections of user comments on social media posts—specifically the pool of replies and reactions that accumulate under a single post—as opposed to summarizing individual posts or news articles. This gap constitutes both the research problem and the primary motivation of the present thesis.The objective of this study is to design, implement, and evaluate the first dedicated sy ...
The exponential growth of social media has produced an unprecedented volume of unstructured, user-generated content—informal, noisy, and rich in slang, abbreviations, emojis, and fragmented discourse. Extracting meaningful information from this content at scale is a critical challenge. Existing automatic summarization systems are primarily designed for formal text (news articles, academic papers, legal documents) and fail to handle the linguistic irregularities, redundancy, and platform-specific features that characterize social media interactions. At the same time, no purpose-built system existed for summarizing collections of user comments on social media posts—specifically the pool of replies and reactions that accumulate under a single post—as opposed to summarizing individual posts or news articles. This gap constitutes both the research problem and the primary motivation of the present thesis.The objective of this study is to design, implement, and evaluate the first dedicated system for abstractive summarization of social media comment pools. The system is intended to be robust to social media noise, computationally efficient for real-world deployment, and capable of generating summaries that are coherent, concise, and semantically faithful to the source discussions. A secondary objective is to establish a multidimensional evaluation framework that goes beyond traditional lexical metrics and captures the full quality profile of generated summaries.The proposed system is built upon the Text-to-Text Transfer Transformer (T5) architecture, specifically the T5-Small variant (76.9 million parameters), selected to balance performance with computational feasibility. The methodology encompasses four principal components. First, a domain-specific pre-processing pipeline was developed to normalize social media noise, including emoji-to-text conversion, hashtag segmentation, repeated-character normalization, and structured comment-thread tokenization using separator tokens ([COMMENT], [REPLY]). Second, three targeted architectural enhancements were introduced to the standard T5 model: (i) an adaptive attention scaling mechanism that adjusts attention temperature based on sequence length to prevent over-dispersion on short posts; (ii) a noise-aware attention mask that suppresses high-entropy tokens (e.g., repeated punctuation, hashtag strings) from influencing attention weights; and (iii) a context-aware positional encoding scheme with a trainable frequency parameter τ that reduces positional sensitivity for hashtag-heavy, order-independent content. Third, the training objective was augmented with a coverage loss term to penalize repeated attention to already-summarized input regions, directly addressing the redundancy typical of social media comment pools. Fourth, the model was fine-tuned on a purpose-built dataset of 15,000 Facebook post–comment pool pairs (12,000 training / 1,500 validation / 1,500 test), annotated with human-written reference summaries achieving an inter-annotator agreement of κ = 0.78 (Fleiss' kappa).Experimental results demonstrate that the proposed model achieves strong performance. On the final test set (Experiment 3, T5-Small), the model attains ROUGE-1 F1 = 0.3292, ROUGE-L F1 = 0.1841, and ROUGE-Lsum F1 = 0.1835. These scores reflect the inherent difficulty of social media summarization—where informal, fragmented source text limits n-gram overlap with formal reference summaries—and are consistent with state-of-the-art results reported in comparable tasks. In a direct comparison with ChatGPT 4.0 on the same dataset, the proposed model achieves superior F1 scores across all ROUGE variants (ROUGE-1: 0.3292 vs. 0.2739; ROUGE-L: 0.1841 vs. 0.1528), reflecting higher precision (0.3921 vs. 0.2557 for ROUGE-1) despite ChatGPT 4.0 achieving higher recall. This precision advantage—20.5% improvement in ROUGE-L—indicates that the proposed model generates more focused summaries with fewer extraneous tokens. The multidimensional evaluation framework confirms the model's superiority across a broader quality profile. On reference-free metrics, the proposed model outperforms ChatGPT 4.0 on Shannon Consistency (0.9512 vs. 0.9447), Shannon Coherence (0.9519 vs. 0.9471), SDC (0.5746 vs. 0.2646—a 117% improvement in semantic diversity capture), and SUPERT (0.9990 vs. 0.9977). On human-shaped metrics, Consistency reaches 0.5627 (vs. 0.2490 for ChatGPT 4.0, a 126% improvement), Lexical Diversity scores 0.7787 (vs. 0.6927), and ROUGE-WE (semantic word-embedding overlap) reaches 0.9568 vs. 0.9495. These results are statistically significant (paired t-test, p < 0.01) and confirm that task-specific fine-tuning of a compact encoder-decoder model yields superior domain performance over a general-purpose large language model with over 1 trillion parameters. The principal contributions of this research are as follows. (i) System novelty: The first purpose-built abstractive summarization system for social media comment pools, demonstrated on Facebook data across 15,000 post-comment pairs. (ii) Architectural innovations: Three novel enhancements to the transformer attention and positional encoding mechanisms, each specifically motivated by the properties of social media text and each validated with quantitative ablation evidence. (iii) A coverage-augmented training objective: A coverage loss formulation that directly reduces redundancy in generated summaries and improves consistency scores by 126% relative to ChatGPT 4.0. (iv) A multidimensional evaluation framework: An evaluation methodology combining ROUGE, ROUGE-WE, SUPERT, Shannon entropy metrics, SDC, and six human-shaped criteria (consistency, coherence, semantic coherence, lexical diversity, fluency, and readability), providing a reusable evaluation standard for social media summarization. (v) Empirical evidence of domain-adapted efficiency: Demonstration that a 76.9M-parameter fine-tuned model outperforms a 1T-parameter general-purpose model (ChatGPT 4.0) on a specialized task, with practical implications for cost-effective deployment of summarization systems.
περισσότερα