Σχεδιασμός και Υλοποίηση εξειδικευμένου chatbot για διαδικτυακές πλατφόρμες
58
πρότασης όμως γίνεται ασταθές, και επειδή κοιτάζει μόνο την ακρίβεια, αγνοεί αν η παραγωγή
παρέλειψε μέρος του περιεχομένου της αναφοράς.
Δύο χρόνια αργότερα προτάθηκε το ROUGE [17], που ακολουθεί την αντίστροφη λογική
και δίνει βάρος στην ανάκληση αντί στην ακρίβεια. Αυτό ταιριάζει με την περίληψη, όπου το
ζητούμενο δεν είναι τόσο αν κάθε λέξη της παραγωγής υπάρχει στην αναφορά, αλλά αν η
παραγωγή κατάφερε να καλύψει το περιεχόμενο που έπρεπε. Το ROUGE-N μετράει πόσα n-
γράμματα του κειμένου αναφοράς βρέθηκαν στην παραγωγή, ενώ το ROUGE-L κοιτάζει τη
μακρύτερη κοινή υπακολουθία, ανταμείβοντας τη σωστή σειρά των λέξεων χωρίς να απαιτεί
να είναι συνεχόμενες. Υπάρχουν και παραλλαγές που εξετάζουν ζευγάρια λέξεων με κενά
ανάμεσά τους ή που συνδυάζουν ακρίβεια και ανάκληση σε ένα ενιαίο σκορ. Παρά τις
βελτιώσεις, το ROUGE παραμένει ίδιο στη φύση του με το BLEU, αφού συνεχίζει να μετράει
επιφανειακή επικάλυψη λέξεων και αδυνατεί να αναγνωρίσει ότι δύο διαφορετικές
διατυπώσεις λένε το ίδιο πράγμα.
Λίγο αργότερα εμφανίστηκε το METEOR [2], που προσπάθησε να σπάσει αυτόν τον
περιορισμό φέρνοντας στη σύγκριση και τη σημασία των λέξεων. Αντί να μετρήσει απλώς
κοινά n-γράμματα, χτίζει πρώτα μια αντιστοίχιση ανάμεσα στις λέξεις της παραγωγής και της
αναφοράς, και μάλιστα σε στάδια: ξεκινά από τις ακριβείς ταυτίσεις, στη συνέχεια δέχεται
λέξεις με κοινή ρίζα, και τέλος αναγνωρίζει συνώνυμα και γνωστές παραφράσεις με τη βοήθεια
λεξιλογικών πόρων. Πάνω σε αυτή την αντιστοίχιση υπολογίζει μαζί ακρίβεια και ανάκληση,
και προσθέτει μια ποινή όταν οι αντιστοιχισμένες λέξεις είναι σκόρπιες αντί για συνεχόμενες,
ώστε να τιμωρεί την κακή σειρά. Η σχεδίαση αυτή δίνει στο METEOR καλύτερη συμφωνία με
την ανθρώπινη κρίση σε επίπεδο πρότασης. Η αδυναμία του είναι ότι η αναγνώριση ριζών και
συνωνύμων στηρίζεται σε γλωσσικούς πόρους που είναι πλούσιοι κυρίως για τα αγγλικά. Για
τα ελληνικά οι αντίστοιχοι πόροι είναι φτωχότεροι, οπότε η θεωρητική ανθεκτικότητα του