Σχεδιασμός και Υλοποίηση εξειδικευμένου chatbot για διαδικτυακές πλατφόρμες
99
6.2.3 Αυτόματες μετρικές αξιολόγησης (ROUGE-L, BERTScore, RAGAS)
Πέρα από τα μεγέθη και τους χρόνους, εφαρμόστηκε σε ένα αντιπροσωπευτικό υποσύνολο
ερωτήσεων με γνωστές, σωστές απαντήσεις το πλαίσιο αυτόματων μετρικών που περιγράφηκε
στο Κεφάλαιο 3. Σκοπός δεν ήταν μια εξαντλητική, στατιστικά ελεγμένη μέτρηση, αλλά η
επίδειξη του τρόπου με τον οποίο οι μετρικές αυτές μπορούν να αποτυπώσουν διαφορετικές
διαστάσεις της ποιότητας: το ROUGE-L τη λεξική επικάλυψη με τις αναφορές, το BERTScore
τη σημασιολογική ομοιότητα, και τα τέσσερα μέτρα του RAGAS την πιστότητα της απάντησης
και την ποιότητα του σταδίου ανάκτησης.
Οι τιμές που μετρήσαμε συνοψίζονται στον Πίνακα 15. Προέκυψαν από την εφαρμογή των
αυτόματων μετρικών σε αντιπροσωπευτικό υποσύνολο ερωτήσεων με γνωστές, σωστές
απαντήσεις. Η εικόνα είναι συνεπής με τα υπόλοιπα ευρήματά μας: η υψηλή σημασιολογική
ομοιότητα και η ισχυρή πιστότητα επιβεβαιώνουν ότι οι απαντήσεις είναι κατά κανόνα ορθές
και θεμελιωμένες στις πηγές, ενώ η σχετικά χαμηλότερη ανάκληση συμφραζομένων
αναδεικνύει ότι το κυριότερο περιθώριο βελτίωσης βρίσκεται στο στάδιο της ανάκτησης.
Πίνακας 15: Τιμές των αυτόματων μετρικών σε αντιπροσωπευτικό υποσύνολο
Μετρική
Ενδεικτική τιμή
Ερμηνεία
ROUGE-L
0,52
Μέτρια λεξική επικάλυψη με τις αναφορές
BERTScore (F1)
0,86
Υψηλή σημασιολογική ομοιότητα
RAGAS – Πιστότητα
0,88
Ισχυρή θεμελίωση στις πηγές
RAGAS – Συνάφεια Απάντησης
0,81
Καλή συνάφεια με την ερώτηση
RAGAS – Ακρίβεια Πλαισίου
0,74
Ικανοποιητική σχετικότητα ανάκτησης
RAGAS – Ανάκληση Πλαισίου
0,69
Περιθώριο βελτίωσης στην κάλυψη
6.3 Σύγκριση με εναλλακτικά γλωσσικά μοντέλα
Πέρα από την αξιολόγηση του ίδιου του συστήματος, έχει ενδιαφέρον να τοποθετηθεί η
επιλογή του γλωσσικού μοντέλου παραγωγής μέσα στο ευρύτερο τοπίο των ανοιχτών
μοντέλων που θα μπορούσαν να εκτελεστούν τοπικά στο ίδιο υλικό. Η σύγκριση που ακολουθεί
στηρίζεται στις δικές μας δοκιμές των μοντέλων πάνω στο ίδιο υλικό και στο ίδιο σύστημα