Σχεδιασμός και Υλοποίηση εξειδικευμένου chatbot για διαδικτυακές πλατφόρμες
60
Σε παρόμοια κατεύθυνση κινείται και το BLEURT [29], που πηγαίνει ένα βήμα παραπέρα.
Αντί να ορίσει έναν σταθερό τύπο, μαθαίνει το ίδιο τι σημαίνει καλή παραγωγή. Εκπαιδεύεται
πρώτα σε τεράστιο πλήθος τεχνητά αλλοιωμένων προτάσεων και έπειτα προσαρμόζεται σε
πραγματικές ανθρώπινες αξιολογήσεις, ώστε να προβλέπει τη βαθμολογία που θα έβαζε ένας
άνθρωπος. Σε δοκιμές δείχνει την καλύτερη συμφωνία με την ανθρώπινη κρίση από όσες
μετρικές αναφέραμε ως τώρα. Έρχεται όμως με κόστος: είναι υπολογιστικά βαρύτερο,
λειτουργεί σαν μαύρο κουτί που δεν εξηγεί γιατί κατέληξε σε μια βαθμολογία, και επειδή τα
δεδομένα εκπαίδευσής του είναι κυρίως αγγλικά, η μεταφορά του σε άλλη γλώσσα δεν είναι
εγγυημένη. Όπως και οι υπόλοιπες, παραμένει εξαρτημένο από την ύπαρξη κειμένου
αναφοράς, αφού συγκρίνει πάντα την παραγωγή με μια σωστή απάντηση που πρέπει κάποιος
να έχει γράψει εκ των προτέρων. Συνολικά, οι μετρικές που βασίζονται σε ενσωματώσεις δεν
λύνουν εντελώς το πρόβλημα της αξιολόγησης, είναι όμως αισθητά καλύτερες από τις
παραδοσιακές μετρικές n-γραμμάτων εκεί όπου η σημασιολογική ισοδυναμία προηγείται της
λεξικής.
3.6 Εξειδικευμένη αξιολόγηση συστημάτων RAG
Όλες οι μετρικές που συζητήθηκαν παραπάνω σχεδιάστηκαν για γενικές εργασίες
παραγωγής κειμένου και έχουν περιορισμούς όταν εφαρμόζονται σε RAG συστήματα. Το
πρόβλημα είναι ότι ένα RAG σύστημα έχει δύο διακριτά στάδια, την ανάκτηση και την
παραγωγή, και η αποτυχία μπορεί να προέρθει από οποιοδήποτε από τα δύο. Μια καλή
απάντηση που χτίστηκε πάνω σε λάθος έγγραφα είναι λάθος, ακόμα και αν διαβάζεται φυσικά
και γραμματικά. Το BLEU δεν θα το πιάσει αυτό. Ομοίως, μια σωστή απάντηση που χτίστηκε
πάνω σε σωστά έγγραφα αλλά με κακή γραμματική δεν θα πάρει χαμηλό σκορ από το
BERTScore, παρότι ο τελικός χρήστης μπορεί να δυσκολευτεί να την κατανοήσει.
Η ανάγκη για μετρικές ειδικά σχεδιασμένες για RAG οδήγησε στο RAGAS (Retrieval-
Augmented Generation Assessment) [10]. Προτείνει τέσσερις βασικές μετρικές. Η πιστότητα
μετράει αν η απάντηση είναι θεμελιωμένη στα ανακτημένα συμφραζόμενα ή αν περιέχει