background image

Σχεδιασμός και Υλοποίηση εξειδικευμένου chatbot για διαδικτυακές πλατφόρμες

 

60

 

Σε παρόμοια κατεύθυνση κινείται και το BLEURT [29], που πηγαίνει ένα βήμα παραπέρα. 

Αντί να ορίσει έναν σταθερό τύπο, μαθαίνει το ίδιο τι σημαίνει καλή παραγωγή. Εκπαιδεύεται 

πρώτα  σε  τεράστιο  πλήθος  τεχνητά  αλλοιωμένων  προτάσεων  και  έπειτα  προσαρμόζεται  σε 

πραγματικές ανθρώπινες αξιολογήσεις, ώστε να προβλέπει τη βαθμολογία που θα έβαζε ένας 

άνθρωπος.  Σε  δοκιμές  δείχνει  την  καλύτερη  συμφωνία  με  την  ανθρώπινη  κρίση  από  όσες 

μετρικές  αναφέραμε  ως  τώρα.  Έρχεται  όμως  με  κόστος:  είναι  υπολογιστικά  βαρύτερο, 

λειτουργεί σαν μαύρο κουτί που δεν εξηγεί γιατί κατέληξε σε μια βαθμολογία, και επειδή τα 

δεδομένα εκπαίδευσής του είναι κυρίως αγγλικά, η μεταφορά του σε άλλη γλώσσα δεν είναι 

εγγυημένη.  Όπως  και  οι  υπόλοιπες,  παραμένει  εξαρτημένο  από  την  ύπαρξη  κειμένου 

αναφοράς, αφού συγκρίνει πάντα την παραγωγή με μια σωστή απάντηση που πρέπει κάποιος 

να έχει γράψει εκ των προτέρων. Συνολικά, οι μετρικές που βασίζονται σε ενσωματώσεις δεν 

λύνουν  εντελώς  το  πρόβλημα  της  αξιολόγησης,  είναι  όμως  αισθητά  καλύτερες  από  τις 

παραδοσιακές μετρικές n-γραμμάτων εκεί όπου η σημασιολογική ισοδυναμία προηγείται της 

λεξικής. 

3.6 Εξειδικευμένη αξιολόγηση συστημάτων RAG 

Όλες  οι  μετρικές  που  συζητήθηκαν  παραπάνω  σχεδιάστηκαν  για  γενικές  εργασίες 

παραγωγής  κειμένου  και  έχουν  περιορισμούς  όταν  εφαρμόζονται  σε  RAG  συστήματα.  Το 

πρόβλημα  είναι  ότι  ένα  RAG  σύστημα  έχει  δύο  διακριτά  στάδια,  την  ανάκτηση  και  την 

παραγωγή,  και  η  αποτυχία  μπορεί  να  προέρθει  από  οποιοδήποτε  από  τα  δύο.  Μια  καλή 

απάντηση που χτίστηκε πάνω σε λάθος έγγραφα είναι λάθος, ακόμα και αν διαβάζεται φυσικά 

και γραμματικά. Το BLEU δεν θα το πιάσει αυτό. Ομοίως, μια σωστή απάντηση που χτίστηκε 

πάνω  σε  σωστά  έγγραφα  αλλά  με  κακή  γραμματική  δεν  θα  πάρει  χαμηλό  σκορ  από  το 

BERTScore, παρότι ο τελικός χρήστης μπορεί να δυσκολευτεί να την κατανοήσει. 

Η  ανάγκη  για  μετρικές  ειδικά  σχεδιασμένες  για  RAG  οδήγησε  στο  RAGAS  (Retrieval-

Augmented Generation Assessment) [10]. Προτείνει τέσσερις βασικές μετρικές. Η πιστότητα 

μετράει  αν  η  απάντηση  είναι  θεμελιωμένη  στα  ανακτημένα  συμφραζόμενα  ή  αν  περιέχει