Νικόλαος Λυμπιτάκης, Κατασκευή ενός RAG Chatbot για
Ξενοδοχειακή Υποστήριξη
61
επιτρέπει την πολυγλωσσική επικοινωνία και τη συλλογή ανατροφοδότησης σε πραγματικό
χρόνο. Στο επόμενο κεφάλαιο, ακολουθεί η αξιολόγηση του συστήματος μέσω σεναρίων
δοκιμών, η ανάλυση της απόδοσής του και η καταγραφή των περιορισμών που προέκυψαν.
5. Δοκιμές και Αξιολόγηση
5.1 Εισαγωγή
Η ανάπτυξη ευφυών συστημάτων διαλόγου που βασίζονται σε Μεγάλα Γλωσσικά
Μοντέλα και αρχιτεκτονικές RAG εισάγει νέες προκλήσεις στον τομέα της διασφάλισης
ποιότητας λογισμικού. Σε αντίθεση με τις παραδοσιακές εφαρμογές, όπου η ορθότητα ενός
αποτελέσματος είναι συνήθως ντετερμινιστική και δυαδική (Σωστό/Λάθος), τα συστήματα
παραγωγικής τεχνητής νοημοσύνης χαρακτηρίζονται από στοχαστικότητα και
δημιουργικότητα. Ένα chatbot μπορεί να απαντήσει στην ίδια ερώτηση με πολλούς
διαφορετικούς τρόπους, οι οποίοι μπορεί να είναι όλοι σημασιολογικά ορθοί, αλλά να
διαφέρουν ως προς το ύφος, την πληρότητα ή την ακρίβεια των λεπτομερειών.
Στο πλαίσιο της παρούσας πτυχιακής εργασίας, η διαδικασία αξιολόγησης δεν
περιορίστηκε μόνο στον έλεγχο της λειτουργικότητας του κώδικα, αλλά επεκτάθηκε στην
ποιοτική αποτίμηση των παραγόμενων απαντήσεων. Ο κύριος στόχος ήταν να διασφαλιστεί
ότι το chatbot λειτουργεί όχι μόνο ως μια βάση γνώσης, αλλά και ως ένας πειστικός,
ευγενικός και εξυπηρετικός ψηφιακός υπάλληλος, αντάξιος των προτύπων ενός
ξενοδοχείου 5 αστέρων.
Η στρατηγική αξιολόγησης σχεδιάστηκε για να μετρήσει τέσσερις βασικούς
ποιοτικούς άξονες: την ακρίβεια (Accuracy) των πληροφοριών, τη Συνάφεια (Relevance)
με το ερώτημα του χρήστη, την Πειστικότητα (Persuasiveness) του ύφους και την
Πιστότητα (Faithfulness) στα δεδομένα πηγής, ώστε να ελαχιστοποιηθούν τα φαινόμενα
"παραισθήσεων" (hallucinations). Παράλληλα, αξιολογήθηκε η απόδοση του συστήματος
σε επίπεδο ταχύτητας απόκρισης (Latency) σε δευτερόλεπτα, καθώς η άμεση εξυπηρέτηση
αποτελεί κρίσιμη λειτουργική απαίτηση για την εμπειρία του χρήστη.
5.2 Μεθοδολογία Αξιολόγησης
Για την υλοποίηση της αξιολόγησης υιοθετήθηκε η σύγχρονη προσέγγιση “LLM-
as-a-Judge” (Το LLM ως Κριτής)
. Η μέθοδος αυτή αξιοποιεί ένα ισχυρό γλωσσικό
μοντέλο για να βαθμολογήσει τις απαντήσεις ενός άλλου μοντέλου, προσφέροντας μια