Νικόλαος Λυμπιτάκης, Κατασκευή ενός RAG Chatbot για
Ξενοδοχειακή Υποστήριξη
64
5.3 Μετρικές Αξιολόγησης (Evaluation Metrics)
Η ποιότητα του chatbot δεν είναι μονοδιάστατη. Για να αποκτηθεί μια
ολοκληρωμένη εικόνα της απόδοσης, ορίστηκαν τέσσερις διακριτές μετρικές ποιότητας και
. Η βαθμολόγηση γίνεται στην κλίμακα (0-5).
Ακρίβεια (Accuracy)
Αυτή η μετρική ελέγχει την πραγματική ακρίβεια των πληροφοριών. Είναι η πιο κρίσιμη
μετρική για ένα επιχειρησιακό chatbot, καθώς λανθασμένες πληροφορίες (π.χ. λάθος ώρα
check-in ή τιμή δωματίου) μπορούν να οδηγήσουν σε δυσαρέσκεια πελατών.
- Βαθμός 5: Η πληροφορία είναι απολύτως ακριβής και συμφωνεί πλήρως με το Ground
Truth.
- Βαθμός 0: Η απάντηση περιέχει σοβαρά πραγματολογικά λάθη.
Συνάφεια (Relevance)
Η συνάφεια εξετάζει αν το chatbot απαντά στο συγκεκριμένο ερώτημα που τέθηκε.
Συχνά τα LLMs τείνουν να πλατειάζουν ή να δίνουν γενικές πληροφορίες αποφεύγοντας
την ουσία.
- Βαθμός 5: Η απάντηση είναι στοχευμένη και καλύπτει ακριβώς την ερώτηση.
- Βαθμός 0: Η απάντηση είναι άσχετη ή γενικόλογη.
Πειστικότητα (Persuasiveness)
Δεδομένου του ρόλου του chatbot ως πωλητή και εκπροσώπου του ξενοδοχείου, το
ύφος έχει μεγάλη σημασία. Η μετρική αυτή αξιολογεί αν η γλώσσα που χρησιμοποιείται
είναι ελκυστική, φιλόξενη και αν προτρέπει τελικά τον πελάτη να κάνει κράτηση στο
ξενοδοχείο.
- Βαθμός 5: Εξαιρετικό ύφος, χρήση θετικών επιθέτων, προτροπή για κράτηση.
- Βαθμός 0: Βαρετή ή αγενής γλώσσα που δεν δημιουργεί προτροπή για κράτηση.
Πιστότητα / Παραισθήσεις (Faithfulness / Hallucination)
Τα LLMs συχνά έχουν παραισθήσεις (Hallucinations), δηλαδή επινοούν γεγονότα
που δεν υπάρχουν και ένας από τους βασικούς λόγους ύπαρξης ενός RAG Chatbot είναι η