background image

 

Νικόλαος Λυμπιτάκης, Κατασκευή ενός RAG Chatbot για 
Ξενοδοχειακή Υποστήριξη 

 

 
 

 

64 

5.3  Μετρικές Αξιολόγησης (Evaluation Metrics) 

 

Η  ποιότητα  του  chatbot  δεν  είναι  μονοδιάστατη.  Για  να  αποκτηθεί  μια 

ολοκληρωμένη εικόνα της απόδοσης, ορίστηκαν τέσσερις διακριτές μετρικές ποιότητας και 

μία μετρική απόδοσης 

[33]

. Η βαθμολόγηση γίνεται στην κλίμακα (0-5). 

 

Ακρίβεια (Accuracy) 

Αυτή η μετρική ελέγχει την πραγματική ακρίβεια των πληροφοριών. Είναι η πιο κρίσιμη 

μετρική για ένα επιχειρησιακό chatbot, καθώς λανθασμένες πληροφορίες (π.χ. λάθος ώρα 

check-in ή τιμή δωματίου) μπορούν να οδηγήσουν σε δυσαρέσκεια πελατών. 

- Βαθμός 5: Η πληροφορία είναι απολύτως ακριβής και συμφωνεί πλήρως με το Ground 

Truth. 

- Βαθμός 0: Η απάντηση περιέχει σοβαρά πραγματολογικά λάθη. 

 

Συνάφεια (Relevance) 

 

Η συνάφεια εξετάζει αν το chatbot απαντά στο συγκεκριμένο ερώτημα που τέθηκε. 

Συχνά τα LLMs τείνουν να πλατειάζουν ή να δίνουν γενικές πληροφορίες αποφεύγοντας 

την ουσία. 

- Βαθμός 5: Η απάντηση είναι στοχευμένη και καλύπτει ακριβώς την ερώτηση. 

- Βαθμός 0: Η απάντηση είναι άσχετη ή γενικόλογη. 

 

Πειστικότητα (Persuasiveness) 

 

Δεδομένου του ρόλου του chatbot ως πωλητή και εκπροσώπου του ξενοδοχείου, το 

ύφος έχει μεγάλη σημασία. Η μετρική αυτή αξιολογεί αν η γλώσσα που χρησιμοποιείται 

είναι  ελκυστική,  φιλόξενη  και  αν  προτρέπει  τελικά  τον  πελάτη  να  κάνει  κράτηση  στο 

ξενοδοχείο. 

- Βαθμός 5: Εξαιρετικό ύφος, χρήση θετικών επιθέτων, προτροπή για κράτηση. 

- Βαθμός 0: Βαρετή ή αγενής γλώσσα που δεν δημιουργεί προτροπή για κράτηση. 

 

Πιστότητα / Παραισθήσεις (Faithfulness / Hallucination) 

 

Τα LLMs συχνά έχουν παραισθήσεις (Hallucinations), δηλαδή επινοούν γεγονότα 

που δεν υπάρχουν και ένας από τους βασικούς λόγους ύπαρξης ενός RAG Chatbot είναι η