14
Αξιολόγηση — Μεθοδολογία LLM-as-a-Judge
▪
Διαδικασία αξιολόγησης :
▪
30 Test Scenarios (15 ΕΛ + 15 ΕΝ ερωτήσεις)
▪
Το DeepSeek δεν βαθμολογεί μόνο την απάντηση του chatbot,
αλλά τη συγκρίνει με την αναμενόμενη σωστή απάντηση (Ground
Truth), ώστε η αξιολόγηση να είναι αντικειμενική.
▪
Μετρικές Αξιολόγησης:
▪
Accuracy — Ακρίβεια πληροφοριών (0-5)
▪
Relevance — Συνάφεια με την ερώτηση (0-5)
▪
Persuasiveness — Πειστικότητα (marketing ύφος) (0-5)
▪
Faithfulness — Πιστότητα - Αποφυγή hallucinations (0=χωρίς
παραισθήσεις)
▪
Latency — Χρόνος απόκρισης (δευτ.)