background image

14

Αξιολόγηση — Μεθοδολογία LLM-as-a-Judge

Διαδικασία αξιολόγησης :

30 Test Scenarios (15 ΕΛ + 15 ΕΝ ερωτήσεις)

Το DeepSeek δεν βαθμολογεί μόνο την απάντηση του chatbot, 
αλλά τη συγκρίνει με την αναμενόμενη σωστή απάντηση (Ground 
Truth), ώστε η αξιολόγηση να είναι αντικειμενική.

Μετρικές Αξιολόγησης:

Accuracy — Ακρίβεια πληροφοριών (0-5)

Relevance — Συνάφεια με την ερώτηση (0-5)

Persuasiveness — Πειστικότητα (marketing ύφος) (0-5)

Faithfulness — Πιστότητα - Αποφυγή hallucinations (0=χωρίς 
παραισθήσεις)

Latency — Χρόνος απόκρισης (δευτ.)