Σχεδιασμός και Υλοποίηση εξειδικευμένου chatbot για διαδικτυακές πλατφόρμες
102
ΕΙΚΟΝΑ 18: ΧΡΟΝΟΣ ΑΠΟΚΡΙΣΗΣ ΑΝΑ ΜΟΝΤΕΛΟ ΣΤΟ ΣΥΣΤΗΜΑ ΜΑΣ (ΚΒΑΝΤΟΠΟΙΗΣΗ
Q4_K_M, RX 6700 XT)
Η Εικόνα 18 αποτυπώνει τον αναμενόμενο χρόνο απόκρισης. Όπως είναι αναμενόμενο, τα
μικρότερα μοντέλα είναι ταχύτερα: το TinyLlama 1.1B [39] απαντά σε περίπου ένα
δευτερόλεπτο και το Llama 3.2 3B [19] σε δύο, ενώ τα μοντέλα των επτά έως οκτώ
δισεκατομμυρίων παραμέτρων κινούνται γύρω στα τέσσερα. Η ταχύτητα όμως δεν είναι
αυτοσκοπός σε ένα σύστημα που οφείλει πρώτα από όλα να μην παραπλανά τον χρήστη.
ΕΙΚΟΝΑ 19: ΔΕΙΚΤΕΣ ΠΟΙΟΤΗΤΑΣ RAG (ΠΙΣΤΟΤΗΤΑ, ΣΥΝΑΦΕΙΑ ΑΠΑΝΤΗΣΗΣ, ΑΚΡΙΒΕΙΑ
ΚΑΙ ΑΝΑΚΛΗΣΗ ΠΛΑΙΣΙΟΥ) ΑΝΑ ΜΟΝΤΕΛΟ
Στην Εικόνα 19 φαίνεται η άλλη όψη του συμβιβασμού. Η Πιστότητα και η Συνάφεια
Απάντησης ακολουθούν τη γενική ικανότητα του μοντέλου: το Qwen2.5 7B [25] και το
Llama 3.1 8B [9] βρίσκονται στην κορυφή, το Mistral 7B [13] λίγο χαμηλότερα, ενώ το
TinyLlama [39] υποχωρεί απότομα. Αντίθετα, η Ακρίβεια και η Ανάκληση Πλαισίου
εμφανίζονται σχεδόν ίδιες για όλα τα μοντέλα, και αυτό δεν είναι τυχαίο: εξαρτώνται από τον
ανακτητή, ο οποίος παραμένει κοινός ανεξάρτητα από το μοντέλο παραγωγής.