background image

Σχεδιασμός και Υλοποίηση εξειδικευμένου chatbot για διαδικτυακές πλατφόρμες

 

102

 

ΕΙΚΟΝΑ 18: ΧΡΟΝΟΣ ΑΠΟΚΡΙΣΗΣ ΑΝΑ ΜΟΝΤΕΛΟ ΣΤΟ ΣΥΣΤΗΜΑ ΜΑΣ (ΚΒΑΝΤΟΠΟΙΗΣΗ 

Q4_K_M, RX 6700 XT) 

 

Η Εικόνα 18 αποτυπώνει τον αναμενόμενο χρόνο απόκρισης. Όπως είναι αναμενόμενο, τα 

μικρότερα  μοντέλα  είναι  ταχύτερα:  το  TinyLlama  1.1B  [39]  απαντά  σε  περίπου  ένα 

δευτερόλεπτο  και  το  Llama  3.2  3B  [19]  σε  δύο,  ενώ  τα  μοντέλα  των  επτά  έως  οκτώ 

δισεκατομμυρίων  παραμέτρων  κινούνται  γύρω  στα  τέσσερα.  Η  ταχύτητα  όμως  δεν  είναι 

αυτοσκοπός σε ένα σύστημα που οφείλει πρώτα από όλα να μην παραπλανά τον χρήστη. 

 

ΕΙΚΟΝΑ 19: ΔΕΙΚΤΕΣ ΠΟΙΟΤΗΤΑΣ RAG (ΠΙΣΤΟΤΗΤΑ, ΣΥΝΑΦΕΙΑ ΑΠΑΝΤΗΣΗΣ, ΑΚΡΙΒΕΙΑ 

ΚΑΙ ΑΝΑΚΛΗΣΗ ΠΛΑΙΣΙΟΥ) ΑΝΑ ΜΟΝΤΕΛΟ 

 

Στην  Εικόνα  19  φαίνεται  η  άλλη  όψη  του  συμβιβασμού.  Η  Πιστότητα  και  η  Συνάφεια 

Απάντησης  ακολουθούν  τη  γενική  ικανότητα  του  μοντέλου:  το  Qwen2.5  7B  [25]  και  το 

Llama 3.1  8B  [9]  βρίσκονται  στην  κορυφή,  το  Mistral  7B  [13]  λίγο  χαμηλότερα,  ενώ  το 

TinyLlama  [39]  υποχωρεί  απότομα.  Αντίθετα,  η  Ακρίβεια  και  η  Ανάκληση  Πλαισίου 

εμφανίζονται σχεδόν ίδιες για όλα τα μοντέλα, και αυτό δεν είναι τυχαίο: εξαρτώνται από τον 

ανακτητή, ο οποίος παραμένει κοινός ανεξάρτητα από το μοντέλο παραγωγής.