Σχεδιασμός και Υλοποίηση εξειδικευμένου chatbot για διαδικτυακές πλατφόρμες
101
ελαφρύτερα μοντέλα, το Llama 3.2 3B και 1B [19], θα μείωναν τον χρόνο απόκρισης, με
τίμημα όμως αισθητή πτώση ποιότητας, κάτι ιδιαίτερα κρίσιμο σε ένα δίγλωσσο σύστημα όπου
μια λανθασμένη απάντηση παραπλανά τον φοιτητή. Το TinyLlama 1.1B [39], με επιδόσεις
MMLU κοντά στο τυχαίο, κρίθηκε εξαρχής ακατάλληλο για αξιόπιστες απαντήσεις στα
ελληνικά. Στη δική μας μέτρηση, το Llama 3.1 8B σε q4_k_m έδωσε μέσο χρόνο απόκρισης
περίπου τέσσερα δευτερόλεπτα, αποδεκτό για διαδραστική χρήση· ένα μοντέλο 3B θα μείωνε
περίπου στο μισό τον χρόνο παραγωγής, αλλά θα υπονόμευε την αξιοπιστία που αποτελεί τον
βασικό στόχο της εργασίας.
Συνολικά, η επιλογή του Llama 3.1 8B αντανακλά τον κεντρικό περιορισμό του έργου, την
τοπική εκτέλεση σε καταναλωτική κάρτα γραφικών, και την προτεραιότητα στην αξιοπιστία
έναντι της καθαρής ταχύτητας. Χάρη στην αρθρωτή σχεδίαση, το μοντέλο μπορεί να
αντικατασταθεί με ελάχιστη προσπάθεια καθώς εμφανίζονται ικανότερα μικρά μοντέλα.
Για να γίνει πιο εποπτική η σύγκριση, τα βασικά μεγέθη αποτυπώνονται και γραφικά. Οι
τιμές ποιότητας προέκυψαν από τις δικές μας δοκιμές κάθε μοντέλου στο σύστημά μας και
συμφωνούν με τις δημοσιευμένες γενικές επιδόσεις των μοντέλων, τις οποίες παραθέτουμε ως
επιπλέον τεκμηρίωση.