Σχεδιασμός και Υλοποίηση εξειδικευμένου chatbot για διαδικτυακές πλατφόρμες
100
RAG. Τα ευρήματά μας τα διασταυρώνουμε επιπλέον με τις δημοσιευμένες τιμές των
επίσημων τεχνικών αναφορών κάθε μοντέλου, οι οποίες συμφωνούν με τις παρατηρήσεις μας.
Ως δείκτης γενικής γνώσης χρησιμοποιείται το MMLU [50], η πιο διαδεδομένη μετρική για
αυτόν τον σκοπό.
Πίνακας 16: Σύγκριση υποψήφιων ανοιχτών γλωσσικών μοντέλων
Μοντέλο
Παράμετροι
MMLU
Μνήμη (q4)
Σχετ. ταχύτητα
Καταλληλότητα
Llama 3.1 8B
(q4_k_m)
8,0 δισ.
≈ 73 [9]
≈ 4,7 GB
Μέτρια
Iσορροπία
ποιότητας/μνήμης
Qwen2.5 7B
(q4_k_m)
7,6 δισ.
74,2 [25]
≈ 4,5 GB
Μέτρια
Συγκρίσιμη
ποιότητα,
βιώσιμη
εναλλακτική
Llama 3.2 3B
3,2 δισ.
63,4 [19]
≈ 2,0 GB
Υψηλή
Ταχύτερο αλλά
αισθητά
ασθενέστερο
Llama 3.2 1B
1,2 δισ.
49,3 [19]
≈ 0,9 GB
Πολύ υψηλή
Πολύ ελαφρύ,
ανεπαρκές σε
σύνθετες
ερωτήσεις
TinyLlama 1.1B
1,1 δισ.
≈ 25 [39]
≈ 0,7 GB
Πολύ υψηλή
Ακατάλληλο για
ερωτήσεις
ελληνικών
Οι τιμές MMLU παρατίθενται από τις επίσημες τεχνικές αναφορές των μοντέλων ως
δείκτης αναφοράς της γενικής γνώσης και επιβεβαιώνουν την εικόνα των δικών μας δοκιμών·
οι τιμές μνήμης και η σχετική ταχύτητα προέκυψαν από τις μετρήσεις μας στο σύστημα, σε
κβαντοποίηση 4 bit.
Η εικόνα που προκύπτει εξηγεί τη σχεδιαστική μας επιλογή. Το Llama 3.1 8B πετυχαίνει
γενική γνώση (MMLU ≈ 73 [9]) πολύ κοντά στο Qwen2.5 7B (74,2 [25]) και σαφώς υψηλότερη
από τα μικρότερα μοντέλα, ενώ στην κβαντοποίηση q4_k_m καταλαμβάνει περίπου 4,7 GB
και χωρά άνετα στα 12 GB της RX 6700 XT μαζί με το μοντέλο ενσωματώσεων. Τα