background image

Σχεδιασμός και Υλοποίηση εξειδικευμένου chatbot για διαδικτυακές πλατφόρμες

 

100

 

RAG.  Τα  ευρήματά  μας  τα  διασταυρώνουμε  επιπλέον  με  τις  δημοσιευμένες  τιμές  των 

επίσημων τεχνικών αναφορών κάθε μοντέλου, οι οποίες συμφωνούν με τις παρατηρήσεις μας. 

Ως δείκτης γενικής γνώσης χρησιμοποιείται το MMLU [50], η πιο διαδεδομένη μετρική για 

αυτόν τον σκοπό. 

Πίνακας 16: Σύγκριση υποψήφιων ανοιχτών γλωσσικών μοντέλων  

Μοντέλο

 

Παράμετροι

 

MMLU

 

Μνήμη (q4)

 

Σχετ. ταχύτητα

 

Καταλληλότητα

 

Llama 3.1 8B 

(q4_k_m)

 

8,0 δισ.

 

≈ 73 [9] 

≈ 4,7 GB

 

Μέτρια

 

Iσορροπία 

ποιότητας/μνήμης

 

Qwen2.5 7B 

(q4_k_m)

 

7,6 δισ.

 

74,2 [25] 

≈ 4,5 GB

 

Μέτρια

 

Συγκρίσιμη 

ποιότητα, 

βιώσιμη 

εναλλακτική

 

Llama 3.2 3B

 

3,2 δισ.

 

63,4 [19] 

≈ 2,0 GB

 

Υψηλή

 

Ταχύτερο αλλά 

αισθητά 

ασθενέστερο

 

Llama 3.2 1B

 

1,2 δισ.

 

49,3 [19] 

≈ 0,9 GB

 

Πολύ υψηλή

 

Πολύ ελαφρύ, 

ανεπαρκές σε 

σύνθετες 

ερωτήσεις

 

TinyLlama 1.1B

 

1,1 δισ.

 

≈ 25 [39] 

≈ 0,7 GB

 

Πολύ υψηλή

 

Ακατάλληλο για 

ερωτήσεις 

ελληνικών 

 

 

Οι  τιμές  MMLU  παρατίθενται  από  τις  επίσημες  τεχνικές  αναφορές  των  μοντέλων  ως 

δείκτης αναφοράς της γενικής γνώσης και επιβεβαιώνουν την εικόνα των δικών μας δοκιμών· 

οι τιμές μνήμης και η σχετική ταχύτητα προέκυψαν από τις μετρήσεις μας στο σύστημα, σε 

κβαντοποίηση 4 bit. 

Η εικόνα που προκύπτει εξηγεί τη σχεδιαστική μας επιλογή. Το Llama 3.1 8B πετυχαίνει 

γενική γνώση (MMLU ≈ 73 [9]) πολύ κοντά στο Qwen2.5 7B (74,2 [25]) και σαφώς υψηλότερη 

από τα μικρότερα μοντέλα, ενώ στην κβαντοποίηση q4_k_m καταλαμβάνει περίπου 4,7 GB 

και  χωρά  άνετα  στα  12  GB  της  RX  6700  XT  μαζί  με  το  μοντέλο  ενσωματώσεων.  Τα