background image

Σχεδιασμός και Υλοποίηση εξειδικευμένου chatbot για διαδικτυακές πλατφόρμες

 

105

 

υπερτερεί  σαφώς  (56,3%  έναντι  48,3%)  [25],  [49].  Το  Llama  3.1  8B,  αντίθετα,  αναφέρει 

επίσημη υποστήριξη μόλις για οκτώ γλώσσες, χωρίς τα ελληνικά ανάμεσά τους [48], παρότι 

στην  πράξη  παράγει  ευχερώς  ελληνικό  κείμενο  χάρη  στα  πολυγλωσσικά  δεδομένα  της 

προεκπαίδευσής  του.  Με  βάση  μόνο  αυτά  τα  στοιχεία,  η  αναμενόμενη  επιλογή  θα  ήταν  το 

Qwen. 

Στην  πράξη  όμως  η  εικόνα  αντιστράφηκε.  Ο  λόγος  ήταν  μια  ικανότητα  που  οι  γενικές 

μετρήσεις  γνώσης  δεν  αποτυπώνουν:  η  πιστή  τήρηση  των  οδηγιών.  Στο  IFEval  [73],  μια 

μετρική  που  αξιολογεί  πόσο  αξιόπιστα  ένα  μοντέλο  ακολουθεί  ρητές  οδηγίες  μορφής  και 

περιεχομένου,  το  Llama  3.1  8B  προηγείται  καθαρά,  με  80,4%  έναντι  71,2%  του 

Qwen2.5 7B [9],  [49].  Για  ένα  σύστημα  RAG  αυτή  η  ικανότητα  δεν  είναι  δευτερεύουσα. 

Ολόκληρη η αξιοπιστία της απάντησης στηρίζεται στο να υπακούει το μοντέλο σε μια αυστηρή 

οδηγία:  να  απαντά  μόνο  από  τα  ανακτημένα  έγγραφα,  στη  γλώσσα  του  χρήστη,  με 

συγκεκριμένη μορφή και με αναφορά στην πηγή. Ένα μοντέλο με ισχυρότερη γενική γνώση 

αλλά ασθενέστερη πειθαρχία στις οδηγίες τείνει να αυτοσχεδιάζει, κάτι ανεπιθύμητο όταν το 

ζητούμενο είναι η τεκμηρίωση. 

Στις δικές μας δοκιμές η διαφορά αυτή αποτυπώθηκε καθαρά. Στα αγγλικά τα δύο μοντέλα 

ήταν ουσιαστικά ισοδύναμα, με το Qwen ίσως ελαφρώς πιο εύστοχο σε σύνθετες ερωτήσεις. 

Στα  ελληνικά  όμως  το  Llama  3.1  8B  έδινε  σταθερά  πιο  φυσικές  και  πιο  σωστά  δομημένες 

απαντήσεις, ενώ το Qwen εμφάνιζε συχνότερα αδέξιες διατυπώσεις και περιστασιακή ανάμειξη 

με αγγλικές ή κινεζικές λέξεις. Η Εικόνα 22 συνοψίζει αυτή την εικόνα: σχεδόν ταυτόσημη 

ποιότητα στα αγγλικά, αισθητή υπεροχή του Llama στα ελληνικά.