background image

Σχεδιασμός και Υλοποίηση εξειδικευμένου chatbot για διαδικτυακές πλατφόρμες

 

44

 

συμπιέζεται έως και κατά 75% και δύναται να λειτουργήσει αποδοτικά εντός των ορίων μιας 

τυπικής  μνήμης  VRAM  12  GB,  επιφέροντας  αμελητέα  υποβάθμιση  στην  ποιότητα  των 

παραγόμενων απαντήσεων. 

Η  επιτάχυνση  αυτών  των  απαιτητικών  υπολογιστικών  πράξεων  στο  υλικό  της  AMD 

βασίζεται στην πλατφόρμα ROCm [1], η οποία αποτελεί μια ανοιχτού  κώδικα εναλλακτική 

λύση  απέναντι  στο  ιδιοταγές  οικοσύστημα  CUDA  της  NVIDIA.  Στο  επίκεντρο  της 

αρχιτεκτονικής  του  ROCm  βρίσκεται  το  HIP  (Heterogeneous-compute  Interface  for 

Portability), ένα στρώμα προγραμματισμού που επιτρέπει τη μετατροπή του πηγαίου κώδικα 

ώστε να εκτελείται απευθείας πάνω στην αρχιτεκτονική RDNA 2 [61] της κάρτας γραφικών 

RX 6700 XT. 

Η επιλογή της συγκεκριμένης στοίβας υλικού έγινε συνειδητά για ερευνητικούς σκοπούς, 

προκειμένου να αποδειχθεί ότι ένα πλήρες σύστημα RAG μπορεί να λειτουργήσει αξιόπιστα 

εκτός  του  κυρίαρχου  μονοπωλίου  της  NVIDIA.  Στο  επίπεδο  της  εφαρμογής,  το  πλαίσιο 

Ollama [21]  λειτουργεί  ως  ένα  περίβλημα  υψηλού  επιπέδου  πάνω  από  τη  βιβλιοθήκη 

llama.cpp,  αναλαμβάνοντας  τη  δυναμική  διαχείριση  της  μνήμης  και  την  επικοινωνία  με  τις 

βιβλιοθήκες  χαμηλού  επιπέδου  του  ROCm,  αποκρύπτοντας  έτσι  την  υπολογιστική 

πολυπλοκότητα. 

2.7 Σύνοψη και σύνδεση με την υλοποίηση 

Το  κεφάλαιο  αυτό  έθεσε  το  θεωρητικό  υπόβαθρο  της  εργασίας.  Ξεκινήσαμε  από  την 

αρχιτεκτονική Transformer και την άνοδο των μεγάλων γλωσσικών μοντέλων, σημειώνοντας 

ταυτόχρονα τους εγγενείς περιορισμούς τους, τη γνώση που μένει παγωμένη στον χρόνο και 

την τάση για ψευδαισθήσεις. Είδαμε πώς οι διανυσματικές ενσωματώσεις και η σημασιολογική 

αναζήτηση επιτρέπουν τον εντοπισμό σχετικού περιεχομένου με βάση  το νόημα, και πώς η 

αρχιτεκτονική RAG αξιοποιεί αυτή τη δυνατότητα ώστε οι απαντήσεις να θεμελιώνονται σε