Σχεδιασμός και Υλοποίηση εξειδικευμένου chatbot για διαδικτυακές πλατφόρμες
44
συμπιέζεται έως και κατά 75% και δύναται να λειτουργήσει αποδοτικά εντός των ορίων μιας
τυπικής μνήμης VRAM 12 GB, επιφέροντας αμελητέα υποβάθμιση στην ποιότητα των
παραγόμενων απαντήσεων.
Η επιτάχυνση αυτών των απαιτητικών υπολογιστικών πράξεων στο υλικό της AMD
βασίζεται στην πλατφόρμα ROCm [1], η οποία αποτελεί μια ανοιχτού κώδικα εναλλακτική
λύση απέναντι στο ιδιοταγές οικοσύστημα CUDA της NVIDIA. Στο επίκεντρο της
αρχιτεκτονικής του ROCm βρίσκεται το HIP (Heterogeneous-compute Interface for
Portability), ένα στρώμα προγραμματισμού που επιτρέπει τη μετατροπή του πηγαίου κώδικα
ώστε να εκτελείται απευθείας πάνω στην αρχιτεκτονική RDNA 2 [61] της κάρτας γραφικών
RX 6700 XT.
Η επιλογή της συγκεκριμένης στοίβας υλικού έγινε συνειδητά για ερευνητικούς σκοπούς,
προκειμένου να αποδειχθεί ότι ένα πλήρες σύστημα RAG μπορεί να λειτουργήσει αξιόπιστα
εκτός του κυρίαρχου μονοπωλίου της NVIDIA. Στο επίπεδο της εφαρμογής, το πλαίσιο
Ollama [21] λειτουργεί ως ένα περίβλημα υψηλού επιπέδου πάνω από τη βιβλιοθήκη
llama.cpp, αναλαμβάνοντας τη δυναμική διαχείριση της μνήμης και την επικοινωνία με τις
βιβλιοθήκες χαμηλού επιπέδου του ROCm, αποκρύπτοντας έτσι την υπολογιστική
πολυπλοκότητα.
2.7 Σύνοψη και σύνδεση με την υλοποίηση
Το κεφάλαιο αυτό έθεσε το θεωρητικό υπόβαθρο της εργασίας. Ξεκινήσαμε από την
αρχιτεκτονική Transformer και την άνοδο των μεγάλων γλωσσικών μοντέλων, σημειώνοντας
ταυτόχρονα τους εγγενείς περιορισμούς τους, τη γνώση που μένει παγωμένη στον χρόνο και
την τάση για ψευδαισθήσεις. Είδαμε πώς οι διανυσματικές ενσωματώσεις και η σημασιολογική
αναζήτηση επιτρέπουν τον εντοπισμό σχετικού περιεχομένου με βάση το νόημα, και πώς η
αρχιτεκτονική RAG αξιοποιεί αυτή τη δυνατότητα ώστε οι απαντήσεις να θεμελιώνονται σε