Σχεδιασμός και Υλοποίηση εξειδικευμένου chatbot για διαδικτυακές πλατφόρμες
30
Κεφάλαιο 2 – Θεωρητικό Υπόβαθρο
Στο Κεφάλαιο 1 παρουσιάστηκε το πρόβλημα της κατακερματισμένης πληροφορίας και
τέθηκαν οι στόχοι της εργασίας. Στο παρόν κεφάλαιο αναλύεται το θεωρητικό υπόβαθρο πάνω
στο οποίο στηρίζεται η υλοποίηση, ξεκινώντας από την αρχιτεκτονική των Transformers και
φτάνοντας έως τους πράκτορες συλλογιστικής και τους συνομιλιακούς βοηθούς στην
εκπαίδευση.
2.1 Από τα Transformers στα μεγάλα γλωσσικά μοντέλα
Η σύγχρονη επανάσταση στην επεξεργασία φυσικής γλώσσας ξεκινά ουσιαστικά από τη
δημοσίευση της εργασίας «Attention Is All You Need» το 2017 [31]. Η εργασία αυτή εισήγαγε
την αρχιτεκτονική Transformer, η οποία εγκατέλειψε τα Recurrent Neural Networks (RNNs)
και βασίστηκε αποκλειστικά σε μηχανισμούς προσοχής. Η βασική καινοτομία της
αρχιτεκτονικής ήταν η δυνατότητα παράλληλης επεξεργασίας όλων των λέξεων μιας
πρότασης, επιτρέποντας στο μοντέλο να μαθαίνει τις σχέσεις μεταξύ τους χωρίς να απαιτείται
σειριακή επεξεργασία. Η αλλαγή αυτή κατέστησε δυνατή την εκπαίδευση πολύ μεγαλύτερων
μοντέλων σε σημαντικά εκτενέστερα σύνολα δεδομένων και άνοιξε τον δρόμο για τις μετέπειτα
εξελίξεις στον τομέα.
Δύο χρόνια αργότερα, το 2019, παρουσιάστηκε το BERT (Bidirectional Encoder
Representations from Transformers) [8], ένα προεκπαιδευμένο γλωσσικό μοντέλο βασισμένο
στους Transformers, το οποίο μπορούσε, μέσω μιας διαδικασίας προσαρμογής, να επιτυγχάνει
αποτελέσματα τελευταίας τεχνολογίας σε πλήθος εργασιών, όπως η απάντηση ερωτήσεων και
η κατηγοριοποίηση κειμένων. Το BERT εδραίωσε το πρότυπο της προεκπαίδευσης σε
τεράστιες ποσότητες κειμένου και της εξειδικευμένης προσαρμογής για κάθε επιμέρους
εργασία. Από εκείνο το σημείο και έπειτα, ξεκίνησε μια συνεχής αύξηση του μεγέθους και της