background image

Σχεδιασμός και Υλοποίηση εξειδικευμένου chatbot για διαδικτυακές πλατφόρμες

 

30

 

Κεφάλαιο 2 – Θεωρητικό Υπόβαθρο 

Στο Κεφάλαιο 1 παρουσιάστηκε το πρόβλημα της κατακερματισμένης πληροφορίας  και 

τέθηκαν οι στόχοι της εργασίας. Στο παρόν κεφάλαιο αναλύεται το θεωρητικό υπόβαθρο πάνω 

στο οποίο στηρίζεται η υλοποίηση, ξεκινώντας από την αρχιτεκτονική των Transformers και 

φτάνοντας  έως  τους  πράκτορες  συλλογιστικής  και  τους  συνομιλιακούς  βοηθούς  στην 

εκπαίδευση. 

2.1 Από τα Transformers στα μεγάλα γλωσσικά μοντέλα 

Η σύγχρονη επανάσταση στην επεξεργασία φυσικής γλώσσας ξεκινά ουσιαστικά από τη 

δημοσίευση της εργασίας «Attention Is All You Need» το 2017 [31]. Η εργασία αυτή εισήγαγε 

την αρχιτεκτονική Transformer, η οποία εγκατέλειψε τα Recurrent Neural Networks (RNNs) 

και  βασίστηκε  αποκλειστικά  σε  μηχανισμούς  προσοχής.  Η  βασική  καινοτομία  της 

αρχιτεκτονικής  ήταν  η  δυνατότητα  παράλληλης  επεξεργασίας  όλων  των  λέξεων  μιας 

πρότασης, επιτρέποντας στο μοντέλο να μαθαίνει τις σχέσεις μεταξύ τους χωρίς να απαιτείται 

σειριακή επεξεργασία. Η αλλαγή αυτή κατέστησε δυνατή την εκπαίδευση πολύ μεγαλύτερων 

μοντέλων σε σημαντικά εκτενέστερα σύνολα δεδομένων και άνοιξε τον δρόμο για τις μετέπειτα 

εξελίξεις στον τομέα. 

Δύο  χρόνια  αργότερα,  το  2019,  παρουσιάστηκε  το  BERT  (Bidirectional  Encoder 

Representations from Transformers) [8], ένα προεκπαιδευμένο γλωσσικό μοντέλο βασισμένο 

στους Transformers, το οποίο μπορούσε, μέσω μιας διαδικασίας προσαρμογής, να επιτυγχάνει 

αποτελέσματα τελευταίας τεχνολογίας σε πλήθος εργασιών, όπως η απάντηση ερωτήσεων και 

η  κατηγοριοποίηση  κειμένων.  Το  BERT  εδραίωσε  το  πρότυπο  της  προεκπαίδευσης  σε 

τεράστιες  ποσότητες  κειμένου  και  της  εξειδικευμένης  προσαρμογής  για  κάθε  επιμέρους 

εργασία. Από εκείνο το σημείο και έπειτα, ξεκίνησε μια συνεχής αύξηση του μεγέθους και της