Σχεδιασμός και Υλοποίηση εξειδικευμένου chatbot για διαδικτυακές πλατφόρμες
94
του συστήματος ξεχωριστά για τις πραγματολογικές, τις χρονικά εξαρτημένες και τις
κακόβουλες ερωτήσεις. Αυτή η οργανωμένη συλλογή δεδομένων αποτέλεσε τη βάση τόσο για
τα ποσοτικά μεγέθη όσο και για την ποιοτική ανάλυση που ακολουθεί.
6.2 Ποσοτικά αποτελέσματα και επιδόσεις του συστήματος
Από τη συνεδρία αυτή προκύπτει μια αρκετά καθαρή εικόνα για το πώς αποδίδει το
σύστημα. Στη συνέχεια παρουσιάζουμε πρώτα τα μεγέθη που το χαρακτηρίζουν και έπειτα τις
επιδόσεις του ως προς την ταχύτητα, την κάλυψη και την αξιοπιστία.
6.2.1 Ποσοτικά στοιχεία του συστήματος
Το υλικό που ευρετηριάστηκε προέρχεται από περίπου τρεις χιλιάδες πεντακόσιες σελίδες
HTML του κύριου ιστότοπου και περίπου επτακόσια εξήντα επτά αρχεία PDF, που μαζί
καλύπτουν το μεγαλύτερο μέρος της δημόσιας πληροφορίας του τμήματος. Μετά τον
καθαρισμό και τον τεμαχισμό, το υλικό αυτό μετατράπηκε σε ενενήντα δύο χιλιάδες τριακόσια
έξι διανύσματα, τα οποία αποθηκεύτηκαν στη βάση ChromaDB και αποτελούν τη γνωσιακή
βάση πάνω στην οποία στηρίζεται κάθε απάντηση. Από την πλευρά του κώδικα, το σύστημα
παρέμεινε σχετικά συμπαγές, με περίπου τρεις χιλιάδες γραμμές κατανεμημένες σε δώδεκα
αρχεία Python. Το μέγεθος αυτό δείχνει ότι η πολυπλοκότητα του συστήματος βρίσκεται
περισσότερο στις σχεδιαστικές επιλογές παρά στον όγκο του κώδικα.
Αξίζει να σημειωθεί ότι η φάση της ευρετηρίασης εκτελείται εκτός σύνδεσης και αποτελεί
ένα εφάπαξ ή περιοδικό κόστος, ανεξάρτητο από τον χρόνο απόκρισης του συστήματος στις
ερωτήσεις των χρηστών. Στις δικές μας εκτελέσεις, η σάρωση του ιστότοπου από τον ανιχνευτή
διαρκούσε κατά μέσο όρο περίπου σαράντα πέντε λεπτά, ενώ η πλήρης ευρετηρίαση, δηλαδή
η λήψη, ο καθαρισμός, ο τεμαχισμός και ο υπολογισμός των διανυσματικών αναπαραστάσεων
όλου του περιεχομένου, ολοκληρωνόταν σε περίπου δυόμισι ώρες. Δεδομένου ότι η διαδικασία
εκτελείται όχι συχνά και στο παρασκήνιο, οι χρόνοι αυτοί δεν αποτελούν περιορισμό για την