background image

Σχήμα 6.1: Σύγκριση των μοντέλων Claude 3.5 Sonnet, Claude Haiku 4.5 και Big Pickle ως προς τον
συνολικό αριθμό των χρησιμοποιηθέντων tokens και το πλήθος των παραγόμενων γραμμών κώδικα.

Σχήμα 6.2: Σύγκριση των μοντέλων Claude 3.5 Sonnet, Claude Haiku 4.5 και Big Pickle ως προς τον
αριθμό των προτροπών (prompts) που απαιτήθηκαν για την επίτευξη λειτουργικού αποτελέσματος και
την προσθήκη επιπρόσθετης λειτουργικότητας.

θέση, ακολουθούμενο από το Claude Haiku 4.5 και το Big Pickle όπως ειναι φανερό και απο

το Σχήμα 6.1. Όσον αφορά το κόστος χρήσης, όπως αυτό εκφράζεται μέσω του αριθμού των

καταναλωθέντων tokens, καθώς και τον όγκο του παραγόμενου κώδικα, το Claude Sonnet 3.5

παρουσίασε την πιο συμπαγή υλοποίηση, παράγοντας τις λιγότερες γραμμές κώδικα. Ωστόσο,

το πλεονέκτημα αυτό συνοδεύτηκε από το υψηλότερο συνολικό κόστος μεταξύ των αξιολογού-

μενων μοντέλων Σχήμα 6.2.

Ένα ιδιαίτερα ενδιαφέρον εύρημα ήταν ότι η λογική ορθότητα του παραγόμενου κώδικα

ήταν σημαντικά υψηλότερη από την οπτική ορθότητα των παιχνιδιών. Στις περισσότερες περι-

πτώσεις, τα μοντέλα κατάφεραν να αξιοποιήσουν σωστά την αρχιτεκτονική Entity Component

System και να υλοποιήσουν λειτουργικούς μηχανισμούς παιχνιδιού. Αντίθετα, παρατηρήθηκαν

συχνότερα προβλήματα που σχετίζονταν με την οπτική αναπαράσταση, όπως λανθασμένες θέ-

σεις αντικειμένων, ασυνέπειες στην κλίμακα, παραμορφώσεις αναλογιών και σφάλματα στη

74