E-Daily Τα Νέα της ημέρας και ότι σου κάνει κλικ!
LOL Feed OMG Feed Retro Feed A-List Feed LGBTQI+ Feed
E-Daily

Η μυστική λίστα ανάγνωσης του ChatGPT: Τι «διαβάζει» για να εξελιχτεί

Και τι τελικά, μαθαίνει από αυτή του την εκπαίδευση;

Γράφει η ΔΕΣΠΟΙΝΑ ΠΟΛΥΧΡΟΝΙΔΟΥ Δημοσίευση 2/6/2023 | 00:02

Η μυστική λίστα ανάγνωσης του ChatGPT: Τι «διαβάζει» για να εξελιχτεί
Φωτογραφία από Tara Winstead

Τα ρομπότ δεν είναι έξυπνα. Δεν καταλαβαίνουν τον κόσμο με κανέναν τρόπο που μπορεί ένας άνθρωπος. Το τι διαβάζει το AI έχει σημασία!

Ένας επιστήμονας πληροφοριών στο UC Berkeley, ο David Bamman χρησιμοποιεί υπολογιστές για να αναλύσει και κατανοήσει την τέχνη, κατασκευάζοντας αυτό που αποκαλεί «αλγοριθμικές συσκευές για τον πολιτισμό». Αυτό σημαίνει εξαγωγή δεδομένων από την κλασική λογοτεχνία για να αναλυθούν έπειτα πράγματα όπως, ας πούμε, οι σχέσεις μεταξύ διαφόρων χαρακτήρων του βιβλίου. Σε αυτή την περίπτωση, επρόκειτο να ξεκινήσει με μια ερώτηση που θα ήταν εύκολη για έναν έστω και οριακά εγγράμματο άνθρωπο: Τι σχέση έχουν οι χαρακτήρες μεταξύ τους; Eίναι π.χ. αδέρφια;

O Bamman λοιπόν, αποφάσισε να δοκιμάσει πρώτα να ρωτήσει το ChatGPT. Τι θα συνέβαινε αν τροφοδοτούσε με τις 4.000 λέξεις του «Pride and Prejudice» και έθετε ένα απλό ερώτημα: «Ποιες είναι οι σχέσεις μεταξύ των χαρακτήρων;»

Προς έκπληξή του, λειτούργησε. Η έκδοση GPT-4 του chatbot ήταν εκπληκτικά ακριβής σχετικά με το οικογενειακό δέντρο των Bennet. Στην πραγματικότητα, ήταν σχεδόν σαν να είχε μελετήσει εκ των προτέρων το μυθιστόρημα. «Ήταν τόσο καλό που σήκωσε πολλές κόκκινες σημαίες στο μυαλό μου», λέει ο Bamman. «Είτε ήξερε πολύ καλά το έργο, είτε είχε δει το «Pride and Prejudice» στο Διαδίκτυο ένα εκατομμύριο φορές, και ξέρει πολύ καλά το βιβλίο!».

Το πρόβλημα είναι ότι δεν υπήρχε τρόπος να γνωρίζουμε πώς το GPT-4 ήξερε ό,τι ήξερε. Η εσωτερική λειτουργία των μεγάλων μοντέλων γλώσσας στην καρδιά ενός chatbot είναι ένα μαύρο κουτί.

Τα σύνολα δεδομένων στα οποία εκπαιδεύονται είναι τόσο κρίσιμα για τη λειτουργία τους που οι δημιουργοί τους θεωρούν τις πληροφορίες ως αποκλειστικό μυστικό. Έτσι η ομάδα του Bamman αποφάσισε να γίνουν «αρχαιολόγοι δεδομένων». Για να καταλάβουν τι έχει διαβάσει το GPT-4, του έκαναν κουίζ σχετικά με τις γνώσεις του για διάφορα βιβλία, σαν να ήταν μαθητής. Στη συνέχεια του έδωσαν βαθμολογία για κάθε βιβλίο. Όσο υψηλότερη ήταν η βαθμολογία, τόσο πιο πιθανό ήταν ότι το βιβλίο ήταν μέρος του συνόλου δεδομένων του ρομπότ, όχι απλώς για να βοηθήσει το ρομπότ να δημιουργήσει νέα γλώσσα, αλλά στην πραγματικότητα απομνημονεύτηκε.

Σε μια πρόσφατη ομιλία η ομάδα παρουσίασε τα ευρήματά της. Πολλά από αυτά, όπως θα περίμενε κανείς, είναι τα κλασικά βιβλία: από το "Moby Dick" και το "The Scarlet Letter" μέχρι το "The Grapes of Wrath" και, ναι, το "Pride and Prejudice".

Υπάρχουν ένα σωρό δημοφιλή μυθιστορήματα, από τον Χάρι Πότερ και τον Σέρλοκ Χολμς μέχρι τον «Κώδικα Ντα Βίντσι» και τις «Πενήντα Αποχρώσεις του Γκρι».

Αλλά αυτό που προκαλεί έκπληξη είναι το πόσα βιβλία επιστημονικής φαντασίας και φαντασίας GPT-4 έχουν "περαστεί" στα συστήματα! Η λίστα είναι συγκλονιστική: J.R.R. Tolkien, Ray Bradbury, William Gibson, Orson Scott Card, Philip K. Dick, Margaret Atwood, και άλλα.

Το ερώτημα για το τι υπάρχει στη λίστα ανάγνωσης του GPT-4 είναι κάτι παραπάνω από ακαδημαϊκό. Τα ρομπότ δεν είναι έξυπνα. Δεν καταλαβαίνουν τον κόσμο με κανέναν τρόπο που μπορεί ένας άνθρωπος. Αλλά αν θέλετε να γνωρίσετε κάποιον - ή κάτι, σε αυτήν την περίπτωση - κοιτάξτε το ράφι της βιβλιοθήκης του, έτσι δεν λένε;

Το τι διαβάζει το AI έχει σημασία

Η βάση δεδομένων του GPT-4 είναι τεράστια — μέχρι ένα petabyte, από ορισμένους λογαριασμούς. Έτσι, κανένα μυθιστόρημα (ή ακόμη και 1000 μυθιστορήματα) δεν θα μπορούσε να του διδάξει, κάτι που να ισχύει!

Ο ωκεανός των δεδομένων κατακλύζει τα νησιά της μυθοπλασίας. «Το σύνολο δεδομένων που χρησιμοποιείται στην προεκπαίδευση είναι μια αρκετά μεγάλη επιλογή κειμένου», λέει ο Ted Underwood, επιστήμονας πληροφοριών στο Πανεπιστήμιο του Ιλινόις, «που δεν είμαι σίγουρος πόσο μεγάλη επίδραση έχουν συγκεκριμένες προκαταλήψεις του είδους στη συμπεριφορά των μοντέλων που προκύπτουν...»

Η παρουσία αυτών των συγκεκριμένων βιβλίων στην ψηφιακή ψυχή του GPT-4 μπορεί απλώς να αντανακλά πόσο παρόντα είναι στο γενικό, άγριο διαδίκτυο από το οποίο ελήφθησαν τα δεδομένα.

Όταν η ομάδα του Bamman περιλαμβάνει βιβλία δημόσιου τομέα στις δοκιμές της, οι βαθμολογίες γίνονται υψηλότερες - Η "Αλίκη στη Χώρα των Θαυμάτων" π.χ. βρίσκεται στην κορυφή του πίνακα με το επιβλητικό 98%. Τα chatbots δεν επέλεξαν τα βιβλία τους. Η κουλτούρα του Διαδικτύου το έκανε. Συγκέντρωσαν αρχικά, τα ευπώλητα βιβλία του πλανήτη! 

Ωστόσο, δεν είναι δύσκολο να φανταστεί κανείς ότι όλη αυτή η επιστημονική φαντασία που διάβασαν τα bots θα έχει την ίδια κακή επιρροή σε αυτά με όλα τα άλλα δεδομένα στα οποία εκπαιδεύτηκαν, δημιουργώντας το ίδιο είδος τυχαίας προκατάληψης.

Μερικές φορές λένε ρατσιστικά πράγματα. Μπορεί να ανακεφαλαιώσουν την παραπληροφόρηση σαν να είναι αληθινή επειδή οι ίδιες αναλήθειες εμφανίζονται συχνά στο διαδίκτυο. Αυτοί είναι γνωστοί κίνδυνοι και μέρος του λόγου που το αφεντικό του OpenAI Sam Altman ζήτησε πρόσφατα από το Κογκρέσο να ρυθμίσει την επιχείρησή του.

«Οι πηγές στις οποίες έχουν εκπαιδευτεί αυτά τα μοντέλα θα επηρεάσουν το είδος των μοντέλων που έχουν και τις αξίες που παρουσιάζουν», λέει ο Bamman. Αν το μόνο που διάβαζαν ήταν βιβλία του Cormac McCarthy, προτείνει, μάλλον θα έλεγαν υπαρξιακά ζοφερά και βάναυσα πράγματα. Τι συμβαίνει λοιπόν όταν ένα ρομπότ καταβροχθίζει τη μυθοπλασία για κάθε λογής σκοτεινούς και δυστοπικούς κόσμους γεμάτους με hunger games για παράδειγμα; «Υπάρχει πολλή ενδιαφέρουσα δουλειά που πρέπει να γίνει εκεί. Αλλά δεν νομίζω ότι έχουμε ακόμη την απάντηση σε αυτή την ερώτηση».

ΔΕΙΤΕ ΕΠΙΣΗΣ
ΣΤΗΝ ΙΔΙΑ ΚΑΤΗΓΟΡΙΑ

155.000 γυναίκες ταξίδεψαν για άμβλωση μέσα σε έναν χρόνο – Τι συμβαίνει στις ΗΠΑ

E-Daily 3.Left 25.06.2026
Όταν ένα τεστ εγκυμοσύνης κοστίζει εκατοντάδες δολάρια

Το ελληνικό χωριό που οι κάτοικοι έχουν κυρίως αρχαία ονόματα

E-Daily 3.Left 25.06.2026
Θα νομίζεις ότι γύρισες 2.000 χρόνια πίσω όταν ακούσεις τα ονόματα των κατοίκων

Τι ζητά ένας άνθρωπος όταν ξέρει ότι σε λίγες ώρες θα πεθάνει; Οι τελευταίες παραγγελίες που σοκάρουν

E-Daily 3.Left 25.06.2026
Το τελευταίο γεύμα πριν το τέλος: Τι ζητούν οι μελλοθάνατοι και ποια λέξη εμφανίζεται ξανά και ξανά στις παραγγελίες τους

Ο Γιάννης στους Miami Heat: Ήταν τελικά καλή κίνηση και για τους δυο;

E-Daily 3.Left 25.06.2026
Το « Giannis Culture» συναντά το «Heat Culture»

Η γυναίκα που άλλαξε για πάντα το modelling – Πού βρίσκεται σήμερα η Cheryl Tiegs

E-Daily 3.Left 25.06.2026
Από τα εξώφυλλα του Sports Illustrated στη ζωή μακριά από τα φώτα

Ο πιο καταστροφικός έρωτας της παγκόσμιας λογοτεχνίας

E-Daily 3.Left Χτες
Ο έρωτας που τους έκανε θρύλους και τους οδήγησε στην καταστροφή

Πώς γεννήθηκε η μούντζα; Η πιο γνωστή ελληνική χειρονομία κρύβει μια σκοτεινή ιστορία

E-Daily 3.Left Χτες
Μια κίνηση που χρησιμοποιούμε καθημερινά σχεδόν αυτόματα - πού όμως γεννήθηκε πραγματικά η μούντζα;

Η Γροιλανδία καίγεται: Πώς ξεσπούν φωτιές σε έναν τόπο γεμάτο πάγο και χιόνι

E-Daily 3.Left Χτες
Πώς γίνεται να ξεσπούν φωτιές σε ένα από τα πιο ψυχρά μέρη του πλανήτη

Το μυστήριο με τις κατσίκες στη Βραζιλία: Πώς κατάφεραν να επιβιώσουν για 250 χρόνια σε νησί χωρίς σταγόνα νερού

E-Daily 3.Left Προχτές
Επιστήμονες μελετούν την απίστευτη ανθεκτικότητά τους αφού τις απομάκρυναν από το νησί για την προστασία του τοπικού οικοσυστήματος.

Η ιστορία του «Ξυπόλητου Ληστή» που έκλεβε αεροπλάνα και το FBI κυνηγούσε για δυο χρόνια

E-Daily 3.Left Προχτές
Αυτή είναι η εξωπραγματική, αλλά απόλυτα αληθινή ιστορία του Κόλτον Χάρις-Μουρ