LOL Feed OMG Feed Retro Feed A-List Feed LGBTQI+ Feed
E-Daily

Η μυστική λίστα ανάγνωσης του ChatGPT: Τι «διαβάζει» για να εξελιχτεί

Και τι τελικά, μαθαίνει από αυτή του την εκπαίδευση;

Γράφει η ΔΕΣΠΟΙΝΑ ΠΟΛΥΧΡΟΝΙΔΟΥ Δημοσίευση 2/6/2023 | 00:02

Η μυστική λίστα ανάγνωσης του ChatGPT: Τι «διαβάζει» για να εξελιχτεί
Φωτογραφία από Tara Winstead

Τα ρομπότ δεν είναι έξυπνα. Δεν καταλαβαίνουν τον κόσμο με κανέναν τρόπο που μπορεί ένας άνθρωπος. Το τι διαβάζει το AI έχει σημασία!

Ένας επιστήμονας πληροφοριών στο UC Berkeley, ο David Bamman χρησιμοποιεί υπολογιστές για να αναλύσει και κατανοήσει την τέχνη, κατασκευάζοντας αυτό που αποκαλεί «αλγοριθμικές συσκευές για τον πολιτισμό». Αυτό σημαίνει εξαγωγή δεδομένων από την κλασική λογοτεχνία για να αναλυθούν έπειτα πράγματα όπως, ας πούμε, οι σχέσεις μεταξύ διαφόρων χαρακτήρων του βιβλίου. Σε αυτή την περίπτωση, επρόκειτο να ξεκινήσει με μια ερώτηση που θα ήταν εύκολη για έναν έστω και οριακά εγγράμματο άνθρωπο: Τι σχέση έχουν οι χαρακτήρες μεταξύ τους; Eίναι π.χ. αδέρφια;

O Bamman λοιπόν, αποφάσισε να δοκιμάσει πρώτα να ρωτήσει το ChatGPT. Τι θα συνέβαινε αν τροφοδοτούσε με τις 4.000 λέξεις του «Pride and Prejudice» και έθετε ένα απλό ερώτημα: «Ποιες είναι οι σχέσεις μεταξύ των χαρακτήρων;»

Προς έκπληξή του, λειτούργησε. Η έκδοση GPT-4 του chatbot ήταν εκπληκτικά ακριβής σχετικά με το οικογενειακό δέντρο των Bennet. Στην πραγματικότητα, ήταν σχεδόν σαν να είχε μελετήσει εκ των προτέρων το μυθιστόρημα. «Ήταν τόσο καλό που σήκωσε πολλές κόκκινες σημαίες στο μυαλό μου», λέει ο Bamman. «Είτε ήξερε πολύ καλά το έργο, είτε είχε δει το «Pride and Prejudice» στο Διαδίκτυο ένα εκατομμύριο φορές, και ξέρει πολύ καλά το βιβλίο!».

Το πρόβλημα είναι ότι δεν υπήρχε τρόπος να γνωρίζουμε πώς το GPT-4 ήξερε ό,τι ήξερε. Η εσωτερική λειτουργία των μεγάλων μοντέλων γλώσσας στην καρδιά ενός chatbot είναι ένα μαύρο κουτί.

Τα σύνολα δεδομένων στα οποία εκπαιδεύονται είναι τόσο κρίσιμα για τη λειτουργία τους που οι δημιουργοί τους θεωρούν τις πληροφορίες ως αποκλειστικό μυστικό. Έτσι η ομάδα του Bamman αποφάσισε να γίνουν «αρχαιολόγοι δεδομένων». Για να καταλάβουν τι έχει διαβάσει το GPT-4, του έκαναν κουίζ σχετικά με τις γνώσεις του για διάφορα βιβλία, σαν να ήταν μαθητής. Στη συνέχεια του έδωσαν βαθμολογία για κάθε βιβλίο. Όσο υψηλότερη ήταν η βαθμολογία, τόσο πιο πιθανό ήταν ότι το βιβλίο ήταν μέρος του συνόλου δεδομένων του ρομπότ, όχι απλώς για να βοηθήσει το ρομπότ να δημιουργήσει νέα γλώσσα, αλλά στην πραγματικότητα απομνημονεύτηκε.

Σε μια πρόσφατη ομιλία η ομάδα παρουσίασε τα ευρήματά της. Πολλά από αυτά, όπως θα περίμενε κανείς, είναι τα κλασικά βιβλία: από το "Moby Dick" και το "The Scarlet Letter" μέχρι το "The Grapes of Wrath" και, ναι, το "Pride and Prejudice".

Υπάρχουν ένα σωρό δημοφιλή μυθιστορήματα, από τον Χάρι Πότερ και τον Σέρλοκ Χολμς μέχρι τον «Κώδικα Ντα Βίντσι» και τις «Πενήντα Αποχρώσεις του Γκρι».

Αλλά αυτό που προκαλεί έκπληξη είναι το πόσα βιβλία επιστημονικής φαντασίας και φαντασίας GPT-4 έχουν "περαστεί" στα συστήματα! Η λίστα είναι συγκλονιστική: J.R.R. Tolkien, Ray Bradbury, William Gibson, Orson Scott Card, Philip K. Dick, Margaret Atwood, και άλλα.

Το ερώτημα για το τι υπάρχει στη λίστα ανάγνωσης του GPT-4 είναι κάτι παραπάνω από ακαδημαϊκό. Τα ρομπότ δεν είναι έξυπνα. Δεν καταλαβαίνουν τον κόσμο με κανέναν τρόπο που μπορεί ένας άνθρωπος. Αλλά αν θέλετε να γνωρίσετε κάποιον - ή κάτι, σε αυτήν την περίπτωση - κοιτάξτε το ράφι της βιβλιοθήκης του, έτσι δεν λένε;

Το τι διαβάζει το AI έχει σημασία

Η βάση δεδομένων του GPT-4 είναι τεράστια — μέχρι ένα petabyte, από ορισμένους λογαριασμούς. Έτσι, κανένα μυθιστόρημα (ή ακόμη και 1000 μυθιστορήματα) δεν θα μπορούσε να του διδάξει, κάτι που να ισχύει!

Ο ωκεανός των δεδομένων κατακλύζει τα νησιά της μυθοπλασίας. «Το σύνολο δεδομένων που χρησιμοποιείται στην προεκπαίδευση είναι μια αρκετά μεγάλη επιλογή κειμένου», λέει ο Ted Underwood, επιστήμονας πληροφοριών στο Πανεπιστήμιο του Ιλινόις, «που δεν είμαι σίγουρος πόσο μεγάλη επίδραση έχουν συγκεκριμένες προκαταλήψεις του είδους στη συμπεριφορά των μοντέλων που προκύπτουν...»

Η παρουσία αυτών των συγκεκριμένων βιβλίων στην ψηφιακή ψυχή του GPT-4 μπορεί απλώς να αντανακλά πόσο παρόντα είναι στο γενικό, άγριο διαδίκτυο από το οποίο ελήφθησαν τα δεδομένα.

Όταν η ομάδα του Bamman περιλαμβάνει βιβλία δημόσιου τομέα στις δοκιμές της, οι βαθμολογίες γίνονται υψηλότερες - Η "Αλίκη στη Χώρα των Θαυμάτων" π.χ. βρίσκεται στην κορυφή του πίνακα με το επιβλητικό 98%. Τα chatbots δεν επέλεξαν τα βιβλία τους. Η κουλτούρα του Διαδικτύου το έκανε. Συγκέντρωσαν αρχικά, τα ευπώλητα βιβλία του πλανήτη! 

Ωστόσο, δεν είναι δύσκολο να φανταστεί κανείς ότι όλη αυτή η επιστημονική φαντασία που διάβασαν τα bots θα έχει την ίδια κακή επιρροή σε αυτά με όλα τα άλλα δεδομένα στα οποία εκπαιδεύτηκαν, δημιουργώντας το ίδιο είδος τυχαίας προκατάληψης.

Μερικές φορές λένε ρατσιστικά πράγματα. Μπορεί να ανακεφαλαιώσουν την παραπληροφόρηση σαν να είναι αληθινή επειδή οι ίδιες αναλήθειες εμφανίζονται συχνά στο διαδίκτυο. Αυτοί είναι γνωστοί κίνδυνοι και μέρος του λόγου που το αφεντικό του OpenAI Sam Altman ζήτησε πρόσφατα από το Κογκρέσο να ρυθμίσει την επιχείρησή του.

«Οι πηγές στις οποίες έχουν εκπαιδευτεί αυτά τα μοντέλα θα επηρεάσουν το είδος των μοντέλων που έχουν και τις αξίες που παρουσιάζουν», λέει ο Bamman. Αν το μόνο που διάβαζαν ήταν βιβλία του Cormac McCarthy, προτείνει, μάλλον θα έλεγαν υπαρξιακά ζοφερά και βάναυσα πράγματα. Τι συμβαίνει λοιπόν όταν ένα ρομπότ καταβροχθίζει τη μυθοπλασία για κάθε λογής σκοτεινούς και δυστοπικούς κόσμους γεμάτους με hunger games για παράδειγμα; «Υπάρχει πολλή ενδιαφέρουσα δουλειά που πρέπει να γίνει εκεί. Αλλά δεν νομίζω ότι έχουμε ακόμη την απάντηση σε αυτή την ερώτηση».

ΣΤΗΝ ΙΔΙΑ ΚΑΤΗΓΟΡΙΑ

Ο κόσμος πρέπει να μάθει για το «karoshi», την υπερκόπωση της Ιαπωνίας, πριν να είναι αργά

Κόσμος 28.09.2023
Μια πρόσφατη μελέτη του ΠΟΥ διαπίστωσε ότι οι θάνατοι που σχετίζονται με την εργασία και τα έτη ζωής έχουν αυξηθεί παγκοσμίως

10 φωτογραφίες διάσημων και μη ανθρώπων που έγραψαν ιστορία

Ιστορικά 28.09.2023
Συναρπαστικά ιστορικά κλικ

Η διαφορετική χρήση του Tinder από τους Κινέζους

Κόσμος 28.09.2023
Καλά τα γκομενικά αλλά...

Σήμερα έμαθα: Γιατί τα μυρμήγκια χτίζουν μικρούς αμμόλοφους γύρω από τη φωλιά τους;

Σήμερα έμαθα 28.09.2023
Δεν τους χτίζουν όλα τα είδη μυρμηγκιών

Σαν σήμερα: Το προσχεδιασμένο ατύχημα στη Φόρμουλα 1

Σαν Σήμερα 28.09.2023
Στις 28 Σεπτεμβρίου του 2008

Ο Έλληνας πλοίαρχος που πέταξε 11 λαθρεπιβάτες σε θάλασσα με καρχαρίες

Ιστορικά Χτες
Και όχι δεν έγινε τον Μεσαίωνα, αλλά το 1984

Σήμερα έμαθα: Γιατί οι πλανήτες έχουν ονόματα αρχαίων Ελλήνων θεών;

Σήμερα έμαθα Χτες
Η απάντηση κρύβεται πάλι στην αρχαιότητα

Η χώρα που μπορείς να πιεις μπύρα με τη βασιλική οικογένεια

Παράξενα Χτες
Μερικά πράγματα που δεν ήξερες γι` αυτήν

Ποιος βλέπει ακόμα τηλεόραση και ποιο θα είναι το μέλλον της;

Media Χτες
Θα αφήσουμε πίσω μας τα παραδοσιακά κανάλια;

Σαν σήμερα: Η θεωρία που άλλαξε τον κόσμο

Σαν Σήμερα Χτες
Στις 27 Σεπτεμβρίου του 1905

Ο πιο ευτυχισμένος άνθρωπος στον πλανήτη

Άνθρωποι Προχτές
Τι λέει ο ίδιος

Σήμερα έμαθα: Γιατί μας λένε Greece και όχι Hellas;

Σήμερα έμαθα Προχτές
Η ιστορική ρίζα των δυο ονομασιών