🌐This article has been automatically translated.Read original in English
Πού λαμβάνει το ChatGPT τα δεδομένα του; Πώς το AI βρίσκει και χρησιμοποιεί περιεχόμενο Ιστού
ChatGPTSEO

Πού λαμβάνει το ChatGPT τα δεδομένα του; Πώς το AI βρίσκει και χρησιμοποιεί περιεχόμενο Ιστού

ChatGPTσυχνά ακούγεται σαν να ξέρει τα πάντα.

Απαντά σε τεχνικές ερωτήσεις, συνοψίζει άρθρα, εξηγεί τις τρέχουσες τάσεις και παραθέτει ιστότοπους. Για πολλούς χρήστες, αυτό εγείρει μια απλή αλλά σημαντική ερώτηση.

Πού λαμβάνει πραγματικά το ChatGPT τα δεδομένα του;

Κάποιοι πιστεύουν ότι κάνει αναζήτηση στο Google σε πραγματικό χρόνο.
Άλλοι πιστεύουν ότι ξύνει συνεχώς τον ιστό.
Πολλοί υποθέτουν ότι έχει πρόσβαση σε ιδιωτικές βάσεις δεδομένων.

Καμία από αυτές τις εξηγήσεις δεν είναι απολύτως σωστή.

Το ChatGPT δεν λειτουργεί σαν μηχανή αναζήτησης.Δεν περιηγείται στο Διαδίκτυο από προεπιλογή και δεν έχει άμεση πρόσβαση σε ζωντανούς ιστότοπους, εκτός εάν είναι ενεργοποιημένες συγκεκριμένες λειτουργίες. Αντίθετα, βασίζεται σε δεδομένα εκπαίδευσης, αδειοδοτημένες πηγές και συστήματα ανάκτησης, αντί για παραδοσιακή ανίχνευση.

Η κατανόηση του πώς λειτουργεί αυτή η διαδικασία έχει μεγαλύτερη σημασία από ό,τι αντιλαμβάνονται οι περισσότεροι.

Για τους εκδότες, καθορίζει εάν το περιεχόμενό τους μπορεί να εμφανίζεται στις απαντήσεις AI.
Για τους SEO, εξηγεί γιατί ορισμένες σελίδες αναφέρονται και άλλες αγνοούνται.
Για τους χρήστες, ορίζει τι μπορεί και τι δεν μπορεί να γνωρίζει το ChatGPT.

Σε αυτόν τον οδηγό, θα μάθετε πού λαμβάνει το ChatGPT τα εκπαιδευτικά του δεδομένα, πώς βρίσκει ιστότοπους όταν είναι ενεργοποιημένη η περιήγηση, ποιες πηγές χρησιμοποιεί στην πράξη και πώς αυτό επηρεάζειSEOκαι ορατότητα ιστού.

Στο τέλος, θα έχετε μια σαφή εικόνα για το πώς τα συστήματα AI διαβάζουν πραγματικά τον Ιστό.

Διαβάστε περισσότερα στο:Πώς να ξεκινήσετε μια επιχείρηση εμφιαλωμένου νερού από την αρχή

Πώς λειτουργεί το ChatGPT

where does chatgpt get its data

Το ChatGPT είναι χτισμένο σε ένα τεράστιο μοντέλο γλώσσας εκπαιδευμένο να προβλέπει και να δημιουργεί κείμενο.

Στον πυρήνα του, το σύστημα δεν πραγματοποιεί αναζήτηση στο διαδίκτυο όταν κάνετε μια ερώτηση. Αντίθετα, αναλύει την προτροπή, εξετάζει τα μοτίβα που έμαθε κατά τη διάρκεια της εκπαίδευσης και δημιουργεί την πιο πιθανή σειρά λέξεων με βάση την πιθανότητα και το πλαίσιο.

Αυτό σημαίνει ότι το ChatGPT δεν «αναζητά» απαντήσεις όπως κάνει η Google.

Από προεπιλογή, βασίζεται εξ ολοκλήρου σε όσα γνωρίζει ήδη το μοντέλο.

Εάν το ChatGPT χρειάζεται πολύ χρόνο για τη δημιουργία περιεχομένου, αυτός ο οδηγός εξηγείγιατί το chat gpt είναι τόσο αργό και πώς να το διορθώσετε βήμα προς βήμα.

Προπόνηση εναντίον συμπερασμάτων

Για να κατανοήσετε πού λαμβάνει τα δεδομένα του το ChatGPT, βοηθάει να διαχωριστούν δύο φάσεις: εκπαίδευση και συμπέρασμα.

Η εκπαίδευση είναι η διαδικασία με την οποία ένα μοντέλο μαθαίνει από μεγάλα σύνολα δεδομένων. Αυτό συμβαίνει εκτός σύνδεσης, πριν κάποιος χρήστης αλληλεπιδράσει με το σύστημα. Κατά τη διάρκεια της εκπαίδευσης, το μοντέλο δεν γνωρίζει μεμονωμένους ιστότοπους ή έγγραφα. Μαθαίνει στατιστικές σχέσεις μεταξύ λέξεων, εννοιών και θεμάτων.

Το συμπέρασμα είναι αυτό που συμβαίνει όταν πληκτρολογείτε μια ερώτηση στο ChatGPT.

Εκείνη τη στιγμή, το μοντέλο δεν διαβάζει νέα δεδομένα. Δημιουργεί μια απάντηση με βάση τα μοτίβα που είναι αποθηκευμένα στις παραμέτρους του. Εκτός εάν είναι ενεργοποιημένες οι λειτουργίες περιήγησης ή ανάκτησης, το σύστημα δεν έχει πρόσβαση σε ζωντανούς ιστότοπους και δεν έχει επίγνωση γεγονότων πέρα ​​από το όριο εκπαίδευσης.

Αυτή η διάκριση εξηγεί πολλές κοινές παρανοήσεις.

Στατική γνώση και ημερομηνίες αποκοπής

Κάθε έκδοση του ChatGPT έχει ένα όριο γνώσης.

Αυτή η αποκοπή σηματοδοτεί το τελευταίο σημείο στα δεδομένα εκπαίδευσης του μοντέλου. Οι πληροφορίες που δημιουργούνται μετά από αυτήν την ημερομηνία δεν αποτελούν μέρος των γνώσεων του μοντέλου, εκτός εάν χρησιμοποιούνται χαρακτηριστικά ανάκτησης.

Όταν το ChatGPT απαντά σε μια ερώτηση σχετικά με πρόσφατα συμβάντα χωρίς να είναι ενεργοποιημένη η περιήγηση, συχνά κάνει εικασίες με βάση γενικά μοτίβα αντί για πρόσβαση σε πραγματικά δεδομένα. Αυτός είναι ο λόγος που το σύστημα παράγει μερικές φορές ξεπερασμένες ή εσφαλμένες πληροφορίες σχετικά με τρέχοντα θέματα.

Το μοντέλο δεν μπορεί να ενημερωθεί σε πραγματικό χρόνο.

Όταν το ChatGPT χρησιμοποιεί ζωντανά δεδομένα

Το ChatGPT χρησιμοποιεί ζωντανά δεδομένα μόνο όταν είναι ενεργοποιημένα συγκεκριμένα εργαλεία.

Δυνατότητες όπως η περιήγηση, η αναζήτηση στον ιστό ή οι προσθήκες ανάκτησης επιτρέπουν στο σύστημα να αναζητά εξωτερικά ευρετήρια, να ανακτά έγγραφα και να ενσωματώνει αυτές τις πληροφορίες στις απαντήσεις του. Σε αυτές τις περιπτώσεις, το ChatGPT λειτουργεί περισσότερο σαν διεπαφή αναζήτησης με τεχνητή νοημοσύνη παρά σαν αυτόνομο μοντέλο γλώσσας.

Χωρίς αυτά τα εργαλεία, το ChatGPT δεν επισκέπτεται ποτέ ιστότοπους.

Δεν ανιχνεύει σελίδες.
Δεν ελέγχει το Google.
Δεν διαβάζει νέα άρθρα.

Όλα όσα παράγει προέρχονται από τις εκπαιδευμένες παραμέτρους του.

Γιατί αυτό έχει σημασία για τις πηγές δεδομένων

Αυτός ο σχεδιασμός εξηγεί ένα σημαντικό σημείο.

Το ChatGPT δεν διαθέτει βάση δεδομένων ιστότοπων.
Δεν αποθηκεύει αντίγραφα μεμονωμένων σελίδων.
Δεν θυμάται συγκεκριμένα άρθρα.

Κατά τη διάρκεια της εκπαίδευσης, μαθαίνει γλωσσικά μοτίβα παρά έγγραφα.

Όταν είναι ενεργοποιημένη η ανάκτηση, αποκτά προσωρινή πρόσβαση σε εξωτερικές πηγές, αλλά δεν αποθηκεύει αυτό τ�� περιεχόμενο στο μοντέλο.

Η κατανόηση αυτού του διαχωρισμού μεταξύ της γνώσης εκπαίδευσης και της ζωντανής ανάκτησης είναι το κλειδί για την κατανόηση από πού προέρχονται τα δεδομένα του ChatGPT και πώς οι εκδότες μπορούν να επηρεάσουν την προβολή.

Τι είναι τα Training Data του ChatGPT;

where does chatgpt get its data

Οι βασικές γνώσεις του ChatGPT προέρχονται από τα δεδομένα στα οποία εκπαιδεύτηκε.

Κατά τη διάρκεια της εκπαίδευσης, το μοντέλο εκτίθεται σε μεγάλες συλλογές κειμένων για να μάθει πώς λειτουργεί η γλώσσα και πώς σχετίζονται οι έννοιες μεταξύ τους. Αυτή η εκπαίδευση δεν περιλαμβάνει απομνημόνευση μεμονωμένων ιστοσελίδων. Αντίθετα, το σύστημα μαθαίνει στατιστικά μοτίβα που του επιτρέπουν να δημιουργεί συνεκτικές, σχετικές απαντήσεις αργότερα.

Το OpenAI έχει δηλώσει δημόσια ότι το ChatGPT εκπαιδεύεται σε ένα μείγμα αδειοδοτημένων δεδομένων, δεδομένων που δημιουργούνται από ανθρώπινους εκπαιδευτές και δημοσίως διαθέσιμου κειμένου.

Αυτός ο συνδυασμός ορίζει σχεδόν όλα όσα γνωρίζει το μοντέλο.

Δημόσια δεδομένα Ιστού

Ένα σημαντικό μέρος των δεδομένων εκπαίδευσης του ChatGPT προέρχεται από δημόσια διαθέσιμο διαδικτυακό περιεχόμενο.

Αυτό περιλαμβάνει ιστότοπους, ιστολόγια, φόρουμ, σελίδες τεκμηρίωσης, άρθρα και υλικό αναφοράς που είναι προσβάσιμα χωρίς έλεγχο ταυτότητας ή τοιχώματα πληρωμής. Ο στόχος δεν είναι να αντιγράψουμε αυτές τις πηγές αλλά να μάθουμε γλωσσικά μοτίβα, γεγονότα και σχέσεις μεταξύ των εννοιών.

Είναι σημαντικό ότι το μοντέλο δεν διατηρεί άμεση πρόσβαση σε αυτούς τους ιστότοπους μετά την εκπαίδευση.

Δεν αποθηκεύει διευθύνσεις URL.
Δεν διατηρεί αντίγραφα σελίδων.
Δεν μπορε�� να ανακτήσει συγκεκριμένα έγγραφα.

Η εκπαιδευτική διαδικασία διδάσκει στο μοντέλο πώς συμπεριφέρεται η γλώσσα, όχι από πού προήλθε αρχικά κάθε πληροφορία.

Αδειοδοτημένα δεδομένα και συνεργασίες εκδοτών

Εκτός από τα δημόσια δεδομένα, το OpenAI χρησιμοποιεί αδειοδοτημένα σύνολα δεδομένων.

Αυτά περιλαμβάνουν περιεχόμενο από εκδότες, προμηθευτές δεδομένων και συνεργάτες βάσει εμπορικών συμφωνιών. Τα δεδομένα με άδεια είναι ολοένα και πιο σημαντικά καθώς αυξάνονται οι κανονισμοί και οι εκδότες απαιτούν μεγαλύτερο έλεγχο σχετικά με τον τρόπο χρήσης του περιεχομένου τους.

Αυτός είναι ένας λόγος που πολλές απαντήσεις υψηλής ποιότητας προέρχονται πλέον από πηγέ�� με επίσημες ρυθμίσεις αδειοδότησης και όχι από ανοιχτή απόξεση.

Τα αδειοδοτημένα δεδομένα επιτρέπουν στις πλατφόρμες τεχνητής νοημοσύνης να έχουν πρόσβαση σε αξιόπιστο περιεχόμενο υψηλής εξουσιοδότησης, ενώ παράλληλα μειώνουν τον νομικό κίνδυνο.

Δεδομένα εκπαίδευσης που δημιουργήθηκαν από τον άνθρωπο

Ένα άλλο σημαντικό μέρος της εκπαίδευσης του ChatGPT προέρχεται από εκπαιδευτές ανθρώπων.

Αυτά περιλαμβάνουν επιμελημένα παραδείγματα, σχολιασμένες συνομιλίες, ζεύγη ερωτήσεων και απαντήσεων και σχόλια που χρησιμοποιούνται για να διδάξουν το μοντέλο να απαντά με ασφάλεια και ακρίβεια. Τα ανθρώπινα δεδομένα είναι σημαντικά για τη βελτίωση της συλλογιστικής, της κλίσης και της ευθυγράμμισης με τις προσδοκίες των χρηστών.

Αυτό το επίπεδο εξηγεί γιατί το ChatGPT μπορεί να ακολουθεί οδηγίες, να προσαρμόζεται σε διαφορετικά στυλ γραφής και να αποφεύγει πολλές μη ασφαλείς εξόδους.

Δεν εκπαιδεύεται μόνο σε ακατέργαστο κείμενο ιστού.

Εκπαιδεύεται στην καθοδηγούμενη ανθρώπινη συμπεριφορά.

Σε τι δεν εκπαιδεύεται το ChatGPT

Ένας από τους πιο επίμονους μύθους είναι ότι το ChatGPT εκπαιδεύεται σε προσωπικά δεδομένα.

Δεν λειτουργεί έτσι το σύστημα.

Το ChatGPT δεν έχει πρόσβαση σε ιδιωτικά μηνύματα ηλεκτρονικού ταχυδρομείου, προσωπικά έγγραφα, βάσεις δεδομένων πελατών ή περιεχόμενο που προστατεύεται με κωδικό πρόσβασης, εκτός εάν αυτά τα δεδομένα έχουν ρητή άδεια χρήσης ή παρέχονται εθελοντικά για εκπαίδευση.

Δεν σαρώνει λογαριασμούς χρηστών.
Δεν διαβάζει ιδιωτικούς ιστότοπους.
Δεν έχει πρόσβαση στα εσωτερικά συστήματα της εταιρείας.

Τα δεδομένα εκπαίδευσης συλλέγονται από εγκεκριμένες πηγές και όχι από ιδιωτικές πληροφορίες μεμονωμένων χρηστών.

Γιατί τα δεδομένα εκπαίδευσης δεν ισοδυναμούν με τη ζωντανή γνώση

Μια άλλη κοινή παρεξήγηση είναι ότι τα δεδομένα εκπαίδευσης παρέχουν στο ChatGPT μόνιμη πρόσβαση σε ιστότοπους.

Δεν το κάνει.

Μόλις τελειώσει η εκπαίδευση, η γνώση του μοντέλου γίνεται στατική. Δεν μπορεί να ανανεωθεί, να ελέγξει αν έχουν αλλάξει οι πληροφορίες ή να επισκεφτεί ξανά πηγές.

Αυτός είναι ο λόγος για τον οποίο υπάρχουν περικοπές γνώσης.

Οτιδήποτε δημοσιεύεται μετά την ημερομηνία λήξης δεν είναι ορατό στο μοντέλο, εκτός εάν είναι ενεργοποιημένα τα εργαλεία ζωντανής ανάκτησης.

Αυτή η διάκριση εξηγεί γιατί το ChatGPT μπορεί να απαντήσει καλά σε ιστορικά ερωτήματα, αλλά συχνά παλεύει με τις πρόσφατες εξελίξεις, εκτός εάν είναι ενεργοποιημένη η περιήγηση.

Τι σημαίνει αυτό για εκδότες και SEO

Από την άποψη του SEO, τα δεδομένα εκπαίδευσης δεν είναι κάτι που μπορείτε να βελτιστοποιήσετε άμεσα.

Δεν μπορείτε να υποβάλετε τον ιστότοπό σας για εκπαίδευση.
Δεν μπορείτε να επιβάλετε την ένταξη.
Δεν μπορείτε να επηρεάσετε τα βάρη των μοντέλων μόνο με τη δημοσίευση.

Η ορατότητα στις απαντήσεις AI σήμερα προέρχεται πολύ περισσότερο από συστήματα ανάκτησης και αναφορές παρά από δεδομένα εκπαίδευσης.

Η εκπαίδευση καθορίζει πώς το μοντέλο κατανοεί τη γλώσσα.

Η ανάκτηση καθορίζει ποιοι ιστότοποι εμφανίζονται.

Αυτή η διαφορά γίνεται κρίσιμη στην επόμενη ενότητα.

Το ChatGPT ανιχνεύει τον Ιστό σε πραγματικό χρόνο;

where does chatgpt get its data

Από προεπιλογή, το ChatGPT δεν ανιχνεύει τον ιστό σε πραγματικό χρόνο.

Αυτή είναι μια από τις πιο παρεξηγημένες πτυχές του τρόπου λειτουργίας του συστήματος. Όταν κάνετε μια ερώτηση στο ChatGPT, δεν ανοίγει ένα πρόγραμμα περιήγησης, δεν σαρώνει ιστότοπους ή ανακτά νέες σελίδες, εκτός εάν είναι ενεργοποιημένη μια δυνατότητα περιήγησης ή ανάκτησης.

Στην τυπική του λειτουργία, το ChatGPT βασίζεται εξ ολοκλήρου στις εκπαιδευμένες γνώσεις του και στο εσωτερικό του γλωσσικό μοντέλο. Δημιουργεί απαντήσεις με βάση τα μοτίβα που έμαθε κατά τη διάρκεια της εκπαίδευσης, όχι με την αναζήτηση στο διαδίκτυο.

Αυτό σημαίνει ότι οι περισσότερες συνεδρίες ChatGPT είναι εντελώς εκτός σύνδεσης από τον ιστό.

Γιατί το ChatGPT δεν είναι πρόγραμμα ανίχνευσης ιστού

Το ChatGPT δεν σχεδιάστηκε για να λειτουργεί ως ανιχνευτής.

Οι μηχανές αναζήτησης λειτουργούν τεράστιες υποδομές ανίχνευσης που σαρώνουν δισεκατομμύρια σελίδες, ενημερώνουν ευρετήρια και παρακολουθούν τις αλλαγές στον ιστό. Το βασικό μοντέλο του ChatGPT δεν κάνει τίποτα από αυτά. Δεν έχει ενσωματωμένο σύστημα ανίχνευσης και δεν έχει σύνδεση με ζωντανούς ιστότοπους.

Χωρίς ενεργοποιημένη την περιήγηση, το ChatGPT δεν μπορεί να δει:

Νέα άρθρα
Ενημερωμένες σελίδες
Έκτακτες ειδήσεις
Πρόσφατη δημοσιευμένη έρευνα

Δεν γνωρίζει τίποτα που δημοσιεύτηκε μετά την εκπαίδευσή της.

Αυτός είναι ο λόγος που το σύστημα λέει τακτικά ότι ενδέχεται να μην έχει πρόσβαση στις τρέχουσες πληροφορίες.

Τι συμβαίνει όταν η περιήγηση είναι ενεργοποιημένη

Το ChatGPT έχει πρόσβαση σε ζωντανά δεδομένα ιστού μόνο όταν είναι ενεργοποιημένες οι λειτουργίες περιήγησης ή ανάκτησης.

Σε αυτές τις λειτουργίες, το σύστημα στέλνει ερωτήματα σε ένα εξωτερικό ευρετήριο αναζήτησης, ανακτά ένα μικρό σύνολο σχετικών εγγράφων και, στη συνέχεια, δημιουργεί μια απάντηση με βάση αυτές τις πηγές. Συμπεριφέρεται περισσότερο σαν διεπαφή αναζήτησης με τεχνητή νοημοσύνη παρά σαν αυτόνομο μοντέλο γλώσσας.

Είναι σημαντικό, ακόμη και στη λειτουργία περιήγησης, το ChatGPT δεν ανιχνεύει τον ίδιο τον ιστό.

Δεν εκτελεί το δικό του πρόγραμμα ανίχνευσης ιστού.

Αντίθετα, βασίζεται σε ευρετήρια τρίτων και συνεργαζόμενες μηχανές αναζήτησης, συνηθέστερα στο Bing, για την παροχή υποψήφιων σελίδων.

Το ChatGPT δεν σαρώνει ποτέ απευθείας τον ανοιχτό ιστό.

Η ανάκτηση δεν είναι ίδια με την ανίχνευση

Αυτή η διάκριση έχει σημασία.

Ανίχνευση σημαίνει συνεχής ανακάλυψη και ευρετηρίαση σελίδων σε κλίμακα. Ανάκτηση σημαίνει την επιλογή μερικών εγγράφων από ένα υπάρχον ευρετήριο για να απαντήσετε σε μια ερώτηση.

Το ChatGPT εκτελεί ανάκτηση, όχι ανίχνευση.

Όταν η περιήγηση είναι ενεργοποιημένη, ζητά από ένα εξωτερικό σύστημα σχετικές σελίδες, διαβάζει έναν περιορισμένο αριθμό από αυτές και εξάγει αποσπάσματα για να δημιουργήσει μια απάντηση. Δεν προσθέτει αυτές τις σελίδες σε ένα ευρετήριο ούτε τις επισκέπτεται ξανά αργότερα, εκτός εάν κάποιο άλλο ερώτημα χρήστη ενεργοποιήσει ξανά την ανάκτηση.

Αυτός είναι ο λόγος που το ChatGPT δεν μπορεί να δημιουργήσει τη δική του βάση δεδομένων με δυνατότητα αναζήτησης στον ιστό.

Γιατί αυτό έχει σημασία για το SEO και τους εκδότες

Αυτή η αρχιτεκτονική εξηγεί μια σημαντική πραγματικότητα.

Αν σαςιστοσελίδαδεν έχει ευρετηριαστεί σε μεγάλες μηχανές αναζήτησης, το ChatGPT δεν θα το βρει ποτέ μέσω της περιήγησης.

Το σύστημα δεν μπορεί να ανακαλύψει νέες σελίδες από μόνο του.

Μπορεί να ανακτήσει μόνο περιεχόμενο που υπάρχει ήδη σε ευρετήρια μηχανών αναζήτησης ή σε πηγές δεδομένων με άδεια χρήσης.

Αυτός είναι ο λόγος για τον οποίο το παραδοσιακό SEO εξακολουθεί να διαμορφώνει την ορατότητα της τεχνητής νοημοσύνης.

Η ευρετηρίαση, η ανίχνευση, η αρχή και η κατάταξη παραμένουν το σημείο εισόδου για τη�� ανάκτηση τεχνητής νοημοσύνης.

Η κοινή παρανόηση για το «ξύσιμο»

Πολλοί άνθρωποι πιστεύουν ότι το ChatGPT ξύνει συνεχώς ιστότοπους στο παρασκήνιο.

Δεν λειτουργεί έτσι το σύστημα.

Τα δεδομένα εκπαίδευσης μπορεί να περιλαμβάνουν μεγάλα σύνολα δεδομένων ιστού που έχουν συλλεχθεί στο παρελθόν, αλλά οι ζωντανές συνεδρίες ChatGPT δεν διαγράφουν το διαδίκτυο. Δεν υπάρχει συνεχής ανίχνευση ή αυτόματη συλλογή νέου περιεχομένου.

Όλη η ζωντανή πρόσβαση γίνεται μέσω ελεγχόμενων συστημάτων ανάκτησης.

The Practical Takeaway

Το ChatGPT δεν ανιχνεύει τον ιστό σε πραγματικό χρόνο.

Έχει πρόσβαση σε ζωντανά δεδομένα μόνο όταν είναι ενεργοποιημένη η περιήγηση, και ακόμη και τότε, βασίζεται σε εξωτερικά ευρετήρια αναζήτησης και όχι σε δικό του πρόγραμμα ανίχνευσης.

Για εκδότες και SEO, αυτό σημαίνει ότι ένα πράγμα εξακολουθεί να ισχύει.

Εάν θέλετε το ChatGPT να βρει το περιεχόμενό σας, πρέπει πρώτα να το κάνετε ορατό στις μηχανές αναζήτησης.

Πώς το ChatGPT βρίσκει ιστότοπους όταν είναι ενεργοποιημένη η περιήγηση

Όταν η περιήγηση είναι ενεργοποιημένη, το ChatGPT δεν γίνεται ξαφνικά μηχανή αναζήτησης.

Δεν ανιχνεύει τον ανοιχτό ιστό, δεν διατηρεί το δικό του ευρετήριο ή δεν κατατάσσει ιστότοπους ανεξάρτητα. Αντίθετα, συνδέεται με ένα εξωτερικό σύστημα ανάκτησης που έχει ήδη κάνει αυτή τη δουλειά.

Στις περισσότερες περιπτώσεις, αυτό το σύστημα τροφοδοτείται απόΕυρετήριο αναζήτησης του Bing.

Αυτό σημαίνει ότι η ικανότητα του ChatGPT να βρίσκει τον ιστότοπό σας εξαρτάται σχεδόν εξ ολοκλήρου από το αν οι σελίδες σας είναι ανιχνεύσιμες και ορατές στις παραδοσιακές μηχανές αναζήτησης.

The Retrieval Pipeline Behind Browsing

Όταν ένας χρήστης κάνει μια ερώτηση με ενεργοποιημένη την περιήγηση, το ChatGPT μετατρέπει πρώτα αυτήν την ερώτηση σε ένα ή περισσότερα ερωτήματα αναζήτησης.

Αυτά τα ερωτήματα αποστέλλονται σε μια εξωτερική υπηρεσία αναζήτησης, η οποία επιστρέφει μια λίστα υποψηφίων εγγράφων. Αυτά τα έγγραφα προέρχονται από ένα ευρετήριο ιστού που έχει ανιχνεύσει, επεξεργαστεί και κατατάξει δισεκατομμύρια σελίδες.

Στη συνέχεια, το ChatGPT λαμβάνει ένα μικρό υποσύνολο αυτών των αποτελεσμάτων.

Δεν βλέπει το πλήρες ευρετήριο.
Δεν σαρώνει εκατοντάδες σελίδες.
Συνήθως λειτουργεί με μια περιορισμένη ομάδα εγγράφων κορυφαίας κατάταξης.

Από αυτό το μικρό σύνολο, το σύστημα διαβάζει αποσπάσματα, αξιολογεί τη συνάφεια και επιλέγει τα κομμάτια κειμένου που απαντούν καλύτερα στην ερώτηση.

Μόνο μετά από αυτήν την επιλογή το ChatGPT παράγει μια απάντηση.

Γιατί το Bing έχει μεγαλύτερη σημασία από τ�� Google εδώ

Το ChatGPT δεν έχει άμεση πρόσβαση στο ευρετήριο της Google.

Οι δυνατότητες περιήγησης και ανάκτησής του είναι χτισμένες κυρίως στην υποδομή της Microsoft, πράγμα που σημαίνει ότι το Bing διαδραματίζει κεντρικό ρόλο στον οποίο μπορούν να δουν οι ιστότοποι ChatGPT.

Εάν ο ιστότοπός σας κατατάσσεται καλά στο Bing, έχει πολύ μεγαλύτερες πιθανότητες να εμφανιστεί στις απαντήσεις ChatGPT.

Εάν ο ιστότοπός σας δεν έχει ευρετηριαστεί στο Bing ή έχει κακή απόδοση εκεί, το ChatGPT είναι απίθανο να τον ανακτήσει καθόλου, ακόμα κι αν βρίσκεται σε καλή θέση στο Google.

Αυτό είναι ένα παραγνωρισμένο αλλά κρίσιμο σημείο για τους SEO.

Η ορατότητα του AI εξαρτάται από περισσότερα από την Google.

Η κατάταξη εξακολουθεί να γίνεται προτού το AI δει το περιεχόμενό σας

Το ChatGPT δεν επιλέγει ελεύθερα πηγές.

Προτού το μοντέλο δει ποτέ μια σελίδα, η εξωτερική μηχανή αναζήτησης την έχει ήδη κατατάξει χρησιμοποιώντας παραδοσιακά σήματα SEO, όπως συνάφεια, backlinks, εξουσία, φρεσκάδα και αφοσίωση.

Το ChatGPT λειτουργεί μόνο με τις σελίδες που επιβιώνουν αυτής της διαδικασίας κατάταξης.

Αυτό εξηγεί γιατί οι αναφορές AI συχνά αντικατοπτρίζουν κορυφαία αποτελέσματα αναζήτησης.

Το σύστημα δεν παρακάμπτει το SEO.

Είναι χτισμένο πάνω του.

Επιλογή αποσπάσματος και δημιουργία απαντήσεων

Μόλις το ChatGPT λάβει ένα μικρό σύνολο υποψήφιων σελίδων, δεν τις επαναχρησιμοποιεί τυφλά.

Σαρώνει το περιεχόμενο, προσδιορίζει τα πιο σχετικά αποσπάσματα και εξάγει τις ενότητες που απαντούν άμεσα στην ερώτηση του χρήστη. Αυτά τα αποσπάσματα γίνονται η πρώτη ύλη για την τελική απάντηση.

Στη συνέχεια, το σύστημα ξαναγράφει, συνοψίζει και συνδυάζει αυτά τα αποσπάσματα σε φυσική γλώσσα.

Μερικές φορές εμφανίζει ρητές παραπομπές.
Μερικές φορές παραφράζει χωρίς συνδέσμους.

Αλλά σε κάθε περίπτωση, μόνο λίγες πηγές επηρεάζουν την τελική απάντηση.

Γιατί η δομή και η σαφήνεια έχουν σημασία

Αυτή η διαδικασία ανάκτησης εξηγεί γιατί η δομή περιεχομένου είναι τόσο σημαντική για την ορατότητα της τεχνητής νοημοσύνης.

Σελίδες που ορίζουν με σαφήνεια έννοιες, χρησιμοποιούν ισχυρές επικεφαλίδες και τοποθετούν απαντήσεις νωρίς στις ενότητες είναι ευκολότερο να εξαχθούν από τα συστήματα ανάκτησης.

Οι μεγάλες, μη εστιασμένες σελίδες με ασαφή γλώσσα συχνά παραλείπονται, ακόμα κι αν κατατάσσονται αρκετά καλά.

Τα συστήματα AI προτιμούν περιεχόμενο που είναι:

Εύκολη τμηματοποίηση.
Με επίκεντρο τα γεγονότα.
Ξεκάθαρα γραμμένο.
Λογικά δομημένο.

Αυτό είναι ένα από τα θεμέλια του LLM SEO.

Οι πρακτικές συνέπειες για τους SEO

Εάν θέλετε το ChatGPT να βρει τον ιστότοπό σας, πρέπει πρώτα να κερδίσετε την προβολή στα παραδοσιακά συστήματα αναζήτησης.

Η ευρετηρίαση σε θέματα Bing.
Η εξουσία εξακολουθεί να έχει σημασία.
Οι σύνδεσμοι εξακολουθούν να έχουν σημασία.
Το τεχνικό SEO εξακολουθεί να έχει σημασία.

Το ChatGPT δεν αντικαθιστά τις μηχανές αναζήτησης.

Εξαρτάται από αυτούς.

Ποιες πηγές δεδομένων χρησιμοποιεί το ChatGPT;

Το ChatGPT δεν βασίζεται σε μία μόνο πηγή δεδομένων.

Αντίθετα, λειτουργεί σε ένα πολυεπίπεδο σύστημα που συνδυάζει δεδομένα εκπαίδευσης, περιεχόμενο με άδεια χρήσης και ζωντανή ανάκτηση από εξωτερικά ευρετήρια αναζήτησης όταν είναι ενεργοποιημένη η περιήγηση. Κάθε επίπεδο παίζει ρόλο στον τρόπο με τον οποίο το σύστημα δημιουργεί απαντήσεις.

Η γνώση αυτών των πηγών βοηθά να εξηγήσουμε γιατί ορισμένες απαντήσεις είναι λεπτομερείς και ακριβείς ενώ άλλες είναι ασαφείς, ξεπερασμένες ή λείπουν αναφορές.

Training Data as the Foundation

Η πρώτη και πιο σημαντική πηγή είναι τα δεδομένα εκπαίδευσης.

Αυτό περιλαμβάνει ένα μείγμα δημοσίως διαθέσιμου περιεχομένου ιστού, συνόλων δεδομένων με άδεια χρήσης και υλικού που δημιουργήθηκε από εκπαιδευτές. Αυτά τα δεδομένα διδάσκουν στο μοντέλο πώς λειτουργεί η γλώσσα, πώς σχετίζονται οι έννοιες και πώς να δημιουργεί απαντήσεις.

Ωστόσο, τα δεδομένα εκπαίδευσης δεν λειτουργούν ως βάση δεδομένων με δυνατότητα αναζήτησης.

Το ChatGPT δεν αποθηκεύει άρθρα, διευθύνσεις URL ή έγγραφα με τρόπο που μπορεί να ανακτήσει αργότερα. Αποθηκεύει μόνο μαθημένα μοτίβα. Όταν το μοντέλο απαντά σε μια ερώτησ�� χρησιμοποιώντας δεδομένα εκπαίδευσης, δεν αναφέρει πηγή. Δημιουργεί κείμενο με βάση τις πιθανότητες και τις γενικές γνώσεις που αποκτήθηκαν κατά τη διάρκεια της εκπαίδευσης.

Αυτός είναι ο λόγος που τα δεδομένα εκπαίδευσης καθορίζουν τι κατανοεί το μοντέλο, αλλά όχι τι μπορεί να αναφέρει.

Δεδομένα αδειοδοτημένου εκδότη και συνεργασίες

Μια δεύτερη σημαντική πηγή προέρχεται από περιεχόμενο με άδεια χρήσης.

Το OpenAI και άλλες πλατφόρμες τεχνητής νοημοσύνης διατηρούν συνεργασίες με εκδότες, παρόχους δεδομένων και εμπορικούς συνεργάτες που παρέχουν επιλεγμένα σύνολα δεδομένων στο πλαίσιο επίσημων συμφωνιών. Αυτές οι πηγές είναι συχνά υψηλής ποιότητας, έγκυρες και νομικά ασφαλείς για επαναχρησιμοποίηση.

Τα αδειοδοτημένα δεδομένα διαδραματίζουν πιο σημαντικό ρόλο στα συστήματα τεχνητής νοημοσύνης επειδή μειώνουν τον νομικό κίνδυνο και βελτιώνουν την αξιοπιστία των απαντήσεων. Πολλές απαντήσεις ειδήσεων, χρηματοδότησης και έρευνας εξαρτώνται πλέον από αυτές τις αδειοδοτημένες ροές και όχι από την ανοιχτή απόξεση ιστού.

Αυτό το επίπεδο εξηγεί επίσης γιατί ορισμένοι εκδότες εμφανίζονται συχνά σε απαντήσεις τεχνητής νοημοσύνης ενώ άλλοι δεν εμφανίζονται ποτέ καθόλου.

Ευρετήρια μηχανών αναζήτησης για ζωντανή ανάκτηση

Όταν είναι ενεργοποιημένες οι λειτουργίες περιήγησης ή ανάκτησης, το ChatGPT έχει πρόσβαση σε ζωντανά δεδομένα μέσω εξωτερικών ευρετηρίων μηχανών αναζήτησης.

Στις περισσότερες περιπτώσεις, αυτό σημαίνει Bing.

Το ChatGPT στέλνει ένα ερώτημα στο σύστημα αναζήτησης, λαμβάνει ένα μικρό σύνολο εγγράφων κατάταξης και διαβάζει μόνο αυτές τις σελίδες. Αυτά τα έγγραφα γίνονται η βάση για παραπομπές και παραπομπές στην τελική απάντηση.

Αυτό το επίπεδο ανάκτησης είναι υπεύθυνο για σχεδόν όλες τις ορατές αναφορές στο ChatGPT, το Perplexity και παρόμοια εργαλεία.

Εάν μια σελίδα δεν έχει ευρετηριαστεί στο Bing ή δεν κατατάσσεται καλά εκεί, είναι ουσιαστικά αόρατη στο σύστημα περιήγησης του ChatGPT.

Ιδιόκτητα και εσωτερικά σύνολα δεδομένων

Εκτός από δημόσιες και αδειοδοτημένες πηγές, τα συστήματα τεχνητής νοημοσύνης χρησιμοποιούν επίσης ιδιόκτητα σύνολα δεδομένων.

Αυτά περιλαμβάνουν επιμελημένες βάσεις γνώσεων, δεδομένα εσωτερικής αξιολόγησης, εκπαιδευτικό υλικό ασφάλειας και δομημένα σύνολα δεδομένων που έχουν σχεδιαστεί για τη βελτίωση της συλλογι��τικής, της ακρίβειας και της ευθυγράμμισης. Αυτά τα δεδομένα δεν είναι δημόσια και δεν συνδέονται με συγκεκριμένους ιστότοπους.

Αυτές οι εσωτερικές πηγές διαμορφώνουν τον τρόπο συμπεριφοράς του μοντέλου, αλλά σπάνια επηρεάζουν τους ιστότοπους που αναφέρονται.

Γιατί δεν υπάρχει εν��αία "βάση δεδομένων ChatGPT"

Μία από τις μεγαλύτερες παρερμηνείες είναι ότι το ChatGPT έχει μια κεντρική βάση δεδομένων με ιστοσελίδες.

Δεν το κάνει.

Δεν υπάρχει κύρια λίστα πηγών.
Το μοντέλο δεν διατηρεί μόνιμο δείκτη.
Δεν υπάρχει μνήμη μεμονωμένων άρθρων.

Αντίθετα, το ChatGPT συνδυάζει γνώσεις στατικής εκπαίδευσης με δυναμική ανάκτηση όταν χρειάζεται.

Αυτή η αρχιτεκτονική εξηγεί γιατί οι παραπομπές εμφανίζονται μόνο όταν είναι ενεργοποιημένη η περιήγηση και γιατί η ορατότητα εξαρτάται σε μεγάλο βαθμό από την ευρετηρίαση και την εξουσία της μηχανής αναζήτησης.

Τι σημαίνει αυτό για τους ιδιοκτήτες ιστοτόπων

Για τους εκδότες και τους SEO, αυτή η δομή έχει μια σαφή επίπτωση.

Τα δεδομένα προπόνησης δεν είναι κάτι που μπορείτε να επηρεάσετε άμεσα.

Τα αδειοδοτημένα δεδομένα χρειάζονται επίσημες συνεργασίες.

Η ζωντανή ανάκτηση εξαρτάται σχεδόν εξ ολοκλήρου από την ορατότητα της μηχανής αναζήτησης.

Εάν το περιεχόμενό σας δεν κατατάσσεται στις μηχανές αναζήτησης και δεν αποτελεί μέρος ενός συνόλου δεδομένων με άδεια, το ChatGPT δεν μπορεί να το ανακαλύψει ή να το επαναχρησιμοποιήσει.

Το ChatGPT χρησιμοποιεί δεδομένα Google;

where does chatgpt get its data

Το ChatGPT δεν έχει άμεση πρόσβαση στα δεδομένα της Google.

Δεν ρωτά την Αναζήτηση Google, δεν διαβάζει το ευρετήριο της Google ή δεν χρησιμοποιεί τα συστήματα κατάταξης της Google για την επιλογή πηγών. Δεν υπάρχει ζωντανή σύνδεση μεταξύ του ChatGPT και της υποδομής της Google.

Αυτό το σημείο είναι σημαντικό επειδή πολλοί άνθρωποι υποθέτουν ότι το ChatGPT είναι απλώς μια νέα διεπαφή πάνω από το Google.

Δεν είναι.

Γιατί υπάρχει αυτή η σύγχυση

Η σύγχυση προέρχεται από το πώς οι απαντήσεις AI μοιάζουν με τα αποτελέσματα αναζήτησης.

Το ChatGPT συχνά επιστρέφει ακριβείς πληροφορίες, παραπέμπει σε γνωστούς ιστότοπους και μερικές φορές παραθέτει πηγές που κατατάσσονται επίσης στο Google. Αυτό δημιουργεί την εντύπωση ότι το σύστημα πρέπει να αντλεί δεδομένα απευθείας από την Google.

Στην πραγματικότητα, και τα δύο συστήματα αντλούν συχνά από τον ίδιο ανοιχτό ιστό.

Όταν δύο ανεξάρτητα συστήματα ευρετηριάζουν τις ίδιες τοποθεσίες υψηλής εξουσιοδότησης, τα αποτελέσματα τους επικαλύπτονται φυσικά.

Αυτή η ίδια η επικάλυψη είναι συσχέτιση, όχι ολοκλήρωση.

Ο ρόλος του Bing και της Microsoft

Οι δυνατότητες περιήγησης και ανάκτησης του ChatGPT βασίζονται κυρίως στην υποδομή αναζήτησης της Microsoft.

Όταν η περιήγηση είναι ενεργοποιημένη, τα ερωτήματα αποστέλλονται στο Bing και όχι στην Google. Το Bing παρέχει τα υποψήφια έγγραφα που διαβάζει και συνοψίζει το ChatGPT.

Αυτό σημαίνει ότι η άποψη του ChatGPT για τον Ιστό διαμορφώνεται πολύ περισσότερο από το Bing παρά από την Google.

Εάν ο ιστότοπός σας έχει καλή απόδοση στο Bing, είναι πιο πιθανό να εμφανίζεται στις απαντήσεις ChatGPT.

Εάν ο ιστότοπός σας είναι αόρατος στο Bing, το ChatGPT δεν μπορεί να τον ανακτήσει, ακόμα κι αν κατατάσσεται καλά στο Google.

Διαβάστε περισσότερα στο:Το σχέδιο δημιουργίας συνδέσμων μου: Πώς δημιουργώ συνδέσμους που εμπιστεύεται η Google

Δεδομένα εκπαίδευσης έναντι δεδομένων Google

Μια άλλη πηγή σύγχυσης προέρχεται από την προπόνηση.

Τα δεδομένα εκπαίδευσης του ChatGPT ενδέχεται να περιλαμβάνουν δημοσίως διαθέσιμες σελίδες τις οποίες η Google ευρετηρίασε επίσης. Ωστόσο, αυτό δεν σημαίνει ότι το μοντέλο έχει πρόσβαση στα ιδιόκτητα σύνολα δεδομένων ή στα συστήματα κατάταξης της Google.

Το OpenAI δεν λαμβάνει τα δεδομένα ανίχνευσης της Google.

Δεν λαμβάνει τα δεδομένα κλικ της Google.

Δεν λαμβάνει τα σήματα κατάταξης της Google.

Τα δεδομένα εκπαίδευσης προέρχονται από ανοιχτές πηγές ιστού, σύνολα δεδομένων με άδεια χρήσης και υλικό που δημιουργήθηκε από ανθρώπους, όχι από εσωτερικά συστήματα της Google.

Συμπέρασμα

Το ChatGPT δεν πραγματοποιεί αναζήτηση στο διαδίκτυο από προεπιλογή και δεν έχει άμεση πρόσβαση σε ζωντανούς ιστότοπους, στο ευρετήριο της Google ή σε προσωπικά δεδομένα. Οι βασικές του γνώσεις προέρχονται από έναν συνδυασμό δημόσιου κειμένου ιστού, συνόλων δεδομένων με άδεια χρήσης και δεδομένων εκπαίδευσης που έχουν δημιουργηθεί από τον άνθρωπο, όλα συλλέγονται πριν από μια καθορισμένη ημερομηνία λήξης.

Όταν η περιήγηση είναι ενεργοποιημένη, το ChatGPT δεν ανιχνεύει τον ίδιο τον ιστό. Ανακτά ένα μικρό σύνολο εγγράφων από εξωτερικά ευρετήρια αναζήτησης, κυρίως το Bing, και δημιουργεί απαντήσεις με βάση αυτές τις πηγές. Αυτό σημαίνει ότι η ο��ατότητα στις απαντήσεις που δημιουργούνται από την τεχνητή νοημοσύνη εξακολουθεί να εξαρτάται από τις παραδοσιακές βασικές αρχές SEO, όπως η ευρετηρίαση, η εξουσία και η κατάταξη αναζήτησης.

Ρίξτε μια ματιά στα άλλα ιστολόγιά μας:

Τι είναι το llm.txt και βοηθάει το SEO;

Read this article in:

🇬🇧 English🇷🇺 Русский🇫🇷 Français🇩🇪 Deutsch🇪🇸 Español🇨🇳 中文🇮🇳 हिन्दी🇳🇱 Nederlands🇮🇹 Italiano🇵🇹 Português🇬🇷 Ελληνικά🇷🇴 Română🇹🇭 ไทย

Έτοιμοι να ξεκινήσετε;

Επικοινωνήστε μαζί μου.

Free SEO Audit
Get your personalised roadmap
Get Free Audit →