ChatGPT-User : comprendre cet accès déclenché depuis ChatGPT

Fabrice Hevin

Voir apparaître ChatGPT-User dans des journaux serveur ne signifie pas qu’un nouveau robot indexe méthodiquement le site. Cet identifiant correspond à la consultation ponctuelle d’une page à la suite d’une action effectuée dans ChatGPT, dans un GPT personnalisé ou au moyen d’une GPT Action.

ChatGPT-User n’a ni le même rôle ni les mêmes règles de contrôle que OAI-SearchBot et GPTBot. Le premier intervient à la demande d’un utilisateur, tandis que les deux autres explorent automatiquement le Web pour des usages définis par OpenAI.

Un accès lié à une action humaine

ChatGPT-User peut être utilisé lorsqu’une personne demande à ChatGPT de consulter une page, fournit une URL à analyser ou déclenche une fonction qui doit récupérer une ressource en ligne. Le serveur du site reçoit alors une requête HTTP associée à cet agent.

OpenAI présente ce trafic comme initié par un utilisateur, et non comme un crawl automatique programmé pour parcourir des sites et constituer un index. Une même page peut donc recevoir une requête parce qu’elle a été directement soumise à ChatGPT ou parce qu’une action a nécessité sa consultation.

Cette récupération ne renseigne pas le propriétaire du site sur la demande à l’origine de l’accès. Les logs montrent qu’une URL a été appelée, mais pas la question posée, les passages éventuellement retenus ni la manière dont le contenu a ensuite été traité. Ils ne permettent pas davantage de savoir si la page a été citée dans la réponse finale.

À lire aussi :  Bloquage ChatGPT : Comment protéger les contenus de votre site contre l'exploitation par ce ChatBot

Comment reconnaître ChatGPT-User dans les logs

La chaîne de user-agent documentée par OpenAI est la suivante :

Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko); compatible; ChatGPT-User/1.0; +https://openai.com/bot

Le jeton le plus utile pour repérer ces requêtes est ChatGPT-User. Il vaut mieux rechercher ce nom que construire une règle dépendant de la chaîne complète, car le numéro de version ou d’autres éléments peuvent évoluer.

Cette détection reste toutefois insuffisante pour attribuer la requête avec certitude. Un user-agent est un simple en-tête HTTP. N’importe quel tiers peut reprendre la même chaîne et se présenter comme ChatGPT-User sans utiliser l’infrastructure d’OpenAI.

OpenAI publie également un fichier JSON répertoriant les plages d’adresses IP employées par cet agent. Pour renforcer l’attribution, il faut comparer l’adresse IP source avec les plages publiées au moment de l’analyse. La liste étant susceptible de changer, une copie ancienne ne constitue pas une référence durable.

Ce double contrôle permet d’associer plus solidement la requête à l’infrastructure annoncée par OpenAI. Il ne révèle pas pour autant l’intention de l’utilisateur ni l’usage fait du contenu récupéré.

Trois agents OpenAI aux fonctions différentes

ChatGPT-User est souvent confondu avec OAI-SearchBot et GPTBot parce que les trois agents sont liés à OpenAI. Ils ne servent pourtant pas le même objectif.

AgentFonction principaleDéclenchementPortée du contrôle
ChatGPT-UserRécupérer une page pour certaines actions dans ChatGPT, les GPT personnalisés ou les GPT ActionsDemande ou action d’un utilisateurNe détermine pas l’inclusion dans ChatGPT Search
OAI-SearchBotExplorer et indexer des pages pour les fonctions de recherche de ChatGPTCrawl automatiqueSon blocage empêche normalement la reprise du contenu dans les réponses de Search, sous réserve d’un possible lien de navigation
GPTBotExplorer du contenu susceptible de servir à l’entraînement des modèles génératifs d’OpenAICrawl automatiqueSon blocage signale que le contenu ne doit pas être utilisé pour cet entraînement

Ces agents correspondent à trois finalités distinctes. Autoriser OAI-SearchBot ne revient pas à accepter l’utilisation du contenu pour l’entraînement. À l’inverse, bloquer GPTBot ne retire pas automatiquement un site des fonctions de recherche de ChatGPT.

À lire aussi :  Microsoft Bing va intégrer un générateur d'image par IA

Un éditeur peut laisser OAI-SearchBot accéder à ses pages afin qu’elles puissent figurer dans les résultats de recherche, tout en refusant GPTBot. OpenAI indique que, lorsque les deux agents sont admis, les résultats d’un même crawl peuvent être mutualisés pour éviter des visites en double. Cette optimisation technique ne supprime pas la séparation entre recherche et entraînement.

ChatGPT-User reste en dehors de cette logique d’indexation. Il ne sert pas à déterminer si un contenu peut apparaître dans ChatGPT Search. OAI-SearchBot est l’agent prévu pour gérer le crawl automatique associé à Search et l’exclusion des contenus de ses réponses.

La portée réelle de robots.txt

Le fichier robots.txt communique aux crawlers les chemins qu’ils sont autorisés à parcourir. Il ne s’agit pas d’un dispositif d’authentification ou d’une barrière de sécurité. Son contenu est public, et une directive Disallow n’empêche pas techniquement un client de demander la ressource.

OAI-SearchBot et GPTBot disposent de contrôles séparés fondés sur ce fichier. Pour autoriser le crawl destiné à la recherche tout en refusant celui lié à l’entraînement, la configuration peut notamment prendre cette forme :

User-agent: OAI-SearchBot Allow: /  User-agent: GPTBot Disallow: /

OpenAI annonce un délai d’environ 24 heures pour la prise en compte d’une modification par ses systèmes de recherche. Ce délai concerne Search et ne doit pas être interprété comme une garantie applicable à tous les produits de l’entreprise.

Le cas de ChatGPT-User est moins direct. Selon la formulation officielle, puisque ses requêtes sont initiées par des utilisateurs, les règles de robots.txt peuvent ne pas s’appliquer. Cela ne permet pas d’affirmer que cet agent respecte toujours le fichier, ni qu’il l’ignore systématiquement. La conclusion pratique est plus limitée : robots.txt ne fournit pas un contrôle suffisamment fiable pour empêcher les consultations à la demande.

À lire aussi :  Python et son rôle dans l'intelligence artificielle

Une ressource qui doit réellement rester privée nécessite une protection appliquée par le serveur. Il peut s’agir d’une authentification, d’une autorisation applicative, d’un filtrage au niveau du pare-feu ou du CDN, d’une limitation de débit ou d’un refus explicite des plages IP concernées. Le contrôle d’accès côté serveur empêche effectivement la lecture, mais peut aussi empêcher un utilisateur de faire analyser la page par ChatGPT.

chatgpt user agent nouvelle ere interaction sites web

Ce qu’un hit ChatGPT-User prouve, et ce qu’il ne prouve pas

Une ligne ChatGPT-User dans les logs établit qu’une requête portant cet identifiant a atteint une URL. Si l’adresse source correspond aux plages publiées, il devient raisonnable de l’attribuer à l’infrastructure annoncée par OpenAI.

Entre la récupération d’une page et une éventuelle visite sur le site, plusieurs opérations peuvent intervenir : sélection de passages, association avec d’autres contenus, génération d’une réponse, affichage d’une citation, puis clic de l’utilisateur. Le serveur de l’éditeur n’observe directement que la requête reçue et, séparément, les visites qui parviennent au site.

Une hausse des accès ChatGPT-User indique donc une augmentation des récupérations déclenchées à la demande. Elle ne démontre pas une progression équivalente de la visibilité, des citations ou du trafic. À l’inverse, l’absence d’un passage récent de cet agent ne suffit pas à exclure l’apparition d’un lien ou la connaissance de la page par un autre mécanisme.

Les logs servent ainsi à compter des requêtes techniques. Ils ne constituent pas un indicateur direct de citation ou d’influence dans les réponses générées.

À lire aussi :  OpenAI lance enfin son API ChatGPT pour le plus grand bonheur des développeurs

Crawl, présence dans Search et clic entrant

Pour contrôler l’utilisation d’un contenu dans les fonctions de recherche, l’agent pertinent est OAI-SearchBot. OpenAI précise qu’une page qui lui est interdite ne doit normalement pas être intégrée aux résumés ou extraits de ChatGPT Search.

Le titre et le lien peuvent toutefois rester affichés comme éléments de navigation si l’URL provient d’un fournisseur de recherche tiers ou a été découverte sur une autre page. OpenAI renvoie vers la balise noindex pour empêcher également cet affichage. Encore faut-il que le crawler puisse accéder à la page et lire la balise : lui interdire simultanément la ressource empêcherait de compter sur cette instruction.

Les clics envoyés depuis ChatGPT relèvent d’une autre mesure. Les liens sortants comportent le paramètre :

utm_source=chatgpt.com

Ce marquage peut être suivi dans un outil d’analytics pour identifier les visites effectivement reçues. Leur nombre ne doit pas être rapproché automatiquement de celui des requêtes ChatGPT-User. Une récupération technique et un clic sortant correspondent à deux événements différents.

Les logs montrent les accès au serveur, la vérification des plages IP renforce leur attribution et utm_source=chatgpt.com renseigne sur certains clics entrants. Aucun de ces signaux ne révèle à lui seul la fréquence des citations ni la place accordée à une page dans une réponse.

Adapter les contrôles à l’objectif du site

Une politique cohérente commence par distinguer ce que le propriétaire souhaite accepter ou refuser. Pour rester accessible aux fonctions de recherche de ChatGPT sans autoriser l’entraînement, il peut ouvrir ses pages à OAI-SearchBot et bloquer GPTBot dans robots.txt.

S’il accepte également que des utilisateurs fassent analyser ses pages publiques, il peut laisser ces ressources accessibles à ChatGPT-User. En revanche, un contenu réservé ne doit pas dépendre d’une directive destinée aux robots. Une protection technique effective doit alors être mise en place au niveau du serveur, de l’application, du pare-feu ou du CDN.

À lire aussi :  Outils digitaux : comment les utiliser efficacement pour former ?

La portée des règles proposées par les outils de gestion des robots mérite d’être vérifiée avant leur activation. Certaines solutions regroupent les robots de recherche, les agents pilotés par des utilisateurs et les robots d’entraînement sous une même catégorie. Un blocage global risque ainsi de fermer l’accès à plusieurs usages alors qu’un seul était visé.

Le suivi doit conserver la même distinction en analysant indépendamment les crawls automatiques, les accès ChatGPT-User et les clics marqués utm_source=chatgpt.com.

Laisser un commentaire