Robots d'IA et robots.txt : décider ce que les assistants peuvent lire sur son site

Mise à jour par Aurélien Delefosse


Publiée le 05.10.2026

Robots d'IA et robots.txt : décider ce que les assistants peuvent lire sur son site

Guide pratique pour les associations, les collectivités et les lieux de médiation numérique. Il explique comment reconnaître les robots d'IA qui visitent un site, distinguer ceux qui collectent des pages pour entraîner des modèles de ceux qui lisent une page pour répondre à un usager, puis régler le fichier robots.txt en connaissance de cause. Il précise ce que ce fichier ne protège pas et comment contrôler les passages dans les journaux du serveur.

4 VuesVues·

Ressource enregistrée dans 0 collections

Aucune collection publique

Enregistrer
Donner son avis

Les assistants conversationnels vont chercher une partie de leurs réponses sur le web. Le site d'une association ou d'une mairie fait partie de ce qu'ils lisent, que son gestionnaire le sache ou non. Un fichier texte placé à la racine du site, le robots.txt, indique à ces robots ce qu'ils peuvent consulter. Le régler ne demande aucune compétence de développement, à condition de savoir à qui l'on s'adresse.

Deux familles de robots, deux décisions

Les robots d'entraînement collectent des pages pour constituer les données sur lesquelles un modèle apprend. Leur fermer la porte, c'est refuser que ses contenus servent à cet usage.

Les robots de recherche et de consultation lisent une page au moment où un usager pose une question, pour y trouver la réponse et citer la source. Les écarter a une conséquence documentée : OpenAI indique qu'un site fermé à son robot de recherche n'apparaît plus dans les réponses de la recherche ChatGPT.

L'assistant répond alors, s'il répond, à partir d'autres sites. Pour les horaires d'une permanence numérique, ce peut être un annuaire qui n'est plus à jour : c'est une hypothèse, que chacun peut tester en posant la question à l'assistant.

Qui est qui ?

Chaque éditeur publie le nom de ses robots. Chez OpenAI, GPTBot collecte pour l'entraînement, OAI-SearchBot alimente la recherche de ChatGPT et ChatGPT-User consulte une page à la demande d'un usager.

Chez Google, le jeton Google-Extended règle l'usage des contenus pour les modèles Gemini, sans effet sur la présence du site dans le moteur de recherche.

Ces noms ont été relevés en octobre 2026. Relisez la documentation de chaque éditeur avant d'écrire une règle.

Lire son robots.txt

Saisissez l'adresse de votre site suivie de /robots.txt dans un navigateur. Le fichier se lit par blocs : une ligne User-agent désigne un robot, les lignes Disallow et Allow qui suivent indiquent ce qui lui est fermé ou ouvert.

Deux cas demandent un contrôle. Un bloc « User-agent: * » suivi de « Disallow: / » ferme le site à tous les robots, moteurs de recherche compris. Ce réglage sert pendant la construction d'un site, et il arrive qu'il reste en place après la mise en ligne. À l'inverse, un site sans robots.txt est considéré comme entièrement ouvert.

Écrire ses règles

L'exemple ci-dessous refuse l'entraînement chez deux éditeurs. Tout ce qui n'est pas nommé reste autorisé, recherche comprise.

User-agent: GPTBot
Disallow: /

User-agent: Google-Extended
Disallow: /

Selon l'outil de gestion du site, ce fichier se modifie depuis l'administration, parfois avec une extension. À défaut, l'hébergeur ou le prestataire qui maintient le site s'en charge.

Le changement n'est pas immédiat : la documentation d'OpenAI, consultée en octobre 2026, annonce environ 24 heures pour sa recherche.

Ce que le fichier ne fait pas

Le robots.txt est une convention : aucun mécanisme technique n'oblige un robot à la suivre. OpenAI précise que ses règles peuvent ne pas s'appliquer à ChatGPT-User, puisque la visite est déclenchée par un usager et non par une exploration automatique.

Le fichier est public. Y inscrire le chemin d'un dossier sensible revient à en donner l'adresse : un document confidentiel se retire du site ou se place derrière un mot de passe.

Une règle ne vaut que pour l'avenir et n'efface pas ce qui a déjà été collecté.

Vérifier qui passe réellement

Les journaux du serveur enregistrent chaque visite, avec le nom que le robot déclare. Demandez à votre hébergeur un export sur un mois et cherchez-y les noms cités plus haut : vous saurez quels robots viennent et sur quelles pages.

Cette mesure a deux limites. Un nom de robot peut être usurpé, et OpenAI publie les adresses IP de ses robots pour permettre le contrôle. Si le site passe par un service de cache ou un réseau de diffusion, une partie des visites n'atteint pas le serveur : demandez alors les journaux de ce service.

L'outil de mesure d'audience ne remplace pas ces journaux. Quand il repose sur un script exécuté par le navigateur du visiteur, rien ne garantit qu'un robot l'exécute.

En parler avant de trancher

Ouvrir ou fermer son site à chacune des deux familles de robots est un choix qui engage la structure. Il arrive qu'il résulte d'un réglage par défaut que personne n'a discuté. Inscrivez le sujet à l'ordre du jour d'un bureau ou d'un conseil, notez la décision et sa date, puis revoyez-la chaque année avec la liste des robots à jour.

Pour aller plus loin

OpenAI décrit ses robots et leurs règles sur la page Overview of OpenAI Crawlers. Google fait de même, Google-Extended compris, sur la page Google's common crawlers.

Inviter des contributeurs

Les contributeurs peuvent voir, éditer, inviter d’autres contributeurs et supprimer la ressource.

Signaler la ressource

Veuillez indiquez le motif de signalement et le préciser dans votre message. Nous prendrons en compte votre signalement au plus vite.

Les champs avec * sont obligatoires.