La réponse courte : pour une PME dont l'enjeu est d'être trouvée, autorisez-les. Pour un éditeur qui vit de la publicité ou de l'abonnement, la question est légitime. Le problème, c'est que la plupart des sites bloqués le sont par défaut, sans que personne n'ait tranché.
Vérifiez d'abord ce que fait votre site
Ouvrez https://votredomaine.ch/robots.txt dans un navigateur. Cherchez ces noms :
| Robot | Opérateur | Rôle |
|---|---|---|
GPTBot |
OpenAI | Collecte pour l'entraînement |
OAI-SearchBot |
OpenAI | Alimente la recherche de ChatGPT |
ChatGPT-User |
OpenAI | Récupération en direct quand un utilisateur pose une question |
ClaudeBot |
Anthropic | Collecte |
PerplexityBot |
Perplexity | Indexation pour les réponses |
Google-Extended |
Contrôle l'usage pour Gemini — sans effet sur le classement Search | |
Applebot-Extended |
Apple | Contrôle l'usage pour l'IA d'Apple |
Si vous trouvez des lignes Disallow: / associées à ces agents, votre site est invisible pour eux. Beaucoup de thèmes, d'extensions et de configurations d'hébergeur les ont ajoutées automatiquement en 2024-2025, souvent sans que le propriétaire du site le sache.
La distinction que presque tout le monde rate
Ces robots ne font pas tous la même chose, et les confondre mène à de mauvaises décisions.
Les robots d'entraînement (GPTBot, ClaudeBot) collectent du contenu pour améliorer les modèles. Les bloquer ne vous retire pas des réponses ; cela retire votre contenu des jeux d'entraînement futurs.
Les robots de récupération (OAI-SearchBot, ChatGPT-User, PerplexityBot) vont chercher des pages au moment où un utilisateur pose une question. Les bloquer, c'est vous exclure des réponses en direct — donc des citations, donc des clics.
C'est là que se joue la vraie décision. Bloquer l'entraînement est un choix défendable sur la propriété intellectuelle. Bloquer la récupération, c'est refuser d'apparaître quand un prospect pose une question sur votre métier.
Un cas fréquent : un site bloque GPTBot par prudence, croit avoir « protégé son contenu », et bloque en réalité aussi sa propre visibilité parce que la règle a été écrite trop largement.
Le cas de Google-Extended
Celui-ci mérite une mention à part, parce qu'il génère beaucoup de confusion.
Google-Extended contrôle l'utilisation de votre contenu pour Gemini. Il n'a aucun effet sur votre classement dans Google Search, ni sur votre présence dans les AI Overviews — celles-ci s'appuient sur l'index Search normal, comme Google l'a confirmé dans son guide du 15 mai 2026.
Autrement dit : le bloquer ne vous retire pas des AI Overviews. Si votre objectif était de sortir des réponses génératives de Google, ce n'est pas le bon levier — et il n'y en a pas d'autre que sortir de l'index tout court.
Comment décider, selon votre situation
Vous êtes une PME, un commerce, un cabinet, un artisan → autorisez tout.
Votre problème n'est pas qu'on vous copie, c'est qu'on ne vous trouve pas. Une citation dans ChatGPT ou Perplexity est une recommandation gratuite devant un prospect en phase de décision. Le contenu que vous publiez existe pour être vu.
Vous êtes un média, un éditeur, une base de données payante → la question est réelle.
Si votre modèle économique repose sur les visites ou l'abonnement, un moteur qui répond à la place de vos lecteurs vous coûte directement. Le calcul mérite d'être fait, et plusieurs éditeurs négocient désormais des accords de licence. Ce n'est pas notre marché, et nous n'avons pas d'avis tranché à vous donner.
Vous avez du contenu réellement confidentiel → ce n'est pas le bon outil.
Le robots.txt est une convention, pas une protection. Ce qui doit rester privé se met derrière une authentification, pas derrière une ligne de texte que rien n'oblige à respecter.
La configuration que nous recommandons
Pour une PME suisse qui veut être trouvée :
User-agent: *
Allow: /
Disallow: /api/
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Google-Extended
Allow: /
Sitemap: https://votredomaine.ch/sitemap.xml
C'est exactement la configuration de ce site — vous pouvez la vérifier sur notre robots.txt. L'autorisation y est explicite plutôt qu'implicite : cela évite qu'une future modification du bloc générique ne bloque involontairement un moteur.
Ce que bloquer ne fait pas
Cela ne protège pas votre contenu déjà appris. Les modèles actuels ont été entraînés sur des données antérieures à votre décision. Bloquer aujourd'hui n'efface rien.
Cela n'empêche pas la copie. Un concurrent qui veut reprendre vos textes le fera à la main. Le robots.txt ne l'arrête pas une seconde.
Cela ne vous fait pas gagner de classement Google. Aucun de ces réglages n'influence le SEO classique.
Sujet voisin, souvent confondu avec celui-ci : llms.txt, utile ou effet de mode ?