SEO et visibilité dans les IA 7 min
Comment être cité par ChatGPT et les moteurs IA
Pour être cité par ChatGPT et les autres moteurs IA, leurs robots doivent d'abord pouvoir lire le site, ce que bien des configurations empêchent en silence. Ensuite, chaque page doit répondre d'emblée à une question précise, avec des faits sourcés et datés. Personne ne garantit une citation : on lève les obstacles, puis on vérifie requête par requête.
La première raison de ne pas être cité : les robots ne lisent pas le site
On parle beaucoup de « GEO » (Generative Engine Optimization) comme d’une discipline nouvelle. Dans nos audits, le premier problème n’a rien de nouveau : le site n’est pas lisible par les robots des assistants. Avant de réécrire une seule page, il faut vérifier ce point, parce qu’aucun travail éditorial ne compense une porte fermée.
Chaque acteur publie la liste de ses robots, et ils ne font pas tous la même chose. Chez OpenAI, la documentation officielle distingue GPTBot, utilisé pour améliorer les modèles, et OAI-SearchBot, utilisé pour faire apparaître des sites dans les fonctions de recherche de ChatGPT. La même page précise qu’un site qui bloque OAI-SearchBot n’apparaîtra pas dans les réponses de recherche de ChatGPT, et qu’il faut compter environ 24 heures pour qu’un changement du robots.txt soit pris en compte. Chez Anthropic, la page d’aide dédiée décrit trois robots : ClaudeBot (collecte pour l’entraînement), Claude-User (quand un utilisateur pose une question qui demande de visiter une page) et Claude-SearchBot (qualité des résultats de recherche). Tous respectent le robots.txt.
Conséquence pratique : vous pouvez refuser l’entraînement et accepter la recherche, ou l’inverse. C’est un choix éditorial légitime. Ce qui ne l’est pas, c’est de le subir sans le savoir.
Ce que nous avons fait : le cas Palmora
Palmora Property est notre agence immobilière à Phuket, un site en six langues. La stratégie actée était claire : rester lisible par les assistants IA. Le fichier robots.txt du dépôt était propre, il autorisait tout le monde sauf les espaces privés.
L’audit SEO et GEO du 22 juillet 2026 a pourtant trouvé autre chose en production. Le robots.txt réellement servi commençait par un bloc ajouté par Cloudflare, le « robots.txt managé », absent du code. Il contenait un Disallow: / pour GPTBot, ClaudeBot, CCBot, Google-Extended, Amazonbot, Applebot-Extended, Bytespider, meta-externalagent et le robot de rendu de Cloudflare. Personne ne l’avait demandé. Nous l’avons désactivé le jour même.
Trois leçons de cet épisode :
- On vérifie ce qui est servi, pas ce qui est écrit. Un
curlsur l’adresse de production a suffi à voir le bloc. Lire le fichier du dépôt ne l’aurait jamais montré. - La couche réseau peut réécrire vos fichiers. Un CDN, un pare-feu applicatif ou une option « protection contre les robots IA » activée par défaut agissent avant votre site.
- Le blocage avait des effets de bord. Les lignes non standard du bloc géré faisaient dire à Lighthouse que le robots.txt était invalide, ce qui plafonnait le score SEO à 92.
Une précision honnête : la liste bloquée visait surtout des robots d’entraînement. OAI-SearchBot n’y figurait pas. Le site n’était donc pas forcément absent de toutes les réponses de ChatGPT, mais il l’était pour plusieurs acteurs, contre notre volonté. Depuis, quand le sujet revient, le premier geste est de relire ce réglage Cloudflare.
Répondre tout de suite, et à une seule question
Une fois la porte ouverte, la forme des pages compte. Un assistant qui compose une réponse extrait des passages. Un passage qui se comprend seul, sorti de sa page, a plus de chances d’être repris qu’un paragraphe qui suppose d’avoir lu les trois précédents.
Nous appliquons deux règles simples :
- La réponse en tête. Sur ce blog, chaque article commence par une réponse directe de deux à quatre phrases, affichée sous le titre. C’est le fragment qu’on veut voir extrait. Le reste de l’article la justifie.
- Une page, une question. C’est le principe de la base de connaissances de Challenge Us, notre application de défis entre proches : 45 pages, chacune intitulée par une question dans les mots des utilisateurs, avec une réponse de deux ou trois phrases qui doit se comprendre seule. Le site refuse de se construire si deux pages servent la même réponse ou si un titre n’est pas une question.
Cette discipline sert aussi les humains : le lecteur pressé lit trois lignes et repart avec sa réponse.
Des faits sourcés et datés
La seule étude académique sérieuse que nous connaissions sur le sujet est « GEO: Generative Engine Optimization » (Aggarwal et coll., présentée à KDD 2024). Les auteurs ont construit un banc d’essai de 10 000 requêtes et testé neuf façons de réécrire un contenu. Les trois qui fonctionnent le mieux : ajouter des citations, ajouter des statistiques, citer ses sources. Le bourrage de mots-clés, à l’inverse, n’apporte presque rien. Ils rapportent une hausse de visibilité allant jusqu’à 40 % dans les réponses générées, et jusqu’à 37 % lors d’un test sur Perplexity.
Il faut lire ces chiffres pour ce qu’ils sont. La visibilité mesurée est la part du texte de la réponse qui provient d’une source, pondérée par sa position, pas un trafic ni un chiffre d’affaires. Les expériences principales reposent sur un moteur simulé (GPT-3.5-turbo alimenté par les cinq premiers résultats de Google), et les auteurs préviennent eux-mêmes que les méthodes devront s’adapter à mesure que les moteurs évoluent. C’est un indice solide sur la direction, pas une recette garantie.
La direction rejoint de toute façon ce que nous faisons pour d’autres raisons : sur nos sites, aucun chiffre n’est publié sans un lien vers sa source primaire, réellement ouverte. Un assistant qui doit choisir entre deux pages a de bonnes raisons de préférer celle qui dit d’où viennent ses affirmations. Et dater chaque page (date de publication, date de mise à jour, et pour Challenge Us la version de l’application où la réponse a été vérifiée) dit au lecteur, humain ou machine, de quoi il parle.
Des données structurées, seulement pour ce qui est affiché
Les données structurées (JSON-LD) aident les moteurs à comprendre ce qu’est une page : un article, une organisation, une question et sa réponse. Elles ne sont pas une case à cocher pour les moteurs IA. Google le dit en toutes lettres dans sa documentation sur les fonctionnalités IA : il n’y a pas d’exigence supplémentaire pour apparaître dans les AI Overviews, ni de fichier ou de balisage spécial à créer.
La règle qui compte est ailleurs. Les consignes générales de Google interdisent de baliser un contenu invisible pour le lecteur. Nous en avons fait une contrainte technique : sur le site de Challenge Us, la FAQ affichée et la FAQ balisée lisent la même liste, si bien qu’elles ne peuvent pas diverger. Une FAQ balisée qui n’existe pas à l’écran, c’est fabriquer une pénalité.
Comment mesurer sans se raconter d’histoires
C’est la partie que les offres « GEO » survolent le plus. Il n’existe pas de Search Console des assistants. Voici ce que nous faisons, et rien de plus :
- Une liste de requêtes cibles, tapées à la main dans ChatGPT, Claude et Perplexity, à date fixe, en notant si le site est cité et quelle page. C’est artisanal, les réponses varient d’une session à l’autre, et c’est pour cela qu’on répète la mesure plutôt que de conclure sur un essai.
- Les journaux du serveur ou du CDN, filtrés sur les noms des robots (OAI-SearchBot, GPTBot, ChatGPT-User, ClaudeBot, Claude-User, Claude-SearchBot). Ils disent si les robots passent et quelles pages ils lisent. Ils ne disent pas si vous êtes cité.
- Les visites venues des assistants dans vos statistiques, quand le référent est transmis. C’est une borne basse : beaucoup de citations ne produisent aucun clic.
Ce que nous ne faisons pas : promettre un nombre de citations. Personne ne contrôle ce qu’un modèle choisit de citer. Une agence qui le garantit vend une impression, pas un résultat.
Par où commencer
Dans l’ordre : vérifier le robots.txt servi et les réglages du CDN, mettre la réponse en tête des pages qui comptent, sourcer et dater, puis baliser ce qui est affiché. Le fichier llms.txt vient après, et nous avons détaillé ce qu’on peut vraiment en attendre. Sur un site multilingue, ajoutez la vérification des hreflang : un assistant ne cite pas une page qu’il ne trouve pas dans la bonne langue, et les erreurs les plus fréquentes sont faciles à repérer.
Ces vérifications font partie de notre audit SEO, et le travail dans la durée de notre moteur SEO et GEO. La méthode d’ensemble est décrite dans ce qu’une agence SEO doit livrer à l’heure de l’IA.
Questions fréquentes
Faut-il bloquer GPTBot pour protéger son contenu ? C’est un choix éditorial. Bloquer GPTBot refuse l’entraînement des modèles d’OpenAI ; c’est OAI-SearchBot qui conditionne l’apparition dans la recherche de ChatGPT. Décidez robot par robot, en lisant la documentation de chaque acteur, et vérifiez ce qui est réellement servi en production, CDN compris.
Le GEO remplace-t-il le SEO ? Non. Les moteurs génératifs s’appuient en grande partie sur des pages qu’ils trouvent et lisent, et l’étude de référence a été menée sur un moteur alimenté par les résultats de Google. Un site techniquement sain, rapide et bien structuré reste la base des deux.
En combien de temps est-on cité ? Personne ne peut le dire honnêtement. Un changement de robots.txt est pris en compte en un jour environ chez OpenAI selon sa documentation, mais être choisi dans une réponse dépend de la requête, de la concurrence et du modèle. On mesure, requête par requête, et on ajuste.
Jim · fondateur de Brain Plus AI
À lire aussi en seo et visibilité dans les ia
- 6min
Comprendre
llms.txt : à quoi ça sert vraiment
Le fichier llms.txt promet d'aider les IA à lire votre site. Ce que dit la proposition, ce qu'on peut vérifier de son usage réel, ce qu'en disent Google, OpenAI et Anthropic, et pourquoi nous en faisons un quand même.
- 6min
Choisir et chiffrerLe guide du sujet
Agence SEO IA : ce qu'elle doit vraiment livrer en 2026
« IA » est devenu l'argument de vente de toutes les agences SEO. Voici ce qu'une agence SEO IA doit concrètement livrer, les questions qui démasquent les autres, et pourquoi la relecture humaine reste non négociable.
- 7min
Guide pratique
Hreflang et SEO multilingue : les erreurs qui coûtent cher
Hreflang vers des pages qui n'existent pas, x-default mal choisi, 404 dans la mauvaise langue, titres non traduits, langue routée mais oubliée : les erreurs que nous avons trouvées sur nos propres sites multilingues, et comment les éviter.