Temps de lecture : 14 minutes
La question arrive désormais dans presque toutes nos missions de visibilité : « comment savoir si ChatGPT parle de nous ? ». Elle est légitime, et sa formulation contient déjà la difficulté — car « parler de nous » recouvre au moins six réalités différentes, qui ne se mesurent pas de la même façon et n’ont pas la même valeur.
L’enjeu, lui, ne fait plus débat. Entre janvier et avril 2026, 68,01 % des recherches Google américaines n’ont donné lieu à aucun clic, contre 60,45 % en 2024, soit 7,56 points de plus en deux ans (SparkToro, 2026). Dans le même temps, ChatGPT revendiquait en février 2026 900 millions d’utilisateurs hebdomadaires, contre 400 millions un an plus tôt (OpenAI, 2026). Une part croissante des décisions se prend donc dans des réponses que la marque ne voit pas, sur des critères qu’elle ne contrôle pas, à partir de contenus qu’elle a pourtant publiés.
Mesurer devient alors la condition de tout pilotage. Sans mesure, une stratégie de visibilité dans les moteurs génératifs se réduit à une série de bonnes pratiques appliquées de bonne foi, sans moyen de savoir si elles produisent quoi que ce soit. Avec une mesure mal conçue, c’est pire : on optimise un indicateur qui ne correspond à rien.
Ce guide outils décrit ce qu’il faut mesurer, comment le mesurer sans dépendre d’un outil, ce que les traces serveur apportent, ce que valent les plateformes du marché en septembre 2026, et où s’arrête la fiabilité de tout cela.
1. Que mesure-t-on au juste ? Six métriques, et pas une seule
Visibilité dans les réponses IA : présence d’une marque, d’un produit ou d’un contenu dans les réponses produites par les moteurs génératifs — ChatGPT, Perplexity, Google AI Overviews et AI Mode, Copilot, Claude. Elle se décompose en six mesures distinctes : la mention du nom, la citation avec lien vers une page, la part de voix face aux concurrents, la position dans la réponse, le sentiment associé, et l’exactitude des faits restitués. Ces mesures évoluent indépendamment : une marque peut gagner en mentions tout en perdant en citations liées.
La distinction la plus importante oppose la mention et la citation. Être nommé dans une réponse construit la notoriété ; être cité avec un lien vers son propre site construit à la fois la notoriété et une chance de visite. Les deux progressent rarement ensemble : un contenu très citable peut alimenter une réponse sans que le moteur juge utile d’en donner la source, et une marque très connue peut être nommée sans qu’aucune de ses pages ne soit consultée.
| Métrique | Ce qu’elle mesure | Comment l’obtenir | Ce qu’elle ne dit pas |
|---|---|---|---|
| Taux de mention | Part des réponses où la marque est nommée | Relevé sur un panier de prompts | Si la marque est présentée favorablement |
| Taux de citation | Part des réponses où une page de la marque est liée | Relevé, en distinguant lien et simple nom | Si le lien est cliqué |
| Part de voix | Poids de la marque parmi toutes les marques citées | Comptage comparatif sur le même panier | Le volume réel de questions posées |
| Position dans la réponse | Rang d’apparition dans le texte généré | Annotation manuelle ou outil | L’attention réelle du lecteur |
| Sentiment | Tonalité de la mention | Lecture qualitative, jamais automatisée seule | La nuance d’une réserve exprimée |
| Exactitude | Fidélité des faits attribués à la marque | Contrôle manuel sur les faits clés | L’origine de l’erreur |
La sixième métrique est la plus négligée et souvent la plus urgente. Un moteur qui attribue à une entreprise un service qu’elle ne propose pas, un tarif obsolète ou une implantation erronée produit un dommage commercial immédiat, sans qu’aucun tableau de bord de part de voix ne le signale. Nous recommandons de la traiter en premier lors du premier relevé : elle donne souvent la liste des pages à corriger.
2. Comment constituer un panier de prompts qui fasse référence ?
Toute mesure sérieuse commence par un panier de questions, et la qualité de ce panier détermine celle de tout ce qui suit.
Constituer le panier. Vingt à trente questions suffisent pour commencer, à condition qu’elles soient réelles. La bonne source n’est pas un outil de recherche de mots-clés mais vos propres matériaux : questions posées en rendez-vous commercial, formulations récurrentes dans les demandes entrantes, verbatims d’études. Les requêtes adressées aux moteurs génératifs sont conversationnelles et longues ; un panier composé de mots-clés courts mesure autre chose que ce que vivent vos clients.
Répartir les intentions. Un panier utile mélange quatre familles : les questions de définition (« qu’est-ce que… »), de comparaison (« quelle différence entre… »), de sélection (« quel prestataire pour… ») et de méthode (« comment faire… »). Les questions de sélection sont les plus disputées commercialement ; les questions de définition sont les plus faciles à gagner et les plus utiles pour installer une autorité.
Standardiser le relevé. Chaque question est posée dans les mêmes conditions : session neutre, sans historique, même langue, même localisation déclarée, même mois de référence. Pour chaque réponse, on consigne la marque mentionnée, les domaines cités, le passage exact repris, et une note d’exactitude. C’est ce dernier champ qui rend le relevé formateur : il montre quels blocs de vos pages sont réellement extraits, information que ne donne aucun indicateur agrégé.
Répéter. La périodicité mensuelle convient à la plupart des organisations ; une périodicité hebdomadaire se justifie pendant une phase active d’optimisation. Ce qui compte est la stabilité du panier dans le temps : ajouter des questions en cours de route rend les comparaisons impossibles, et il vaut mieux ouvrir un second panier que modifier le premier.
Ce protocole demande environ trois heures par mois pour un panier de trente questions et trois moteurs. C’est le meilleur rapport entre coût et apprentissage de toute la discipline, et il constitue le prolongement naturel du travail décrit dans notre guide pour structurer un contenu citable par ChatGPT : on y vérifie, page par page, si les blocs conçus pour être extraits le sont effectivement.
3. Que voient vos traces, et que ne voient-elles pas ? Analytics et journaux serveur
La mesure par prompts dit ce que les moteurs répondent. Les traces techniques disent ce qui en résulte et qui vient lire.
Le trafic référent. Dans un outil d’analyse d’audience, les visites issues des interfaces conversationnelles apparaissent sous les domaines des moteurs : chatgpt.com, perplexity.ai, gemini.google.com, copilot.microsoft.com, claude.ai. Google Analytics propose depuis le 13 mai 2026 un canal natif dédié à ces assistants, dont la couverture reste partielle : un canal personnalisé demeure utile pour y agréger les moteurs absents de la définition par défaut. Deux précautions s’imposent ensuite. D’abord, une part importante du trafic issu de ces interfaces arrive sans référent identifiable, notamment depuis les applications mobiles — les estimations disponibles émanent d’éditeurs commerciaux et divergent fortement, mais toutes concluent à une sous-estimation : le chiffre mesuré est un plancher. Ensuite, les volumes restent modestes en valeur absolue, ce qui rend les variations relatives spectaculaires et trompeuses.
Ces visites ont pourtant une qualité particulière. Selon Adobe Analytics, les visiteurs issus des moteurs génératifs passent 48 % de temps en plus sur les sites qu’ils consultent, y consultent 13 % de pages supplémentaires et affichent un taux de conversion supérieur de 42 % à celui des autres canaux (Adobe, 2026). Semrush estimait de son côté qu’un visiteur issu de la recherche IA vaut environ 4,4 fois un visiteur organique classique (Semrush, 2025) — une estimation d’éditeur, sur un périmètre thématique étroit, que d’autres travaux nuancent. Ces écarts s’expliquent simplement : la personne arrive après avoir formulé un besoin précis et lu une réponse qui l’a orientée.
Du côté des volumes, la croissance est réelle et part de bas : le trafic renvoyé par les moteurs IA vers les sites marchands américains a progressé de 393 % sur un an au premier trimestre 2026 (Adobe, 2026).
Les journaux serveur. Ils répondent à une autre question : mes pages sont-elles seulement collectées ? On y suit les passages des robots par leur identifiant, en distinguant trois familles aux implications très différentes. Attention à ne pas généraliser leur comportement : chaque éditeur documente le sien, et ils divergent.
| Famille de robot | Identifiants principaux | Ce que son passage signifie | Effet d’un blocage |
|---|---|---|---|
| Entraînement des modèles | GPTBot, ClaudeBot, Google-Extended | Le contenu peut nourrir les futurs modèles | Protège les contenus, prive du savoir paramétrique ultérieur ; Google-Extended n’affecte ni Search ni les AI Overviews |
| Recherche et citation | OAI-SearchBot, Claude-SearchBot, PerplexityBot | Le contenu est éligible aux réponses avec citation | Bloquer OAI-SearchBot retire le site des réponses de la recherche ChatGPT |
| Récupération déclenchée par l’utilisateur | ChatGPT-User, Perplexity-User, Claude-User | Quelqu’un a demandé au moteur d’aller lire cette page | Comportements divergents : Anthropic déclare que Claude-User respecte robots.txt, Perplexity indique que Perplexity-User l’ignore généralement, OpenAI précise que les règles peuvent ne pas s’appliquer à ChatGPT-User |
Cette distinction est la plus utile du suivi technique : beaucoup de sites bloquent l’ensemble des robots par précaution, puis s’étonnent d’être absents des réponses. Le blocage des robots d’entraînement est une décision stratégique défendable ; celui des robots de recherche est presque toujours une erreur non intentionnelle.
Un ordre de grandeur aide à calibrer l’effort : selon l’analyse de Cloudflare sur son réseau, sur douze mois glissants, 80 % du crawl des robots IA relève de l’entraînement, 18 % de la recherche et 2 % seulement d’actions déclenchées par un utilisateur (Cloudflare, 2025). Autrement dit, l’essentiel des passages observés dans vos journaux ne produira aucune visite à court terme.
| Source de mesure | Question à laquelle elle répond | Effort | Principale limite |
|---|---|---|---|
| Panier de prompts | Que répond le moteur sur mon sujet ? | 3 h par mois | Ne couvre que les questions choisies |
| Trafic référent | Combien de visites en résultent ? | Configuration initiale | Sous-estime, référents souvent absents |
| Journaux serveur | Mes pages sont-elles collectées, et par qui ? | Accès technique requis | Ne dit rien des réponses produites |
| Plateforme spécialisée | Suivi automatisé à grande échelle | Budget mensuel | Méthodologie opaque, panier imposé |
4. Quels outils du marché, et à quel prix, en septembre 2026 ?
Le segment s’est constitué en moins de deux ans, avec des financements qui disent l’attente du marché : Profound a levé 96 millions de dollars le 24 février 2026 sur une valorisation d’un milliard, après une série A de 20 millions en juin 2025 et une série B de 35 millions en août, portant le total levé à plus de 155 millions, amorçage compris (Fortune, 2026).
Côté tarifs publics, relevés en septembre 2026, Otterly.AI affiche une grille lisible : 29 dollars par mois pour 15 prompts suivis, 189 dollars pour 100, 489 dollars pour 400, et une offre entreprise à partir de 1 000 dollars, couvrant ChatGPT, les AI Overviews, Perplexity et Copilot, avec Claude, Gemini et AI Mode en option. Peec AI propose quatre niveaux dont les prix ne sont pas affichés publiquement. Les suites établies ont suivi, avec l’AI Toolkit de Semrush et le Brand Radar d’Ahrefs, qui ont l’avantage d’articuler visibilité IA et données SEO existantes. D’autres acteurs — Scrunch, Goodie, Rankscale, AthenaHQ, ZipTie — se disputent le segment intermédiaire.
Trois critères de choix comptent davantage que la liste des moteurs couverts :
- L’exportabilité des réponses brutes. Un outil qui livre un score sans permettre de relire les réponses générées empêche le travail le plus utile : comprendre quel passage a été repris et pourquoi.
- La transparence méthodologique. Combien de fois chaque prompt est-il posé ? Dans quelle localisation ? Avec quel modèle et quelle version ? Sans ces informations, deux relevés successifs ne sont pas comparables.
- La maîtrise du panier. Un outil qui impose ses propres questions mesure sa vision du marché, pas la vôtre.
Un mot sur les classements de moteurs qui circulent. Les répartitions du trafic référent par plateforme — ChatGPT largement en tête, devant Gemini, puis les autres — proviennent le plus souvent d’agrégateurs dont la méthodologie n’est pas publique. Elles donnent un ordre de grandeur utile pour prioriser un suivi, jamais une mesure sur laquelle fonder un investissement.
Pour une organisation qui démarre, la séquence la plus efficace ne commence pas par l’achat d’un outil :
- Constituer le panier de prompts et effectuer un premier relevé manuel, en traitant d’abord l’exactitude des faits.
- Configurer le canal de trafic référent dans l’outil d’analyse d’audience, pour disposer d’un historique dès que les volumes deviendront significatifs.
- Vérifier l’accès des robots dans le fichier robots.txt et dans les journaux, ce qui prend une heure et corrige parfois un blocage involontaire.
- Répéter le relevé manuel pendant deux à trois mois, le temps de savoir quelles questions bougent et lesquelles sont stables.
- Souscrire à un outil seulement une fois connus le panier utile, les moteurs à suivre et les questions à surveiller — c’est-à-dire quand on sait ce qu’on lui demande.
Cette progression évite l’erreur la plus coûteuse du domaine : payer un abonnement mensuel pour un tableau de bord que personne ne lit, parce que ses indicateurs ne répondent à aucune question formulée.
5. Qu’est-ce qui corrèle réellement avec la visibilité ?
Mesurer sert à agir, ce qui suppose de savoir sur quoi. L’analyse la plus large disponible porte sur 75 000 marques et compare leur visibilité dans les AI Overviews à différents signaux : les mentions de marque sur le web arrivent en tête avec une corrélation de 0,664, devant les ancres de marque (0,527), le volume de recherche de marque (0,392), l’autorité de domaine (0,326) et, loin derrière, les backlinks (0,218) (Ahrefs, 2025). Un rapport ultérieur du même éditeur place les mentions sur YouTube au premier rang des signaux observés (Ahrefs, 2026).
Ces corrélations ne sont pas des relations causales, et il faut résister à la tentation de les lire comme une recette. Elles indiquent néanmoins une direction cohérente avec ce que l’on sait du fonctionnement de ces systèmes : ce qui compte est d’être nommé dans des contenus que les moteurs collectent, plus que d’être lié. C’est un renversement par rapport à deux décennies de référencement, où le lien entrant était la monnaie de l’autorité.
Rand Fishkin, fondateur de SparkToro et auteur de l’étude sur les recherches sans clic, en tire une conclusion que nous partageons : la bataille se déplace de l’acquisition de clics vers la présence dans les contenus que les moteurs lisent. Mike King, fondateur d’iPullRank, insiste de son côté sur le fait que la sélection se joue au niveau du passage vectorisé, non de la page — ce qui explique pourquoi une page peut être collectée sans jamais fournir de citation.
6. Quelles limites faut-il expliciter avant de publier un chiffre ?
Quatre limites doivent figurer dans tout tableau de bord honnête.
La variabilité. La génération est probabiliste : la même question posée deux fois peut produire deux réponses différentes, avec des sources différentes. Un relevé unique n’a aucune valeur ; seule la répétition permet de distinguer une tendance d’un aléa.
La personnalisation. Historique de session, localisation, langue et compte utilisateur modifient les réponses. La mesure « neutre » que l’on effectue en session vierge est une convention utile, pas la réalité vécue par les utilisateurs.
L’instabilité des modèles. Une mise à jour de modèle peut modifier les réponses du jour au lendemain, sans que rien n’ait changé côté site. Une chute brutale de part de voix impose donc de vérifier d’abord ce qui a bougé chez le moteur.
L’absence de dénominateur. Contrairement au référencement classique, où le volume de recherche est estimable, personne ne sait combien de personnes posent réellement une question donnée à un moteur génératif. Une part de voix de 40 % sur un panier de trente questions ne dit rien du nombre de personnes concernées. C’est la limite la plus structurelle, et elle interdit de convertir ces indicateurs en prévision de chiffre d’affaires.
Ces limites n’invalident pas la mesure : elles en fixent l’usage. On mesure pour piloter des contenus et détecter des erreurs factuelles, pas pour produire un indicateur de performance qui tiendrait devant un comité d’investissement.
7. L’approche Agalma
Chez Agalma Études, nous abordons la mesure de visibilité IA avec les réflexes d’un institut d’études, pas d’un outil de reporting. Trois principes en découlent.
Le panier de prompts est un objet d’étude. Nous le construisons à partir de matériaux réels — verbatims d’entretiens, questions posées en rendez-vous, formulations spontanées relevées en ligne — plutôt qu’à partir d’un générateur de mots-clés. C’est la même exigence que pour un guide d’entretien : la qualité des réponses dépend de la qualité des questions, et une question formulée dans le vocabulaire de l’entreprise mesure la visibilité d’un vocabulaire que personne n’emploie.
L’exactitude passe avant la part de voix. Notre premier relevé porte systématiquement sur ce que les moteurs affirment de nos clients : services, tarifs, implantations, dirigeants. Les erreurs y sont fréquentes et corrigeables, et leur correction produit un bénéfice immédiat, là où gagner trois points de part de voix demande des mois. Cette approche rejoint la logique d’une stratégie de données propriétaires bien tenue : ce que l’entreprise publie sur elle-même est la source la plus citable dont elle dispose.
Les limites sont dans le livrable. Nous documentons la variabilité observée, le nombre de relevés, la composition du panier et l’absence de dénominateur. Un client qui comprend ce que son indicateur ne dit pas l’utilise mieux qu’un client à qui l’on a vendu une certitude. Nos méthodes d’études qualitatives et d’intelligence client reposent sur cette transparence méthodologique.
La visibilité dans les réponses IA se mesure aujourd’hui avec des instruments imparfaits, sur un terrain qui bouge vite. C’est une raison de mesurer souvent et modestement, pas de renoncer. Pour situer ce travail dans une stratégie d’ensemble, explorez notre pilier consacré à la visibilité et à la stratégie GEO ou découvrez nos expertises en études qualitatives et intelligence client.