Aller au contenu principal
Blog Expertises Méthode Philosophie À propos Parlons-en

Mesurer sa visibilité dans les réponses IA : métriques, protocole et outils

Laurent Yvart

Mis à jour le

15 min de lecture

Temps de lecture : 14 minutes

La question arrive désormais dans presque toutes nos missions de visibilité : « comment savoir si ChatGPT parle de nous ? ». Elle est légitime, et sa formulation contient déjà la difficulté — car « parler de nous » recouvre au moins six réalités différentes, qui ne se mesurent pas de la même façon et n’ont pas la même valeur.

L’enjeu, lui, ne fait plus débat. Entre janvier et avril 2026, 68,01 % des recherches Google américaines n’ont donné lieu à aucun clic, contre 60,45 % en 2024, soit 7,56 points de plus en deux ans (SparkToro, 2026). Dans le même temps, ChatGPT revendiquait en février 2026 900 millions d’utilisateurs hebdomadaires, contre 400 millions un an plus tôt (OpenAI, 2026). Une part croissante des décisions se prend donc dans des réponses que la marque ne voit pas, sur des critères qu’elle ne contrôle pas, à partir de contenus qu’elle a pourtant publiés.

Mesurer devient alors la condition de tout pilotage. Sans mesure, une stratégie de visibilité dans les moteurs génératifs se réduit à une série de bonnes pratiques appliquées de bonne foi, sans moyen de savoir si elles produisent quoi que ce soit. Avec une mesure mal conçue, c’est pire : on optimise un indicateur qui ne correspond à rien.

Ce guide outils décrit ce qu’il faut mesurer, comment le mesurer sans dépendre d’un outil, ce que les traces serveur apportent, ce que valent les plateformes du marché en septembre 2026, et où s’arrête la fiabilité de tout cela.


1. Que mesure-t-on au juste ? Six métriques, et pas une seule

Visibilité dans les réponses IA : présence d’une marque, d’un produit ou d’un contenu dans les réponses produites par les moteurs génératifs — ChatGPT, Perplexity, Google AI Overviews et AI Mode, Copilot, Claude. Elle se décompose en six mesures distinctes : la mention du nom, la citation avec lien vers une page, la part de voix face aux concurrents, la position dans la réponse, le sentiment associé, et l’exactitude des faits restitués. Ces mesures évoluent indépendamment : une marque peut gagner en mentions tout en perdant en citations liées.

La distinction la plus importante oppose la mention et la citation. Être nommé dans une réponse construit la notoriété ; être cité avec un lien vers son propre site construit à la fois la notoriété et une chance de visite. Les deux progressent rarement ensemble : un contenu très citable peut alimenter une réponse sans que le moteur juge utile d’en donner la source, et une marque très connue peut être nommée sans qu’aucune de ses pages ne soit consultée.

Métrique Ce qu’elle mesure Comment l’obtenir Ce qu’elle ne dit pas
Taux de mention Part des réponses où la marque est nommée Relevé sur un panier de prompts Si la marque est présentée favorablement
Taux de citation Part des réponses où une page de la marque est liée Relevé, en distinguant lien et simple nom Si le lien est cliqué
Part de voix Poids de la marque parmi toutes les marques citées Comptage comparatif sur le même panier Le volume réel de questions posées
Position dans la réponse Rang d’apparition dans le texte généré Annotation manuelle ou outil L’attention réelle du lecteur
Sentiment Tonalité de la mention Lecture qualitative, jamais automatisée seule La nuance d’une réserve exprimée
Exactitude Fidélité des faits attribués à la marque Contrôle manuel sur les faits clés L’origine de l’erreur

La sixième métrique est la plus négligée et souvent la plus urgente. Un moteur qui attribue à une entreprise un service qu’elle ne propose pas, un tarif obsolète ou une implantation erronée produit un dommage commercial immédiat, sans qu’aucun tableau de bord de part de voix ne le signale. Nous recommandons de la traiter en premier lors du premier relevé : elle donne souvent la liste des pages à corriger.

2. Comment constituer un panier de prompts qui fasse référence ?

Toute mesure sérieuse commence par un panier de questions, et la qualité de ce panier détermine celle de tout ce qui suit.

Constituer le panier. Vingt à trente questions suffisent pour commencer, à condition qu’elles soient réelles. La bonne source n’est pas un outil de recherche de mots-clés mais vos propres matériaux : questions posées en rendez-vous commercial, formulations récurrentes dans les demandes entrantes, verbatims d’études. Les requêtes adressées aux moteurs génératifs sont conversationnelles et longues ; un panier composé de mots-clés courts mesure autre chose que ce que vivent vos clients.

Répartir les intentions. Un panier utile mélange quatre familles : les questions de définition (« qu’est-ce que… »), de comparaison (« quelle différence entre… »), de sélection (« quel prestataire pour… ») et de méthode (« comment faire… »). Les questions de sélection sont les plus disputées commercialement ; les questions de définition sont les plus faciles à gagner et les plus utiles pour installer une autorité.

Standardiser le relevé. Chaque question est posée dans les mêmes conditions : session neutre, sans historique, même langue, même localisation déclarée, même mois de référence. Pour chaque réponse, on consigne la marque mentionnée, les domaines cités, le passage exact repris, et une note d’exactitude. C’est ce dernier champ qui rend le relevé formateur : il montre quels blocs de vos pages sont réellement extraits, information que ne donne aucun indicateur agrégé.

Répéter. La périodicité mensuelle convient à la plupart des organisations ; une périodicité hebdomadaire se justifie pendant une phase active d’optimisation. Ce qui compte est la stabilité du panier dans le temps : ajouter des questions en cours de route rend les comparaisons impossibles, et il vaut mieux ouvrir un second panier que modifier le premier.

Ce protocole demande environ trois heures par mois pour un panier de trente questions et trois moteurs. C’est le meilleur rapport entre coût et apprentissage de toute la discipline, et il constitue le prolongement naturel du travail décrit dans notre guide pour structurer un contenu citable par ChatGPT : on y vérifie, page par page, si les blocs conçus pour être extraits le sont effectivement.

3. Que voient vos traces, et que ne voient-elles pas ? Analytics et journaux serveur

La mesure par prompts dit ce que les moteurs répondent. Les traces techniques disent ce qui en résulte et qui vient lire.

Le trafic référent. Dans un outil d’analyse d’audience, les visites issues des interfaces conversationnelles apparaissent sous les domaines des moteurs : chatgpt.com, perplexity.ai, gemini.google.com, copilot.microsoft.com, claude.ai. Google Analytics propose depuis le 13 mai 2026 un canal natif dédié à ces assistants, dont la couverture reste partielle : un canal personnalisé demeure utile pour y agréger les moteurs absents de la définition par défaut. Deux précautions s’imposent ensuite. D’abord, une part importante du trafic issu de ces interfaces arrive sans référent identifiable, notamment depuis les applications mobiles — les estimations disponibles émanent d’éditeurs commerciaux et divergent fortement, mais toutes concluent à une sous-estimation : le chiffre mesuré est un plancher. Ensuite, les volumes restent modestes en valeur absolue, ce qui rend les variations relatives spectaculaires et trompeuses.

Ces visites ont pourtant une qualité particulière. Selon Adobe Analytics, les visiteurs issus des moteurs génératifs passent 48 % de temps en plus sur les sites qu’ils consultent, y consultent 13 % de pages supplémentaires et affichent un taux de conversion supérieur de 42 % à celui des autres canaux (Adobe, 2026). Semrush estimait de son côté qu’un visiteur issu de la recherche IA vaut environ 4,4 fois un visiteur organique classique (Semrush, 2025) — une estimation d’éditeur, sur un périmètre thématique étroit, que d’autres travaux nuancent. Ces écarts s’expliquent simplement : la personne arrive après avoir formulé un besoin précis et lu une réponse qui l’a orientée.

Du côté des volumes, la croissance est réelle et part de bas : le trafic renvoyé par les moteurs IA vers les sites marchands américains a progressé de 393 % sur un an au premier trimestre 2026 (Adobe, 2026).

Les journaux serveur. Ils répondent à une autre question : mes pages sont-elles seulement collectées ? On y suit les passages des robots par leur identifiant, en distinguant trois familles aux implications très différentes. Attention à ne pas généraliser leur comportement : chaque éditeur documente le sien, et ils divergent.

Famille de robot Identifiants principaux Ce que son passage signifie Effet d’un blocage
Entraînement des modèles GPTBot, ClaudeBot, Google-Extended Le contenu peut nourrir les futurs modèles Protège les contenus, prive du savoir paramétrique ultérieur ; Google-Extended n’affecte ni Search ni les AI Overviews
Recherche et citation OAI-SearchBot, Claude-SearchBot, PerplexityBot Le contenu est éligible aux réponses avec citation Bloquer OAI-SearchBot retire le site des réponses de la recherche ChatGPT
Récupération déclenchée par l’utilisateur ChatGPT-User, Perplexity-User, Claude-User Quelqu’un a demandé au moteur d’aller lire cette page Comportements divergents : Anthropic déclare que Claude-User respecte robots.txt, Perplexity indique que Perplexity-User l’ignore généralement, OpenAI précise que les règles peuvent ne pas s’appliquer à ChatGPT-User

Cette distinction est la plus utile du suivi technique : beaucoup de sites bloquent l’ensemble des robots par précaution, puis s’étonnent d’être absents des réponses. Le blocage des robots d’entraînement est une décision stratégique défendable ; celui des robots de recherche est presque toujours une erreur non intentionnelle.

Un ordre de grandeur aide à calibrer l’effort : selon l’analyse de Cloudflare sur son réseau, sur douze mois glissants, 80 % du crawl des robots IA relève de l’entraînement, 18 % de la recherche et 2 % seulement d’actions déclenchées par un utilisateur (Cloudflare, 2025). Autrement dit, l’essentiel des passages observés dans vos journaux ne produira aucune visite à court terme.

Source de mesure Question à laquelle elle répond Effort Principale limite
Panier de prompts Que répond le moteur sur mon sujet ? 3 h par mois Ne couvre que les questions choisies
Trafic référent Combien de visites en résultent ? Configuration initiale Sous-estime, référents souvent absents
Journaux serveur Mes pages sont-elles collectées, et par qui ? Accès technique requis Ne dit rien des réponses produites
Plateforme spécialisée Suivi automatisé à grande échelle Budget mensuel Méthodologie opaque, panier imposé

4. Quels outils du marché, et à quel prix, en septembre 2026 ?

Le segment s’est constitué en moins de deux ans, avec des financements qui disent l’attente du marché : Profound a levé 96 millions de dollars le 24 février 2026 sur une valorisation d’un milliard, après une série A de 20 millions en juin 2025 et une série B de 35 millions en août, portant le total levé à plus de 155 millions, amorçage compris (Fortune, 2026).

Côté tarifs publics, relevés en septembre 2026, Otterly.AI affiche une grille lisible : 29 dollars par mois pour 15 prompts suivis, 189 dollars pour 100, 489 dollars pour 400, et une offre entreprise à partir de 1 000 dollars, couvrant ChatGPT, les AI Overviews, Perplexity et Copilot, avec Claude, Gemini et AI Mode en option. Peec AI propose quatre niveaux dont les prix ne sont pas affichés publiquement. Les suites établies ont suivi, avec l’AI Toolkit de Semrush et le Brand Radar d’Ahrefs, qui ont l’avantage d’articuler visibilité IA et données SEO existantes. D’autres acteurs — Scrunch, Goodie, Rankscale, AthenaHQ, ZipTie — se disputent le segment intermédiaire.

Trois critères de choix comptent davantage que la liste des moteurs couverts :

  1. L’exportabilité des réponses brutes. Un outil qui livre un score sans permettre de relire les réponses générées empêche le travail le plus utile : comprendre quel passage a été repris et pourquoi.
  2. La transparence méthodologique. Combien de fois chaque prompt est-il posé ? Dans quelle localisation ? Avec quel modèle et quelle version ? Sans ces informations, deux relevés successifs ne sont pas comparables.
  3. La maîtrise du panier. Un outil qui impose ses propres questions mesure sa vision du marché, pas la vôtre.

Un mot sur les classements de moteurs qui circulent. Les répartitions du trafic référent par plateforme — ChatGPT largement en tête, devant Gemini, puis les autres — proviennent le plus souvent d’agrégateurs dont la méthodologie n’est pas publique. Elles donnent un ordre de grandeur utile pour prioriser un suivi, jamais une mesure sur laquelle fonder un investissement.

Pour une organisation qui démarre, la séquence la plus efficace ne commence pas par l’achat d’un outil :

  1. Constituer le panier de prompts et effectuer un premier relevé manuel, en traitant d’abord l’exactitude des faits.
  2. Configurer le canal de trafic référent dans l’outil d’analyse d’audience, pour disposer d’un historique dès que les volumes deviendront significatifs.
  3. Vérifier l’accès des robots dans le fichier robots.txt et dans les journaux, ce qui prend une heure et corrige parfois un blocage involontaire.
  4. Répéter le relevé manuel pendant deux à trois mois, le temps de savoir quelles questions bougent et lesquelles sont stables.
  5. Souscrire à un outil seulement une fois connus le panier utile, les moteurs à suivre et les questions à surveiller — c’est-à-dire quand on sait ce qu’on lui demande.

Cette progression évite l’erreur la plus coûteuse du domaine : payer un abonnement mensuel pour un tableau de bord que personne ne lit, parce que ses indicateurs ne répondent à aucune question formulée.

5. Qu’est-ce qui corrèle réellement avec la visibilité ?

Mesurer sert à agir, ce qui suppose de savoir sur quoi. L’analyse la plus large disponible porte sur 75 000 marques et compare leur visibilité dans les AI Overviews à différents signaux : les mentions de marque sur le web arrivent en tête avec une corrélation de 0,664, devant les ancres de marque (0,527), le volume de recherche de marque (0,392), l’autorité de domaine (0,326) et, loin derrière, les backlinks (0,218) (Ahrefs, 2025). Un rapport ultérieur du même éditeur place les mentions sur YouTube au premier rang des signaux observés (Ahrefs, 2026).

Ces corrélations ne sont pas des relations causales, et il faut résister à la tentation de les lire comme une recette. Elles indiquent néanmoins une direction cohérente avec ce que l’on sait du fonctionnement de ces systèmes : ce qui compte est d’être nommé dans des contenus que les moteurs collectent, plus que d’être lié. C’est un renversement par rapport à deux décennies de référencement, où le lien entrant était la monnaie de l’autorité.

Rand Fishkin, fondateur de SparkToro et auteur de l’étude sur les recherches sans clic, en tire une conclusion que nous partageons : la bataille se déplace de l’acquisition de clics vers la présence dans les contenus que les moteurs lisent. Mike King, fondateur d’iPullRank, insiste de son côté sur le fait que la sélection se joue au niveau du passage vectorisé, non de la page — ce qui explique pourquoi une page peut être collectée sans jamais fournir de citation.

6. Quelles limites faut-il expliciter avant de publier un chiffre ?

Quatre limites doivent figurer dans tout tableau de bord honnête.

La variabilité. La génération est probabiliste : la même question posée deux fois peut produire deux réponses différentes, avec des sources différentes. Un relevé unique n’a aucune valeur ; seule la répétition permet de distinguer une tendance d’un aléa.

La personnalisation. Historique de session, localisation, langue et compte utilisateur modifient les réponses. La mesure « neutre » que l’on effectue en session vierge est une convention utile, pas la réalité vécue par les utilisateurs.

L’instabilité des modèles. Une mise à jour de modèle peut modifier les réponses du jour au lendemain, sans que rien n’ait changé côté site. Une chute brutale de part de voix impose donc de vérifier d’abord ce qui a bougé chez le moteur.

L’absence de dénominateur. Contrairement au référencement classique, où le volume de recherche est estimable, personne ne sait combien de personnes posent réellement une question donnée à un moteur génératif. Une part de voix de 40 % sur un panier de trente questions ne dit rien du nombre de personnes concernées. C’est la limite la plus structurelle, et elle interdit de convertir ces indicateurs en prévision de chiffre d’affaires.

Ces limites n’invalident pas la mesure : elles en fixent l’usage. On mesure pour piloter des contenus et détecter des erreurs factuelles, pas pour produire un indicateur de performance qui tiendrait devant un comité d’investissement.

7. L’approche Agalma

Chez Agalma Études, nous abordons la mesure de visibilité IA avec les réflexes d’un institut d’études, pas d’un outil de reporting. Trois principes en découlent.

Le panier de prompts est un objet d’étude. Nous le construisons à partir de matériaux réels — verbatims d’entretiens, questions posées en rendez-vous, formulations spontanées relevées en ligne — plutôt qu’à partir d’un générateur de mots-clés. C’est la même exigence que pour un guide d’entretien : la qualité des réponses dépend de la qualité des questions, et une question formulée dans le vocabulaire de l’entreprise mesure la visibilité d’un vocabulaire que personne n’emploie.

L’exactitude passe avant la part de voix. Notre premier relevé porte systématiquement sur ce que les moteurs affirment de nos clients : services, tarifs, implantations, dirigeants. Les erreurs y sont fréquentes et corrigeables, et leur correction produit un bénéfice immédiat, là où gagner trois points de part de voix demande des mois. Cette approche rejoint la logique d’une stratégie de données propriétaires bien tenue : ce que l’entreprise publie sur elle-même est la source la plus citable dont elle dispose.

Les limites sont dans le livrable. Nous documentons la variabilité observée, le nombre de relevés, la composition du panier et l’absence de dénominateur. Un client qui comprend ce que son indicateur ne dit pas l’utilise mieux qu’un client à qui l’on a vendu une certitude. Nos méthodes d’études qualitatives et d’intelligence client reposent sur cette transparence méthodologique.

La visibilité dans les réponses IA se mesure aujourd’hui avec des instruments imparfaits, sur un terrain qui bouge vite. C’est une raison de mesurer souvent et modestement, pas de renoncer. Pour situer ce travail dans une stratégie d’ensemble, explorez notre pilier consacré à la visibilité et à la stratégie GEO ou découvrez nos expertises en études qualitatives et intelligence client.

Questions fréquentes

Qu'est-ce que le share of AI voice ?

C'est la part des réponses d'un moteur génératif, sur un ensemble de questions données, où votre marque est mentionnée, rapportée au total des marques citées sur ce même ensemble. Il se calcule sur un panier de prompts défini à l'avance et suivi dans la durée. Contrairement à une part de marché, cet indicateur dépend entièrement du panier retenu : deux agences mesurant la même marque avec des listes de questions différentes obtiendront des résultats incomparables. Sa valeur est dans son évolution, pas dans son niveau absolu.

Comment mesurer sa visibilité IA sans outil payant ?

Par un protocole manuel rigoureux. Constituez un panier de 20 à 30 questions que vos clients posent réellement, en reprenant leurs formulations issues de vos verbatims commerciaux et de vos études. Posez-les chaque mois aux principaux moteurs, en session neutre et sans historique. Consignez pour chaque réponse trois informations : votre marque est-elle mentionnée, une page est-elle liée, quel passage précis est repris. Trois heures par mois suffisent, et ce relevé apprend davantage sur ce qui est extrait de vos pages qu'un tableau de bord automatisé.

Peut-on suivre le trafic issu des IA dans Google Analytics ?

Partiellement. Les visites référées apparaissent dans les rapports d'acquisition sous les domaines des moteurs, notamment chatgpt.com, perplexity.ai, gemini.google.com, copilot.microsoft.com et claude.ai. Google Analytics propose depuis mai 2026 un canal natif dédié aux assistants, à compléter par un canal personnalisé pour les moteurs qu'il ne couvre pas. La limite reste importante : une part du trafic conversationnel arrive sans référent identifiable, notamment depuis les applications mobiles. Le trafic mesuré est donc un plancher, et sa comparaison d'un mois sur l'autre est plus fiable que sa valeur absolue.

Quels outils permettent de suivre les citations IA en 2026 ?

Le marché s'est structuré autour de plateformes spécialisées. Otterly.AI affiche des tarifs publics allant de 29 dollars par mois pour 15 prompts suivis à 489 dollars pour 400. Profound, positionné sur le segment entreprise, a levé 96 millions de dollars en février 2026 sur une valorisation d'un milliard. Les suites établies ont suivi avec l'AI Toolkit de Semrush et le Brand Radar d'Ahrefs. Le critère de choix n'est pas la liste des moteurs couverts mais la capacité à exporter les réponses brutes pour les analyser soi-même.

Pourquoi les mesures de visibilité IA varient-elles autant ?

Parce que la génération de réponses est probabiliste et personnalisée. La même question posée deux fois au même moteur peut produire deux réponses différentes, avec des sources différentes. S'y ajoutent des variations liées à la langue, à la localisation, à l'historique de session et aux mises à jour de modèles. La conséquence méthodologique est nette : un relevé ponctuel n'a aucune valeur, seule la répétition sur un panier stable permet de distinguer une tendance d'un aléa. Trois relevés espacés valent mieux qu'un relevé massif.

Échangeons sur vos enjeux

Réservez un échange stratégique gratuit de 30 minutes.

Prendre rendez-vous

Sources et références

Laurent Yvart

Laurent Yvart

Gérant fondateur – Agalma

Plus de 15 ans d'expérience en études marketing, sciences comportementales et intelligence artificielle appliquée à la connaissance client. Spécialiste de la transformation des insights en leviers stratégiques, il accompagne les marques dans l'intégration de l'IA et de la data au service de décisions éclairées.

Veille stratégique

Chaque mois, une longueur d'avance sur vos marchés

Analyses, décryptages méthodologiques et signaux faibles pour éclairer vos décisions stratégiques.

Un email par mois · Désinscription à tout moment