Aller au contenu principal
Blog Expertises Méthode Philosophie À propos Parlons-en

NLP et analyse de verbatims : guide pratique pour les équipes marketing

Laurent Yvart

Mis à jour le

19 min de lecture

Temps de lecture : 19 minutes

Chaque organisation possède un gisement d’insights qu’elle n’exploite qu’en surface : les milliers de réponses aux questions ouvertes de ses enquêtes, les avis clients, les motifs de contact du support, les transcriptions d’entretiens. Ce gisement a désormais son industrie. Le marché mondial du text analytics est estimé à 18,81 milliards de dollars en 2026 et devrait plus que doubler pour atteindre 51,17 milliards en 2031, soit une croissance annuelle de 22,16 % (Mordor Intelligence, 2026). Son premier débouché est précisément celui qui intéresse les équipes marketing : la gestion de l’expérience client, qui concentrait 29,72 % des revenus du secteur en 2025.

Ce marché croît parce que les entreprises veulent exploiter des textes non structurés que les outils décisionnels traditionnels ne savent pas analyser (Mordor Intelligence, 2026) ; pour le marketing, les verbatims en sont le gisement le plus immédiat. Les lire tous coûte cher : un codeur humain met de 72 à 144 secondes par document selon la complexité du corpus (Chew et al., 2023). Longtemps, les alternatives se résumaient à des lexiques, simples mais peu précis, et à des modèles supervisés, plus précis mais difficiles à entraîner faute de données annotées. Les grands modèles de langage (LLM) ont changé l’équation : sur 213 titres de presse anglophones notés pour le sentiment et quatre émotions (colère, peur, joie, tristesse), les modèles GPT atteignent des corrélations de 0,59 à 0,77 avec des annotateurs humains, contre 0,20 à 0,30 pour l’analyse par dictionnaires (Rathje et al., PNAS, 2024).

Ce tutoriel s’adresse aux équipes marketing, CX et études qui veulent passer du principe à la pratique. Il détaille une méthode en six étapes — cadrer, constituer le corpus, outiller, coder, valider, restituer — pour transformer des verbatims bruts en tableau de bord d’insights défendable. Il s’inscrit dans notre exploration des insights augmentés par l’IA, dont l’analyse de verbatims est sans doute l’application la plus immédiatement rentable : nul besoin de nouveau terrain, la matière dort déjà dans vos fichiers.


1. Que fait vraiment le NLP à vos verbatims, et que ne fera-t-il pas ?

Le NLP transforme des réponses libres en données structurées — thèmes, sentiments, intentions — à une échelle qu’aucune lecture humaine n’atteint. Il ne remplace ni la question d’étude, ni la validation, ni l’interprétation : sa fiabilité varie fortement selon la technique employée et selon les catégories qu’on lui demande de reconnaître.

Analyse de verbatims : traitement systématique des réponses textuelles libres recueillies auprès de clients ou d’utilisateurs — questions ouvertes d’enquêtes, avis en ligne, tickets de support, transcriptions d’entretiens — afin d’en extraire des thèmes, des sentiments et des intentions exploitables. Le NLP (Natural Language Processing, traitement automatique du langage) en est le socle technique ; les grands modèles de langage en sont, depuis 2023, l’accélérateur : ils classifient des textes à partir de simples instructions en langage naturel, sans entraînement préalable.

Quatre générations de techniques coexistent aujourd’hui, et les confondre est une source fréquente de déconvenues. Un « outil d’analyse de sentiment » peut désigner un lexique comme un LLM : dans une comparaison publiée dans PNAS sur des titres de presse anglophones, la corrélation avec le jugement humain passe de 0,20-0,30 pour les dictionnaires à 0,59-0,77 pour GPT (Rathje et al., 2024).

Génération Principe Forces Limites
Lexiques et dictionnaires Chaque mot porte une valence fixe Simplicité, transparence, coût quasi nul Corrélation faible avec le jugement humain (r = 0,20-0,30 pour des lexiques anglophones, même avec gestion des négations) ; ironie invisible
Topic modeling statistique (LDA) Cooccurrences de mots regroupées en thèmes Émergence de thèmes sans grille préalable Thèmes parfois peu lisibles, réglages sensibles
Transformers fine-tunés (BERT, CamemBERT) Modèle de langue ajusté sur des données annotées Précision élevée sur une tâche stable, exécution locale possible Exige des données annotées et des compétences ML
LLM génératifs (GPT, Claude, Mistral) Classification zero-shot par instructions r = 0,59-0,77 mesuré pour GPT (Rathje et al., 2024) ; grille modifiable en cours d’étude Coût par appel, variabilité, validation indispensable

Les preuves de performance des LLM viennent de la littérature académique, non des éditeurs. Outre l’étude de Rathje et ses collègues, qui a évalué GPT sur 47 925 textes en 12 langues (les corrélations citées plus haut portent, elles, sur 213 titres de presse anglophones), une étude publiée dans PNAS montre que, sur quatre jeux de données (6 183 tweets et articles de presse), ChatGPT dépasse en moyenne de 25 points la précision de crowd workers rémunérés, pour un coût inférieur à 0,003 dollar par annotation, environ trente fois moins cher que MTurk (Gilardi, Alizadeh et Kubli, PNAS, 2023).

La même étude mesure la constance du modèle : codé deux fois, un même lot obtient 91 % d’accord à température 1 et 97 % à température 0,2, contre 79 % entre annotateurs entraînés et 56 % entre crowd workers (Gilardi, Alizadeh et Kubli, 2023). Ces travaux portent sur GPT-3.5, GPT-4 et GPT-4 Turbo, en 2023-2024 ; les modèles ont progressé depuis, mais leur protocole de validation reste transposable. L’un des auteurs en marquait lui-même la portée :

« Notre article démontre le potentiel de ChatGPT pour les tâches d’annotation de données, mais des recherches supplémentaires sont nécessaires pour bien comprendre ses capacités dans ce domaine. » — Fabrizio Gilardi, professeur d’analyse des politiques publiques à l’université de Zurich, co-auteur de l’étude (The Register, avril 2023)

Côté adoption, le basculement est acté : 95 % des chercheurs en études utilisent l’IA régulièrement ou l’expérimentent, et 53 % l’utilisent régulièrement (rapport 2026 Market Research Trends de Qualtrics auprès de plus de 3 000 professionnels dans 14 pays, publié en novembre 2025). Le même rapport, déclaratif et publié par un éditeur qui vend ces outils, affirme que les équipes qui s’en tiennent à des fonctionnalités d’IA basiques sont quatre fois plus exposées à une perte d’influence. La question n’est donc plus « faut-il y aller ? » mais « comment y aller sans sacrifier la rigueur ? ». Voici la méthode que ce guide déroule :

  1. Cadrer la question d’étude et le périmètre du corpus.
  2. Constituer et nettoyer le corpus de verbatims.
  3. Choisir l’outillage adapté au volume et aux compétences.
  4. Construire la grille de codage et faire classifier par le modèle.
  5. Valider l’accord humain-machine catégorie par catégorie.
  6. Quantifier et restituer dans un tableau de bord d’insights.

2. Étapes 1 et 2 : comment cadrer la question et constituer un corpus propre ?

En partant d’une question d’étude précise, puis en nettoyant le corpus avant toute analyse. Le cadrage décide de l’unité d’analyse, de la profondeur temporelle et des sources ; la préparation retire doublons et bruit, protège les données personnelles et conserve les métadonnées qui donneront leur valeur décisionnelle aux thèmes.

Étape 1 : cadrer. Comme pour toute étude, la question précède l’outil. « Analyser nos verbatims » n’est pas une question ; « comprendre pourquoi les détracteurs NPS citent la livraison alors que nos délais s’améliorent » en est une. Ce cadrage fixe l’unité d’analyse (le verbatim entier, ou la phrase quand une réponse mêle plusieurs sujets), la profondeur temporelle et le périmètre de sources : questions ouvertes des enquêtes NPS et CSAT, avis publics, motifs de contact du support, réponses libres des études ad hoc, transcriptions d’entretiens qualitatifs augmentés par l’IA. Les conversations sociales relèvent d’une autre logique de collecte — celle du social listening augmenté — mais rejoignent le même pipeline d’analyse.

Étape 2 : nettoyer et préparer. C’est l’étape la moins spectaculaire et la plus déterminante : un corpus mal préparé produira des thèmes précis, chiffrés… et faux. Le pas-à-pas :

  1. Dédoublonner et filtrer : doublons, réponses vides ou non informatives (« RAS »), tests internes, spam et, pour les avis publics, contenus suspects de fraude.
  2. Détecter la langue de chaque verbatim et la router vers le bon traitement.
  3. Pseudonymiser avant tout envoi à une API tierce : noms, emails, téléphones, numéros de dossier. C’est l’application du principe de minimisation du RGPD, qui cite la pseudonymisation parmi les mesures à mettre en œuvre (article 25), et une hygiène contractuelle — vérifiez les clauses de rétention et de réutilisation des données de vos outils ; certains éditeurs, comme Lumivero pour NVivo ou VERBI pour MAXQDA, affichent une politique de non-rétention des données traitées par l’IA.
  4. Conserver les métadonnées de croisement : segment client, note attribuée, date, canal, produit. Un thème n’a de valeur décisionnelle que croisé avec ces variables.
  5. Standardiser le format : un verbatim par ligne, un identifiant stable, un fichier propre. Cet identifiant permettra de tracer chaque citation du rapport final jusqu’à sa source.

Ne sous-traitez pas mentalement cette étape à l’outil : la plupart des déceptions attribuées « à l’IA » naissent ici, dans un corpus pollué ou amputé de ses métadonnées.


3. Étape 3 : quel niveau d’outillage choisir ?

Celui que votre équipe saura faire vivre. Les plateformes SaaS spécialisées servent les flux récurrents sans data scientist, les logiciels d’analyse qualitative augmentés les corpus d’entretiens, les pipelines sur mesure les volumes importants ou les données sensibles : ce sont moins des niveaux de qualité que des profils d’équipe et de volume.

L’analyse de données figure parmi les trois tâches où l’IA agentique est déjà intégrée aux études, avec la mise à jour des rapports et la préparation des données (Greenbook, GRIT Insights Practice Report, juin 2026). Laura Pulito rappelait dès 2024 ce dont dépend l’adoption de cette automatisation :

« L’adoption de l’automatisation assistée par l’IA dépend toutefois de son accessibilité et de la sensibilisation, ainsi que de la formation des chercheurs à la façon dont elle peut aider à transformer leurs propres pratiques de recherche. » — Laura Pulito, vice-présidente Recherche de Recollective (Greenbook, mai 2024)

Niveau Exemples vérifiés (octobre 2026) Pour qui Vigilance
Plateforme SaaS spécialisée Caplena (analyse de feedback, 100+ langues) Équipes marketing/CX sans data scientist, flux récurrents (NPS, avis) Fonctionnement en boîte noire partielle : exiger les métriques de validation
Logiciel quali augmenté (CAQDAS) ATLAS.ti (AI Coding) et NVivo (AI Assistant, NVivo AI Cloud), tous deux édités par Lumivero ; MAXQDA (AI Assist) Chargés d’études, chercheurs, corpus d’entretiens L’IA suggère, le chercheur arbitre ; moins adapté aux très gros volumes
Pipeline sur mesure BERTopic, CamemBERT 2.0, LLM par API ou en interne Corpus volumineux, récurrents ou sensibles ; équipe data disponible Coût de construction et de maintenance, gouvernance des prompts

Les plateformes SaaS spécialisées industrialisent le cycle complet — import, codage, dashboard. Caplena, par exemple, revendique un codage des questions ouvertes « 95 % plus rapide à une précision de niveau humain » et affirme que ce qui demandait deux à trois jours-homme ne prend plus que quelques minutes de codage et quelques heures de contrôle qualité, avec des références comme IKEA, DHL ou Lufthansa (chiffres de l’éditeur, 2026). Ces promesses restent des revendications commerciales. L’éditeur publie d’ailleurs lui-même, pour son attribution de thèmes sans exemple, un score F1 de 0,61, quand la fiabilité entre codeurs humains se situe selon lui entre 0,70 et 0,85 (Caplena, octobre 2025) : c’est précisément le type de métrique à exiger, et à refaire mesurer sur vos données avec le protocole de l’étape 5.

Les CAQDAS augmentés (logiciels d’analyse qualitative assistée) ont intégré l’IA générative sans renoncer à leur philosophie : le chercheur reste le codeur en chef. ATLAS.ti propose un « Intentional AI Coding » guidé par les objectifs de recherche ; MAXQDA, avec AI Assist, suggère codes et sous-codes, résume documents et segments, et code désormais automatiquement ; NVivo présente son AI Assistant comme conçu pour « soutenir, pas remplacer, le chercheur ». Depuis septembre 2024, ATLAS.ti et NVivo appartiennent au même éditeur, Lumivero, qui ouvre le 6 octobre 2026 NVivo AI Cloud et son agent AURA aux chercheurs individuels et aux étudiants, les équipes et institutions étant inscrites sur liste d’attente pour 2027 ; selon l’éditeur, chaque action de l’agent renvoie à la donnée source et attend l’approbation du chercheur (Lumivero, septembre 2026).

Le pipeline sur mesure combine des briques open source et des API : BERTopic pour faire émerger des thèmes par embeddings et clustering (Grootendorst, 2022), un modèle de langue français comme CamemBERT 2.0 — réentraîné par l’Inria sur 275 milliards de tokens, contre 32 milliards pour la version originale de 2019, et librement disponible (Antoun et al., 2024) — pour la classification fine-tunée en local, et un LLM généraliste pour le codage zero-shot, hébergé en interne quand le corpus ne peut pas quitter l’infrastructure. C’est l’option des corpus sensibles et des baromètres à fort volume. Rathje et ses co-auteurs soutiennent que GPT et les autres LLM « contribuent à démocratiser l’analyse automatisée de texte » en la rendant plus accessible ; reste la méthode, qui devient la vraie barrière. Pour un comparatif détaillé des plateformes du marché, notre benchmark des outils IA pour les études est en préparation.


4. Étapes 4 et 5 : comment faire coder par le modèle et faire arbitrer par l’humain ?

En construisant une grille de codage explicite, que le modèle applique à grande échelle, puis en mesurant catégorie par catégorie son accord avec des codeurs humains sur un échantillon contrôle. Le modèle code vite ; l’humain fixe les définitions, tranche les désaccords et décide quelles catégories peuvent être déployées.

Étape 4 : construire la grille et coder. Deux logiques se complètent. La grille déductive part des catégories métier (prix, livraison, SAV, qualité produit, parcours digital…) : c’est la voie des baromètres, car elle garantit la comparabilité entre vagues. La grille inductive laisse émerger les thèmes du corpus lui-même — via un topic modeling type BERTopic ou en demandant au LLM de proposer une typologie à partir d’un échantillon — et révèle ce que personne ne cherchait. En pratique, la meilleure grille est hybride : un socle déductif stable, enrichi des thèmes émergents détectés à chaque vague.

Le codage par LLM se joue ensuite dans la qualité du prompt, qui est l’équivalent moderne du « livre de codes » du chargé d’études. La recette éprouvée :

  1. Donner le rôle et le contexte : secteur, nature de l’enquête, qui répond, à quelle question.
  2. Définir chaque catégorie en une ou deux phrases, avec deux ou trois exemples tranchés, présentés comme dans un livre de codes (code, définition, exemples). Dans les travaux de Xiao et ses collègues (2023), cette présentation l’emportait sur une suite d’exemples commentés de même contenu, et c’est l’ajout d’un premier exemple qui apportait le gain le plus net ; au-delà, cinq exemples par code n’amélioraient plus guère l’accord.
  3. Fixer les règles de tranchement : étiquettes multiples ou non, traitement des cas limites, catégorie « inclassable » explicite plutôt qu’un modèle forcé de deviner.
  4. Imposer un format de sortie structuré (tableau ou JSON) : identifiant du verbatim, catégories, sentiment et justification courte, précieuse pour auditer les désaccords.
  5. Tester sur un lot réduit avant de lancer l’ensemble du corpus. Figez la version du modèle et, si le fournisseur le permet encore, une température basse ; sur les modèles récents qui n’acceptent plus ce réglage (les derniers Claude, la plupart des modèles de raisonnement d’OpenAI), mesurez la variabilité en codant deux fois le même lot.

Étape 5 : valider l’accord humain-machine. C’est l’étape qui sépare une méthode d’un acte de foi, et les données publiées montrent pourquoi. Dans l’étude de Chew et ses collègues de RTI International (2023), l’accord humain-modèle mesuré par l’AC1 de Gwet atteint 0,85 sur un corpus de presse à cinq catégories, mieux que l’accord entre deux codeurs humains (0,76), mais seulement 0,59 sur une taxonomie de 28 codes de discours climatosceptique, où deux codeurs humains ne s’accordent eux-mêmes qu’à 0,65.

Sur un même corpus de tweets, l’accord culmine à 0,96-0,98 pour les codes bien définis, mais s’effondre à 0,18 sur un code pourtant trivial pour un humain : la présence d’un hashtag, sur laquelle deux codeurs s’accordent à 0,96 (Chew et al., 2023). Les auteurs l’attribuent au découpage du texte en sous-mots ; une expression régulière détecte ce que le modèle voit mal. Le code « mentionne un individu » plafonne à 0,50 (0,79 entre humains) : le modèle y rangeait tout groupe, un défaut du livre de codes selon les auteurs. Le verdict global — « GPT-3.5 code souvent à des niveaux d’accord comparables aux codeurs humains » — cache donc une variance énorme entre catégories : valider globalement ne suffit pas, il faut valider code par code. Le protocole :

  1. Constituer un échantillon contrôle de quelques centaines de verbatims, représentatif des segments et des canaux.
  2. Doubler le codage : un ou deux codeurs humains d’un côté, le modèle de l’autre, en aveugle.
  3. Mesurer l’accord par catégorie — kappa de Cohen ou AC1 de Gwet, plus robuste sur les catégories rares — et non un score global qui noie les faiblesses.
  4. Statuer catégorie par catégorie : au-dessus du seuil fixé, on déploie — McHugh (2012) juge insuffisant tout kappa inférieur à 0,60 et qualifie de « fort » un accord de 0,80 à 0,90, niveau à viser pour les décisions à enjeu ; en dessous, on reformule la définition, on ajoute un exemple tranché au prompt, ou l’on repasse la catégorie en codage humain.
  5. Documenter le tout : taux d’accord, périmètre validé, part du corpus codée automatiquement — ce sont ces chiffres qui rendront l’étude défendable en comité de direction.

L’investissement reste marginal au regard du gain : là où les codeurs humains de l’étude mettaient 72 à 144 secondes par document, GPT-3.5 en demandait 4 à 52 (Chew et al., 2023). On valide en jours ce qui économise des semaines — à condition, encore une fois, de traiter ces résultats 2023-2024 comme un ordre de grandeur et un protocole à répliquer, pas comme une garantie transférable à votre corpus : une version plus récente ne fait pas toujours mieux, et chez Rathje et ses collègues, GPT-3.5 Turbo faisait légèrement mieux que GPT-4 et GPT-4 Turbo sur deux tâches de sentiment.


5. Étape 6 : comment passer du codage au tableau de bord d’insights ?

En quantifiant les thèmes, en les croisant avec les données de comportement et de transaction, puis en les restituant dans un tableau de bord où chaque citation reste traçable jusqu’à sa source. Un corpus codé n’est encore qu’une base de données : la valeur naît de ces trois opérations, menées dans cet ordre.

Quantifier : fréquence de chaque thème, évolution entre vagues, croisements par segment, canal ou produit — et surtout lecture des thèmes par niveau de note, qui transforme un nuage de sujets en hiérarchie de leviers. Croiser : les thèmes issus des verbatims prennent leur pleine valeur reliés aux données comportementales et transactionnelles — ce que permet une Customer Data Platform bien architecturée, où le « pourquoi » des verbatims rejoint le « quoi » des parcours. Restituer : un tableau de bord d’insights minimal viable tient en cinq composants — volumes et évolution par thème ; sentiment par thème ; verbatims exemplaires traçables (chaque citation reliée à son identifiant source) ; vue croisée thème × segment × note ; alertes sur les thèmes émergents ou en accélération.

Reste à éviter les pièges qui guettent tout déploiement — ils sont connus, documentés, et presque tous évitables :

Piège Symptôme Parade
Déployer sans validation Des scores précis dont personne ne connaît la fiabilité Protocole d’accord de l’étape 5, catégorie par catégorie
Le « sentiment washing » Le score de sentiment traité comme une vérité absolue Afficher l’incertitude ; relire les verbatims sources avant toute décision
Confondre déclaratif et comportement Des thèmes déclarés qui ne prédisent pas les actes Croiser avec les données comportementales — le say-do gap est mesuré et massif
Synthèses IA non traçables Des « citations » introuvables dans le corpus Exiger l’identifiant du verbatim source pour toute citation restituée
Dérive silencieuse Un accord qui se dégrade au fil des vagues Re-valider à chaque changement de modèle, de prompt ou de vocabulaire marché

Deux de ces pièges méritent un mot de plus. La traçabilité, d’abord : un LLM qui synthétise peut halluciner un verbatim plausible ; la règle « pas de citation sans identifiant source » coûte une colonne dans votre fichier et sauve votre crédibilité. Les biais, ensuite : biais linguistique (performances moindres sur certaines langues ou registres), biais de surface (survalorisation des réponses longues et articulées), biais hérités des données d’entraînement — nous leur consacrons une analyse dédiée sur les biais de l’IA dans les études marketing.

Enfin, le plus beau tableau de bord ne décide rien : transformer un thème récurrent en action priorisée relève d’une méthodologie de l’insight actionnable à part entière.


6. L’approche Agalma : le NLP comme instrument, l’interprétation comme métier

Chez Agalma Études, l’analyse de verbatims par NLP n’est ni un gadget ni une religion : c’est un instrument de mesure, qui exige ce qu’on exige de tout instrument — étalonnage, conditions d’usage, marges d’erreur. Trois principes structurent notre pratique, de la question posée à la décision prise.

La question avant le corpus. Nous ne « passons pas les verbatims à l’IA » : nous instrumentons une question d’étude. Le cadrage de l’étape 1 est un travail de consultant, pas de technicien — c’est lui qui décide si le livrable éclairera une décision ou décorera une réunion. Christina Silver, qui dirige à l’université de Surrey le CAQDAS Networking Project, consacré aux logiciels d’analyse qualitative, le formule sans détour :

« Je mets les outils au service des méthodes ; je ne les laisse pas en être l’architecte. Ce n’est pas parce qu’une chose est possible qu’il est approprié de la faire. » — Christina Silver, directrice du CAQDAS Networking Project, université de Surrey (mars 2026)

La validation documentée. Chaque livrable doit expliciter le protocole : taux d’accord humain-machine par catégorie, périmètre validé, part du corpus codée automatiquement, catégories restées en codage humain. Quand un chiffre s’affiche dans un comité de direction, sa traçabilité doit résister aux questions — celles d’un directeur financier comme celles d’un data scientist.

L’hybridation des preuves. Un verbatim reste un discours déclaratif : précieux pour comprendre les représentations, insuffisant pour prédire les comportements. Nous triangulons nos analyses NLP avec les données comportementales dès que le client y donne accès et, quand l’enjeu le justifie, avec un terrain qualitatif qui va chercher ce que les clients ne savent pas dire.

Le mouvement ne fait que commencer : le text analytics augmenté par l’IA générative est le type d’analyse qui devrait croître le plus vite, de 24,23 % par an jusqu’en 2031, quand l’analyse de sentiment pesait encore 35,21 % des revenus du secteur en 2025 (Mordor Intelligence, 2026). Et 78 % des chercheurs pensent que des agents IA géreront plus de la moitié des projets de bout en bout d’ici 2028, alors que 15 % seulement en utilisaient au troisième trimestre 2025 (Qualtrics, novembre 2025). Plus l’analyse s’automatise, plus la valeur se déplace vers ce qui ne s’automatise pas : la question juste, le protocole honnête, l’interprétation courageuse.

Pour approfondir la transformation des études par l’intelligence artificielle, explorez notre pilier insights augmentés par l’IA ou découvrez nos expertises en études qualitatives et intelligence client.

Questions fréquentes

Qu'est-ce que l'analyse de verbatims par NLP ?

L'analyse de verbatims par NLP (Natural Language Processing, traitement automatique du langage) consiste à transformer des réponses textuelles libres — questions ouvertes d'enquêtes, avis clients, tickets de support, transcriptions d'entretiens — en données structurées : thèmes, sentiments, intentions. Les techniques vont des lexiques historiques aux LLM actuels, capables de classifier sans entraînement préalable. Le marché du text analytics qui porte ces usages est estimé à 18,81 milliards de dollars en 2026 et devrait atteindre 51,17 milliards en 2031 (Mordor Intelligence).

Les LLM codent-ils les verbatims aussi bien qu'un codeur humain ?

Souvent, mais pas partout. Sur quatre jeux de tweets et d'articles de presse, la précision de ChatGPT sans exemple dépasse en moyenne de 25 points celle de crowd workers rémunérés (Gilardi et al., PNAS, 2023). En codage déductif, l'accord humain-machine atteint 0,85 (AC1 de Gwet) sur un corpus de presse, mieux que deux codeurs humains entre eux, mais tombe à 0,18 sur un simple code de forme, la présence d'un hashtag (Chew et al., 2023). D'où la règle : valider catégorie par catégorie.

Quels outils utiliser pour analyser des verbatims en 2026 ?

Trois niveaux d'outillage coexistent. Les plateformes SaaS spécialisées comme Caplena (plus de 100 langues) automatisent le cycle complet pour les équipes marketing. Les logiciels d'analyse qualitative augmentés gardent le chercheur au centre : ATLAS.ti et NVivo, réunis chez Lumivero depuis septembre 2024, et MAXQDA, avec son AI Assist. Les pipelines sur mesure combinent topic modeling (BERTopic), modèles français comme CamemBERT 2.0 (Inria) et LLM, par API ou en interne, pour les corpus volumineux ou sensibles. Le choix dépend du volume, de la récurrence et des compétences internes.

Combien de temps le NLP fait-il gagner sur l'analyse de verbatims ?

Les mesures académiques donnent un ordre de grandeur : des codeurs humains mettent 72 à 144 secondes par document selon les corpus, contre 4 à 52 secondes pour GPT-3.5 (Chew et al., 2023). Côté éditeurs, Caplena revendique un codage des questions ouvertes « 95 % plus rapide » et affirme que deux à trois jours-homme se réduisent à quelques minutes de codage et quelques heures de contrôle qualité. Le temps de cadrage et de validation reste incompressible : intégrez-le dans tout planning honnête.

Comment valider la fiabilité d'un codage automatique de verbatims ?

Par un protocole d'accord inter-codeurs : faire coder quelques centaines de verbatims en double (humain et modèle), mesurer l'accord par catégorie (kappa de Cohen ou AC1 de Gwet), puis ne déployer que les catégories dépassant le seuil fixé — 0,8 marque un accord « fort » selon McHugh (2012), qui juge insuffisant tout kappa inférieur à 0,60. Les catégories faibles sont reformulées, illustrées d'un exemple dans le prompt ou repassées en codage humain. La validation se répète à chaque changement de modèle, de prompt ou de vague d'étude.

Échangeons sur vos enjeux

Réservez un échange stratégique gratuit de 30 minutes.

Prendre rendez-vous

Sources et références

Laurent Yvart

Laurent Yvart

Gérant fondateur – Agalma

Plus de 15 ans d'expérience en études marketing, sciences comportementales et intelligence artificielle appliquée à la connaissance client. Spécialiste de la transformation des insights en leviers stratégiques, il accompagne les marques dans l'intégration de l'IA et de la data au service de décisions éclairées.

Veille stratégique

Chaque mois, une longueur d'avance sur vos marchés

Analyses, décryptages méthodologiques et signaux faibles pour éclairer vos décisions stratégiques.

Un email par mois · Désinscription à tout moment