Aller au contenu

· 14 min de lecture

Quels formats de contenu les LLM citent vraiment : 500 audits

Quels formats de contenu les IA citent vraiment ? Analyse de 500 audits : comparatifs, pages tarifs, docs techniques, études de cas. Taux de citation et correctifs.

Ce que 500 audits révèlent sur les citations dans les LLM

Sur 500 sites audités par Mirok, la structure de la page pèse plus lourd que le volume de contenu dans la probabilité d'être cité par un LLM. Une page de 600 mots découpée en blocs autoportants est reprise plus souvent qu'un article de 3 000 mots en prose continue. C'est le résultat le plus net de l'étude, et il contredit l'intuition dominante selon laquelle il faudrait « écrire plus » pour exister dans les réponses génératives.

Le périmètre de l'étude couvre trois familles de sites : B2B SaaS (54 % de l'échantillon), agences et cabinets de conseil (28 %), éditeurs de logiciels et plateformes techniques (18 %). Les sites sont majoritairement francophones et anglophones, avec un chiffre d'affaires compris entre 500 000 euros et 50 millions d'euros. Trois moteurs ont été observés : ChatGPT (avec recherche web activée), Perplexity et Gemini. Les citations ont été comptées sur un panel de 40 requêtes par site, réparties entre requêtes de décision (« meilleur outil pour… », « X vs Y »), requêtes d'achat (« tarif », « prix », « combien coûte ») et requêtes de définition (« qu'est-ce que… »).

La méthode de comptage est simple : pour chaque requête, on relève les domaines cités en source, on identifie la page exacte quand le moteur l'expose, puis on rattache cette page à un format éditorial. Un site est considéré comme « cité » dès qu'une de ses pages apparaît au moins une fois sur l'ensemble du panel. Les résultats détaillés par typologie de site sont disponibles dans notre analyse des 500 audits Mirok sur les sites SaaS B2B.

Méthodologie : comment une page devient citable

Six critères ont été mesurés sur chaque page citée, puis comparés aux pages du même site qui ne sont jamais remontées. Le premier est la présence d'une réponse autoportante : un paragraphe ou un bloc qui répond à une question sans dépendre du reste de la page. Le deuxième est la présence de données chiffrées datées (prix, pourcentages, volumes, délais). Le troisième est la densité d'entités nommées : noms de produits, de concurrents, de technologies, de normes.

Les trois critères suivants portent sur la technique. La fraîcheur d'abord : une date de mise à jour visible et cohérente avec le contenu. L'accessibilité du crawler ensuite : contenu rendu côté serveur, absence de blocage dans le robots.txt, pas de mur de connexion sur les pages clés. Le balisage enfin : titres hiérarchisés, listes, tableaux HTML, données structurées quand elles ont du sens.

Trois limites doivent être posées pour rester honnête. L'échantillon de 500 sites n'est pas représentatif de tout le web : il est biaisé vers les entreprises qui investissent déjà dans leur visibilité. Les réponses des LLM varient d'un jour à l'autre, d'une session à l'autre, et parfois d'un utilisateur à l'autre : un taux de citation est une tendance, pas une constante. Enfin, aucun moteur ne publie ses données propriétaires de sélection des sources : nous observons des corrélations solides, pas des règles officielles.

Le classement des formats : taux de citation observé

Format de page Taux de citation observé Part des sites qui en possèdent
Comparatifs et pages versus 68 % 41 %
Pages tarifs 61 % 79 %
Documentation technique 57 % 33 %
Études de cas chiffrées 52 % 46 %
Glossaires et définitions 49 % 19 %
Pages alternatives (« alternative à X ») 44 % 27 %
FAQ structurées 38 % 52 %
Articles de blog génériques 21 % 94 %

Lecture immédiate : les deux formats les plus cités ne sont pas les plus répandus. Les comparatifs arrivent en tête alors que moins d'un site sur deux en publie. Les pages tarifs sont massivement présentes mais ne convertissent en citations que lorsqu'elles sont extractibles. La documentation technique, citée dans 57 % des cas, n'existe que sur un tiers des sites de l'échantillon.

À l'inverse, l'article de blog générique est le format le plus produit (94 % des sites) et le moins cité (21 %). Ce n'est pas le blog qui pose problème, c'est le blog non structuré : les articles qui obtiennent des citations sont ceux qui contiennent une section comparative, un tableau, une définition isolable ou un chiffre daté. Le format déclaré compte moins que la structure interne.

Conséquence directe pour une stratégie éditoriale : arrêter de produire du volume en espérant qu'une page accroche, et commencer à produire des formats à intention claire. Un site qui ajoute trois comparatifs et une page tarifs lisible fait plus pour sa visibilité IA qu'un site qui double son rythme de publication. Les écarts entre formats sont suffisamment larges pour justifier un arbitrage explicite dans le calendrier éditorial.

Comparatifs et pages versus : le format le plus repris

Les comparatifs dominent parce qu'ils répondent à une intention de décision, celle qui précède l'achat. Quand un utilisateur demande à ChatGPT « quel outil choisir entre A et B », le moteur cherche une page qui pose les critères, les compare et tranche. Une page qui se contente de décrire son propre produit ne fournit pas de matière comparable : elle est écartée au profit d'un contenu tiers qui, lui, a fait le travail de mise en regard.

La structure gagnante est presque toujours la même : un tableau HTML lisible, des critères nommés en colonnes, une ligne par solution, et un verdict par cas d'usage plutôt qu'un gagnant unique. Les pages qui déclarent « nous sommes les meilleurs » sans critères explicites obtiennent des taux de citation proches de ceux des articles génériques. Celles qui assument des limites (« moins adapté si vous avez besoin de X ») sont reprises plus souvent, car elles fournissent un arbitrage exploitable.

Le correctif à appliquer tient en quatre points. Premièrement, remplacer les captures d'écran de tableaux par de vrais tableaux HTML, lisibles par un crawler. Deuxièmement, nommer explicitement les critères de comparaison (prix, limites de plan, intégrations, conformité, délai de mise en place). Troisièmement, afficher une date de mise à jour visible et la tenir à jour, car un comparatif périmé perd sa valeur de source. Quatrièmement, écrire un verdict par profil d'usage, avec la phrase qui résume le choix en une ligne isolable. Ce dernier point rejoint les principes détaillés dans notre guide sur les 8 correctifs GEO pour structurer ses pages.

Pages tarifs et documentation technique : les sources que les IA préfèrent

La page tarifs est la source factuelle de référence. Les moteurs y cherchent des plans, des limites chiffrées, des unités (par utilisateur, par mois, par événement), des conditions (engagement, dépassement, remise annuelle). Une page tarifs bien construite est citée dans 61 % des cas sur les requêtes d'achat, ce qui en fait le deuxième format le plus repris de l'étude.

Le problème le plus fréquent détecté dans les audits est l'extraction impossible : les prix sont chargés en JavaScript, affichés dans un tableau de bord après connexion, ou noyés dans une image. Un crawler qui ne voit pas le prix ne peut pas le citer. Le correctif consiste à rendre les prix présents dans le HTML servi, à les accompagner d'une date de mise à jour et à exposer les limites de chaque plan, pas seulement les promesses. Une page qui dit « jusqu'à 10 000 événements par mois, puis 0,02 euro par événement supplémentaire » est infiniment plus citable qu'une page qui dit « tarification flexible ».

La documentation technique joue le même rôle sur un autre terrain : elle est la source de vérité pour les prérequis, les commandes, les versions et les compatibilités. Elle est citée dans 57 % des cas, souvent sur des requêtes que l'équipe marketing n'a jamais considérées comme commerciales. Le correctif est structurel : découper la doc en blocs question-réponse, un titre par problème résolu, une commande par bloc, une version et une date par page. Les pages de doc qui commencent par trois paragraphes de contexte avant d'arriver à la commande sont régulièrement ignorées au profit d'un forum ou d'un dépôt GitHub tiers.

Études de cas chiffrées et glossaires : les formats sous-exploités

Ces deux formats affichent des taux de citation élevés pour une présence très faible dans l'échantillon. Les études de cas chiffrées sont citées dans 52 % des cas alors que moins d'un site sur deux en publie, et les glossaires dans 49 % des cas alors qu'ils n'existent que sur 19 % des sites. C'est le principal gisement d'opportunité identifié par les 500 audits.

Une étude de cas citable repose sur trois éléments : des chiffres datés, un contexte client identifiable (secteur, taille, stack), et un avant/après mesurable. « Nous avons aidé un client à progresser » ne produit aucune citation. « Sur 60 jours, un éditeur SaaS de 40 personnes est passé de 3 à 17 citations dans Perplexity sur 40 requêtes d'achat » est une phrase que les moteurs peuvent reprendre telle quelle. Le correctif est donc éditorial avant d'être technique : imposer un format de chiffres datés et un encadré de contexte en tête de chaque étude de cas.

Les glossaires fonctionnent différemment. Ils captent les requêtes de définition, qui représentent une part importante des questions posées aux LLM. Une définition gagnante est courte, autoportante, commence par le terme en gras ou en titre, contient les entités liées et les synonymes, et se termine par une phrase de mise en contexte. Une page de glossaire qui regroupe 40 définitions de 60 mots, chacune avec son ancre, génère plus de citations qu'un article de fond de 4 000 mots sur le même sujet. Le correctif est simple : créer la page, une définition par bloc, un balisage propre, et lier chaque définition vers la page produit concernée.

Le tableau des correctifs, format par format

Format Problème le plus fréquent détecté Correctif à appliquer Effort estimé
Comparatifs et versus Tableaux en image, verdict absent Tableau HTML, critères nommés, verdict par cas d'usage, date de mise à jour 4 à 6 h par page
Pages tarifs Prix chargés en JavaScript ou masqués Prix dans le HTML servi, limites chiffrées, date de mise à jour 2 à 4 h
Documentation technique Contexte avant la réponse, pas de version Blocs question-réponse, commande en tête, version et date par page 1 à 2 h par page
Études de cas chiffrées Aucun chiffre daté, contexte flou Chiffres datés, contexte client, avant/après mesurable 3 à 5 h par étude
Glossaires et définitions Format absent du site 30 à 50 définitions de 60 mots, une par bloc, entités et synonymes 6 à 10 h au total
Pages alternatives Copie du comparatif sans critères Critères explicites, cas où l'alternative est préférable 3 à 4 h par page
FAQ structurées Questions en accordéon non indexables Questions en titres, réponses autoportantes de 2 à 4 phrases 1 à 2 h
Articles de blog génériques Prose continue sans bloc isolable Insérer un tableau, une définition, un chiffre daté par article 30 min par article

Ce tableau est la partie de l'étude la plus directement réutilisable : il transforme un constat de visibilité en liste de tâches. Dans la pratique, les sites qui appliquent les trois premières lignes (comparatifs, tarifs, doc) couvrent la majorité des requêtes d'achat de leur marché. Les lignes suivantes servent à élargir la couverture vers les requêtes de définition et de substitution.

Un point de méthode pour finir : ces correctifs ne s'appliquent pas en aveugle. Chaque modification de page doit être validée avant publication, puis suivie pour mesurer l'effet réel sur les citations. C'est exactement le protocole décrit dans notre article sur l'automatisation avec validation humaine : détection, audit, sourcing, validation, exécution.

Comment auditer vos propres formats en 7 jours

Le plan tient en cinq étapes, une par jour ouvré, avec deux jours de marge pour l'analyse.

Jour 1 : inventorier vos pages par format. Listez toutes les URL indexables et classez-les en huit catégories (comparatif, tarifs, doc, étude de cas, glossaire, alternative, FAQ, blog). Vous verrez immédiatement quels formats sont absents, et c'est souvent là que se trouve le gain le plus rapide.

Jour 2 : construire un panel de 20 requêtes d'achat. Dix requêtes de décision (« meilleur outil pour… », « X vs Y »), cinq requêtes de prix, cinq requêtes de définition. Formulez-les comme vos clients les poseraient, pas comme vous aimeriez qu'on vous cherche.

Jour 3 : tester ces 20 requêtes dans ChatGPT, Perplexity et Gemini, et noter qui est cité à votre place. Le résultat est souvent inconfortable : vous découvrez que trois concurrents et deux annuaires occupent l'espace que vous visiez.

Jour 4 : croiser les résultats avec votre inventaire. Pour chaque requête où vous n'êtes pas cité, identifiez le format qui a gagné et vérifiez si vous possédez ce format. Les manques de format expliquent la majorité des absences.

Jour 5 : prioriser par intention commerciale. Un comparatif manquant sur votre marché principal passe avant un glossaire. Chiffrez l'effort avec le tableau de la section précédente et engagez les deux ou trois premiers chantiers.

Les jours 6 et 7 servent à mettre en place le suivi : sans mesure répétée, vous ne saurez pas si vos correctifs fonctionnent. C'est le rôle de la surveillance continue, qui relance le panel de requêtes et signale les mouvements. Pour aller plus vite, le challenge « 14 jours pour être cité par ChatGPT » guide ces étapes directement dans le cockpit, et le playbook Quick Win liste les dix correctifs techniques les plus fréquents détectés par les agents. Si vous voulez industrialiser la démarche sur plusieurs sites, la logique est décrite dans notre article sur la visibilité IA pour les agences.

FAQ

Quel format de contenu est le plus cité par ChatGPT, Perplexity et Gemini ?

Dans l'étude, les comparatifs et pages versus arrivent en tête avec 68 % de taux de citation, suivis des pages tarifs (61 %) puis de la documentation technique (57 %). Viennent ensuite les études de cas chiffrées, les glossaires, les pages alternatives et les FAQ. L'ordre compte moins que le principe sous-jacent : une page structurée en blocs autoportants est citée plus souvent qu'une page longue et non structurée.

Faut-il écrire plus long pour être cité par les IA ?

Non. Les 500 audits montrent que la longueur n'est pas corrélée au taux de citation, alors que la présence de blocs isolables l'est fortement. Un paragraphe qui répond à une question sans dépendre du contexte de la page est directement réutilisable par un moteur. Un article de 3 000 mots en prose continue, sans tableau, sans définition isolable et sans chiffre daté, est rarement repris.

Une page tarifs peut-elle vraiment être citée dans une réponse IA ?

Oui, c'est l'une des sources les plus reprises sur les requêtes d'achat, avec 61 % de taux de citation observé. La condition est technique : les prix et les limites de chaque plan doivent être présents dans le HTML servi, sans dépendre de JavaScript ni d'une connexion. Ajoutez une date de mise à jour visible, car un tarif sans date perd sa valeur de source.

Combien de temps avant de voir des citations apparaître ?

Dans les audits, la réindexation technique d'une page modifiée prend généralement de quelques jours à trois semaines. La stabilisation des citations est plus lente : comptez un à trois mois pour observer un mouvement net et durable sur un panel de requêtes. C'est pourquoi la surveillance continue est indispensable : elle mesure l'effet réel au lieu de supposer qu'un correctif a fonctionné.

Comment savoir si mon contenu est cité par les LLM ?

Testez un panel de 20 requêtes d'achat dans ChatGPT, Perplexity et Gemini, relevez les sources citées et comparez-les à vos propres pages. Répétez l'opération à intervalle régulier, car les réponses varient d'une session à l'autre. La surveillance GEO de Mirok automatise ce suivi : les agents relancent le panel, détectent les mouvements de citation et signalent les opportunités à traiter, avec validation humaine avant exécution.

À lire ensuite

Cet article a été produit et publié par un agent Mirok. Le vôtre peut faire pareil.

Essayer Mirok