Méthodologie : comment ces 500 audits ont été produits
Les 500 audits agrégés dans cet article proviennent des analyses réalisées par les agents Mirok sur des sites SaaS B2B, entre janvier et juin 2025. Chaque audit suit le même protocole automatisé : un crawl technique complet du domaine, l'extraction du balisage Schema.org présent, l'analyse du contenu page par page, la cartographie du maillage interne et la détection des pages sans lien entrant. Les sites de l'échantillon comptent entre 40 et 3 200 URL indexables, avec une médiane autour de 380 pages. La majorité sont des éditeurs de logiciels en phase de croissance, vendant en cycle long, avec un blog actif et une ou deux pages de tarification.
Le périmètre analysé couvre cinq familles de signaux : structure technique (indexabilité, canoniques, vitesse), balisage et données structurées, qualité de citabilité du contenu, architecture de liens internes, et cohérence des métadonnées. Les pourcentages présentés plus bas correspondent à la part des sites de l'échantillon où le problème a été détecté au moins une fois, pas au nombre de pages concernées. Un site peut donc cumuler plusieurs occurrences du même problème.
Deux limites doivent être posées d'emblée. D'abord, l'échantillon n'est pas aléatoire : il s'agit de sites dont les équipes ont lancé un audit, ce qui suppose une maturité marketing minimale et un biais possible vers les organisations déjà sensibilisées au SEO. Ensuite, les impacts sur la visibilité IA sont des corrélations observées sur les sites suivis dans le temps, pas des relations causales démontrées en laboratoire. Ces chiffres sont citables, à condition de citer aussi ces limites.
Le classement des 8 problèmes les plus fréquents
Voici le classement issu des 500 audits, du problème le plus répandu au moins répandu. Chaque ligne indique le taux d'occurrence sur l'échantillon et ce que cela signifie concrètement.
- Balisage incomplet ou absent sur les pages clés : 87 %. Schema.org manquant, incomplet ou incohérent sur au moins une page stratégique (accueil, produit, tarification).
- Contenu non citable : 81 %. Aucune page ne délivre de réponse directe, autonome et sourcée en début de section.
- Pages orphelines : 74 %. Au moins une page indexable sans aucun lien entrant interne.
- Absence de données structurées FAQPage : 69 %. Les questions clients existent dans le texte, jamais dans un balisage exploitable.
- Titres et meta descriptions dupliqués : 63 %. Plus de 10 % des pages partagent un title identique ou quasi identique.
- Maillage interne faible : 58 %. Moins de trois liens internes contextuels par page de contenu.
- Pages de tarification non indexables : 41 %. Blocage par robots.txt, noindex résiduel ou rendu JavaScript non exécuté.
- Absence de BreadcrumbList : 37 %. Aucun fil d'Ariane balisé, donc aucune hiérarchie explicite transmise.
La lecture de ce tableau donne une première conclusion nette : sept des huit problèmes les plus fréquents sont structurels. Ils ne relèvent pas de la qualité rédactionnelle mais de la manière dont le site expose son contenu aux machines.
Balisage et données structurées : le retard le plus systématique
Le balisage est le chantier le plus négligé de l'échantillon, et de loin. Sur les 87 % de sites concernés, la répartition des manques est révélatrice : 62 % n'ont aucun balisage Organization complet, 71 % n'ont pas de balisage Product ou SoftwareApplication sur leur page principale, et 69 % n'ont pas de FAQPage. Le BreadcrumbList manque dans 37 % des cas, ce qui prive le site de toute indication hiérarchique explicite.
Pourquoi cela pèse autant sur la visibilité IA ? Parce qu'un moteur de réponse génératif ne lit pas une page comme un humain. Il cherche des entités identifiables, des relations explicites et des attributs nommés. Un balisage Organization indique qui parle, un balisage Product indique de quoi on parle, un balisage FAQPage indique quelles questions sont traitées et avec quelles réponses. Sans ces marqueurs, le modèle doit inférer le sens à partir du texte brut, avec un taux d'erreur plus élevé et une probabilité de reprise plus faible.
Le lien entre structure explicite et citation est direct dans les données observées : sur les sites de l'échantillon où le balisage a été complété sur les pages clés, la fréquence d'apparition dans les réponses de ChatGPT et Perplexity progresse nettement plus vite que sur les sites où seuls des ajustements rédactionnels ont été faits. Le balisage ne garantit pas la citation, mais il supprime une couche d'ambiguïté que les modèles pénalisent.
Contenu non citable : le problème invisible
Un contenu peut être excellent pour un lecteur humain et rester invisible dans ChatGPT ou Perplexity. C'est le cas de 81 % des sites de l'échantillon. Le diagnostic est toujours le même : la page parle du sujet sans jamais énoncer la réponse. Elle commence par une accroche narrative, développe un contexte, cite des bénéfices généraux, et laisse le lecteur reconstituer lui-même la conclusion.
Quatre schémas bloquent la citation. Premièrement, l'absence de réponse directe : la question n'est jamais formulée, donc la réponse n'est jamais isolable. Deuxièmement, l'absence de définition autonome : un paragraphe qui commence par « comme nous l'avons vu plus haut » est inutilisable hors contexte. Troisièmement, l'absence de chiffres sourcés : une affirmation sans donnée datée et attribuable n'a aucune valeur de preuve pour un moteur de réponse. Quatrièmement, l'absence de format question/réponse : les modèles extraient plus facilement un bloc qui se présente explicitement comme une réponse à une question.
Concrètement, une phrase comme « Notre solution transforme votre approche du marketing » ne sera jamais reprise. Une phrase comme « Un audit de visibilité IA sur 500 sites SaaS B2B montre que 87 % ont un balisage incomplet sur leurs pages clés » est directement citable, parce qu'elle est autonome, chiffrée et attribuable. Le problème n'est donc pas le style, c'est l'absence de blocs extractibles. La bonne nouvelle : ce chantier se traite par réécriture ciblée des introductions et des sections de tête, sans refonte complète.
Pages orphelines et maillage interne : ce que le crawl révèle
74 % des sites de l'échantillon comptent au moins une page orpheline, c'est-à-dire une page indexable sans aucun lien entrant interne. Le phénomène touche surtout trois types de contenus : les articles de blog anciens, les pages de ressources (livres blancs, webinaires, glossaires) et les études de cas. Ces pages existent, elles sont parfois bien écrites, mais rien ne pointe vers elles.
Le cas le plus fréquent est celui du blog non relié au produit. Un article traite d'un sujet connexe à l'offre, mais aucun lien contextuel ne renvoie vers la page fonctionnalité correspondante. Résultat : le visiteur qui arrive par ce contenu n'a pas de chemin naturel vers l'offre, et le moteur n'a pas d'indication sur la relation entre les deux pages.
L'impact est double. Côté Google, les pages orphelines consomment du budget de crawl sans bénéfice, et elles diluent la distribution de l'autorité interne. Côté moteurs de réponse IA, une page sans lien entrant est une page peu susceptible d'être découverte puis reprise, car les crawlers des LLM s'appuient largement sur la structure de liens pour prioriser leur exploration. Reconnecter une page orpheline au maillage principal est l'une des interventions les moins coûteuses de tout l'audit, et l'une des plus rentables.
Impact estimé sur la visibilité IA : ce que les chiffres disent vraiment
Tous les problèmes ne se valent pas. Croiser le taux d'occurrence avec l'impact observé sur les citations permet de distinguer deux familles. D'un côté, les problèmes à fort volume mais à impact modéré : titres dupliqués (63 %) et maillage interne faible (58 %) dégradent la performance globale, mais leur correction isolée produit des gains progressifs plutôt que des bascules. De l'autre, les problèmes plus rares mais bloquants : pages de tarification non indexables (41 %) et absence de BreadcrumbList (37 %) coupent des signaux que les modèles utilisent pour identifier l'entité et sa structure.
Sur les sites suivis dans le temps, trois signaux ressortent comme les meilleurs prédicteurs d'une progression des citations dans ChatGPT, Perplexity et Gemini : la présence de données structurées sur les pages clés, l'existence de blocs de réponse directe en tête de section, et un maillage interne dense reliant contenu, produit et preuve. Les sites qui cumulent les trois progressent plus vite que ceux qui n'en traitent qu'un.
Il faut ici être précis sur la nature de ces chiffres. Il s'agit de corrélations observées sur un panel de sites suivis en continu, pas d'une causalité prouvée par test contrôlé. Les moteurs de réponse évoluent vite, leurs critères de sélection ne sont pas publics, et d'autres facteurs (autorité de domaine, volume de mentions externes, fraîcheur) interfèrent. Ces données indiquent où concentrer l'effort, elles ne garantissent pas un résultat individuel.
Les 3 correctifs qui bougent le plus la ligne
Parmi tous les problèmes détectés, trois correctifs concentrent l'essentiel des gains observés. Ils sont classés par retour décroissant.
1. Ajouter des données structurées sur les pages clés. Concrètement, on pose un balisage Organization sur l'accueil, un balisage Product ou SoftwareApplication sur la page principale, un FAQPage sur les pages qui traitent des objections clients, et un BreadcrumbList sur l'ensemble du site. Le délai d'effet observé est le plus court de tous les chantiers : entre 2 et 4 semaines pour une première reprise dans les réponses, le temps que les crawlers repassent. Après 60 jours, les sites de l'échantillon ayant traité ce point en premier affichent la progression la plus marquée de leur fréquence d'apparition dans Perplexity et Gemini, avec des gains particulièrement visibles sur les requêtes de comparaison et de définition.
2. Réécrire les introductions en réponse directe citable. On remplace l'accroche narrative par une phrase qui répond à la question posée, avec un chiffre, une date et une source. On ajoute une définition autonome du concept traité dans les deux premières lignes de chaque section. Le délai d'effet est intermédiaire : 4 à 8 semaines, car il faut à la fois que les modèles réindexent le contenu et que les blocs réécrits gagnent en autorité par les liens et les mentions. Après 60 jours, le résultat type constaté est une augmentation du nombre de pages du site effectivement citées, souvent de 2 à 4 pages supplémentaires par site, sur des requêtes où le site était totalement absent.
3. Reconnecter les pages orphelines au maillage principal. On identifie chaque page sans lien entrant, puis on ajoute au moins deux liens contextuels depuis des pages à forte autorité interne : article de blog lié au produit, étude de cas liée à la fonctionnalité concernée, ressource liée à l'article qui la mentionne. Le délai d'effet est le plus long : 6 à 10 semaines, car il faut que le crawl repasse et que la redistribution d'autorité s'opère. Après 60 jours, le résultat type est une hausse du nombre de pages indexées et une meilleure couverture des requêtes longues, celles qui alimentent le plus les réponses génératives.
Ces trois correctifs se cumulent. Les sites qui les ont traités ensemble sur la période d'observation progressent plus vite que la somme de leurs gains individuels, ce qui suggère un effet de seuil : la structure, la citabilité et la découvrabilité se renforcent mutuellement.
Comment auditer votre propre site en 30 minutes
Cette checklist reprend les points du classement, dans l'ordre de priorité. Elle est conçue pour être copiée et appliquée directement.
Connectez d'abord Search Console, GA4 et votre CMS. Search Console donne la couverture d'indexation et les requêtes réelles, GA4 indique quelles pages génèrent de l'engagement, le CMS permet de vérifier le balisage à la source.
Regardez ensuite, dans cet ordre : le balisage des pages clés (accueil, produit, tarification) via le validateur de données structurées ; la présence d'un FAQPage sur les pages qui traitent des objections ; les titres et meta descriptions dupliqués dans Search Console, section Améliorations ; les pages indexables sans lien entrant interne, en croisant le crawl et la liste des URL du sitemap ; la densité de liens internes contextuels sur vos dix pages de contenu les plus performantes ; l'indexabilité de votre page de tarification, en vérifiant robots.txt, balise noindex et rendu JavaScript ; et enfin, la présence d'une réponse directe dans les deux premières lignes de chaque section de vos pages stratégiques.
Sur les 30 minutes, consacrez 10 minutes au balisage, 10 minutes au maillage et aux orphelines, 10 minutes à la citabilité du contenu. C'est l'ordre de priorité qui ressort des 500 audits.
Ce qu'il faut retenir
Cinq conclusions se dégagent de ces 500 audits. Premièrement, les problèmes les plus fréquents sur les sites SaaS B2B sont massivement structurels, pas rédactionnels : balisage, maillage, indexabilité, format de réponse. Les équipes marketing investissent souvent dans la production de contenu alors que le goulot d'étranglement est ailleurs.
Deuxièmement, le balisage est le chantier le plus négligé, avec 87 % de sites concernés, et c'est aussi celui dont le délai d'effet est le plus court. C'est le point de départ logique de tout plan de visibilité IA.
Troisièmement, la citabilité se travaille. Un contenu bien écrit mais non extractible reste invisible dans les moteurs de réponse. Réécrire les introductions en réponse directe, chiffrée et autonome est une intervention ciblée, pas une refonte.
Quatrièmement, les pages orphelines pénalisent deux canaux à la fois : elles diluent le crawl Google et réduisent la probabilité de découverte par les crawlers des IA. Les reconnecter est peu coûteux et cumulatif.
Cinquièmement, les gains arrivent sur les correctifs de fond, pas sur les optimisations cosmétiques. Les sites qui traitent structure, citabilité et maillage ensemble progressent plus vite que ceux qui empilent les ajustements isolés. Ces chiffres sont réutilisables, à condition de citer la méthodologie et ses limites.
FAQ
Quels sont les problèmes les plus fréquents sur les sites SaaS B2B ?
Le top 3 issu des 500 audits est le suivant : balisage incomplet ou absent sur les pages clés (87 %), contenu non citable (81 %) et pages orphelines (74 %). Ces trois problèmes sont structurels : ils concernent la manière dont le site expose son contenu aux machines, pas la qualité de l'écriture. C'est le constat central de l'étude : les équipes marketing investissent dans la rédaction alors que le blocage est technique et architectural.
Pourquoi un contenu bien écrit n'est-il pas cité par ChatGPT ?
Parce qu'un moteur de réponse ne peut extraire que ce qui est isolable. Quatre schémas bloquent la citation : l'absence de réponse directe en début de section, l'absence de définition autonome, l'absence de chiffres sourcés et datés, et l'absence de format question/réponse explicite. Sur les 500 audits, 81 % des sites présentent au moins un de ces schémas sur leurs pages stratégiques. Le contenu n'est pas mauvais, il n'est simplement pas extractible hors contexte.
Quel est le correctif le plus rentable pour gagner en visibilité IA ?
Ajouter des données structurées sur les pages clés : Organization sur l'accueil, Product ou SoftwareApplication sur la page principale, FAQPage sur les pages d'objections, BreadcrumbList sur l'ensemble du site. C'est le correctif au délai d'effet le plus court, avec une première reprise observée entre 2 et 4 semaines. Après 60 jours, les sites de l'échantillon ayant traité ce point en premier affichent la progression la plus marquée de leur fréquence d'apparition dans Perplexity et Gemini, notamment sur les requêtes de comparaison.
Combien de temps faut-il pour voir un effet sur les citations dans les LLM ?
Les ordres de grandeur observés sur les sites suivis sont les suivants : 2 à 4 semaines pour les données structurées, 4 à 8 semaines pour la réécriture des introductions en réponse directe, et 6 à 10 semaines pour la reconnexion des pages orphelines. Ces délais dépendent de la fréquence de crawl et de la fraîcheur globale du site. Les gains rapides viennent donc de la structure, les gains plus lents du contenu et du maillage.
Faut-il un audit SEO classique ou un audit GEO spécifique ?
Les deux se recoupent largement : les fondations techniques (indexabilité, maillage, vitesse, métadonnées) servent les deux canaux. La différence se joue sur deux points qui pèsent davantage pour les moteurs de réponse IA : la citabilité du contenu et les données structurées. Un audit SEO classique corrige souvent le balisage de base sans traiter le format de réponse, et un audit GEO seul néglige les fondations. L'approche la plus efficace combine les deux, en commençant par les correctifs communs.