Metodología: cómo se elaboraron estas 500 auditorías
Las 500 auditorías agregadas en este artículo proceden de los análisis realizados por los agentes de Mirok sobre sitios SaaS B2B entre enero y junio de 2025. Cada auditoría sigue el mismo protocolo automatizado: un rastreo técnico completo del dominio, la extracción del marcado Schema.org presente, el análisis del contenido página a página, la cartografía del enlazado interno y la detección de páginas sin enlaces entrantes. Los sitios de la muestra cuentan entre 40 y 3.200 URL indexables, con una mediana en torno a 380 páginas. La mayoría son editores de software en fase de crecimiento, que venden con ciclo largo, con un blog activo y una o dos páginas de precios.
El alcance analizado cubre cinco familias de señales: estructura técnica (indexabilidad, canónicas, velocidad), marcado y datos estructurados, calidad de citabilidad del contenido, arquitectura de enlaces internos y coherencia de los metadatos. Los porcentajes que aparecen más abajo corresponden a la proporción de sitios de la muestra en los que se detectó el problema al menos una vez, no al número de páginas afectadas. Por tanto, un mismo sitio puede acumular varias ocurrencias del mismo problema.
Conviene fijar dos límites desde el principio. Primero, la muestra no es aleatoria: se trata de sitios cuyos equipos lanzaron una auditoría, lo que presupone una madurez de marketing mínima y un posible sesgo hacia organizaciones ya sensibilizadas con el SEO. Segundo, los impactos sobre la visibilidad en IA son correlaciones observadas en los sitios monitorizados a lo largo del tiempo, no relaciones causales demostradas en laboratorio. Estas cifras son citables, siempre que se citen también estos límites.
El ranking de los 8 problemas más frecuentes
Este es el ranking extraído de las 500 auditorías, del problema más extendido al menos extendido. Cada línea indica la tasa de ocurrencia en la muestra y qué significa en la práctica.
- Marcado incompleto o ausente en las páginas clave: 87 %. Schema.org ausente, incompleto o incoherente en al menos una página estratégica (home, producto, precios).
- Contenido no citable: 81 %. Ninguna página ofrece una respuesta directa, autónoma y con fuente al inicio de sección.
- Páginas huérfanas: 74 %. Al menos una página indexable sin ningún enlace entrante interno.
- Ausencia de datos estructurados FAQPage: 69 %. Las preguntas de los clientes existen en el texto, pero nunca en un marcado explotable.
- Títulos y meta descripciones duplicados: 63 %. Más del 10 % de las páginas comparten un title idéntico o casi idéntico.
- Enlazado interno débil: 58 %. Menos de tres enlaces internos contextuales por página de contenido.
- Páginas de precios no indexables: 41 %. Bloqueo por robots.txt, noindex residual o renderizado JavaScript no ejecutado.
- Ausencia de BreadcrumbList: 37 %. Ningún breadcrumb marcado, por lo que no se transmite ninguna jerarquía explícita.
La lectura de esta tabla arroja una primera conclusión clara: siete de los ocho problemas más frecuentes son estructurales. No tienen que ver con la calidad de la redacción, sino con la forma en que el sitio expone su contenido a las máquinas.
Marcado y datos estructurados: el retraso más sistemático
El marcado es el frente más desatendido de la muestra, y con diferencia. En el 87 % de los sitios afectados, el reparto de las carencias es revelador: el 62 % no tiene ningún marcado Organization completo, el 71 % no tiene marcado Product o SoftwareApplication en su página principal y el 69 % no tiene FAQPage. El BreadcrumbList falta en el 37 % de los casos, lo que priva al sitio de toda indicación jerárquica explícita.
¿Por qué pesa tanto en la visibilidad en IA? Porque un motor de respuesta generativo no lee una página como un humano. Busca entidades identificables, relaciones explícitas y atributos con nombre. Un marcado Organization indica quién habla, un marcado Product indica de qué se habla, un marcado FAQPage indica qué preguntas se abordan y con qué respuestas. Sin estos marcadores, el modelo debe inferir el significado a partir del texto bruto, con una tasa de error mayor y una probabilidad de reutilización menor.
El vínculo entre estructura explícita y cita es directo en los datos observados: en los sitios de la muestra donde se completó el marcado en las páginas clave, la frecuencia de aparición en las respuestas de ChatGPT y Perplexity crece bastante más rápido que en los sitios donde solo se hicieron ajustes de redacción. El marcado no garantiza la cita, pero elimina una capa de ambigüedad que los modelos penalizan.
Contenido no citable: el problema invisible
Un contenido puede ser excelente para un lector humano y seguir siendo invisible en ChatGPT o Perplexity. Es el caso del 81 % de los sitios de la muestra. El diagnóstico es siempre el mismo: la página habla del tema sin enunciar nunca la respuesta. Empieza con un gancho narrativo, desarrolla un contexto, cita beneficios generales y deja que el lector reconstruya por su cuenta la conclusión.
Cuatro patrones bloquean la cita. Primero, la ausencia de respuesta directa: la pregunta nunca se formula, así que la respuesta nunca es aislable. Segundo, la ausencia de definición autónoma: un párrafo que empieza por «como vimos más arriba» es inservible fuera de contexto. Tercero, la ausencia de cifras con fuente: una afirmación sin dato fechado y atribuible no tiene ningún valor de prueba para un motor de respuesta. Cuarto, la ausencia de formato pregunta/respuesta: los modelos extraen más fácilmente un bloque que se presenta explícitamente como respuesta a una pregunta.
En la práctica, una frase como «Nuestra solución transforma tu enfoque del marketing» nunca será reutilizada. Una frase como «Una auditoría de visibilidad en IA sobre 500 sitios SaaS B2B muestra que el 87 % tiene un marcado incompleto en sus páginas clave» es directamente citable, porque es autónoma, cifrada y atribuible. El problema, por tanto, no es el estilo: es la ausencia de bloques extraíbles. La buena noticia: este frente se resuelve con una reescritura selectiva de las introducciones y las secciones de cabecera, sin necesidad de rehacer todo el sitio.
Páginas huérfanas y enlazado interno: lo que revela el rastreo
El 74 % de los sitios de la muestra cuenta con al menos una página huérfana, es decir, una página indexable sin ningún enlace entrante interno. El fenómeno afecta sobre todo a tres tipos de contenido: artículos de blog antiguos, páginas de recursos (ebooks, webinars, glosarios) y casos de éxito. Estas páginas existen, a veces están bien escritas, pero nada apunta hacia ellas.
El caso más frecuente es el del blog desconectado del producto. Un artículo trata un tema relacionado con la oferta, pero ningún enlace contextual remite a la página de funcionalidad correspondiente. Resultado: el visitante que llega por ese contenido no tiene un camino natural hacia la oferta, y el motor no tiene ninguna indicación sobre la relación entre ambas páginas.
El impacto es doble. En Google, las páginas huérfanas consumen presupuesto de rastreo sin beneficio y diluyen la distribución de la autoridad interna. En los motores de respuesta con IA, una página sin enlaces entrantes es una página con pocas probabilidades de ser descubierta y luego reutilizada, porque los crawlers de los LLM se apoyan en gran medida en la estructura de enlaces para priorizar su exploración. Reconectar una página huérfana al enlazado principal es una de las intervenciones menos costosas de toda la auditoría, y una de las más rentables.
Impacto estimado en la visibilidad en IA: qué dicen realmente las cifras
No todos los problemas valen lo mismo. Cruzar la tasa de ocurrencia con el impacto observado en las citas permite distinguir dos familias. Por un lado, los problemas de alto volumen pero impacto moderado: títulos duplicados (63 %) y enlazado interno débil (58 %) degradan el rendimiento global, pero su corrección aislada produce mejoras progresivas más que saltos. Por otro, los problemas más raros pero bloqueantes: páginas de precios no indexables (41 %) y ausencia de BreadcrumbList (37 %) cortan señales que los modelos usan para identificar la entidad y su estructura.
En los sitios monitorizados a lo largo del tiempo, tres señales destacan como los mejores predictores de una progresión de las citas en ChatGPT, Perplexity y Gemini: la presencia de datos estructurados en las páginas clave, la existencia de bloques de respuesta directa al inicio de sección y un enlazado interno denso que conecta contenido, producto y prueba. Los sitios que acumulan las tres progresan más rápido que los que solo abordan una.
Conviene ser preciso aquí sobre la naturaleza de estas cifras. Son correlaciones observadas en un panel de sitios monitorizados de forma continua, no una causalidad demostrada mediante test controlado. Los motores de respuesta evolucionan rápido, sus criterios de selección no son públicos y otros factores (autoridad de dominio, volumen de menciones externas, frescura) interfieren. Estos datos indican dónde concentrar el esfuerzo, pero no garantizan un resultado individual.
Los 3 arreglos que más mueven la aguja
De todos los problemas detectados, tres arreglos concentran la mayor parte de las mejoras observadas. Están ordenados por retorno decreciente.
1. Añadir datos estructurados en las páginas clave. En concreto, se coloca un marcado Organization en la home, un marcado Product o SoftwareApplication en la página principal, un FAQPage en las páginas que abordan objeciones de clientes y un BreadcrumbList en todo el sitio. El plazo de efecto observado es el más corto de todos los frentes: entre 2 y 4 semanas para una primera reutilización en las respuestas, el tiempo que tardan los crawlers en volver a pasar. A los 60 días, los sitios de la muestra que abordaron este punto primero muestran la progresión más marcada de su frecuencia de aparición en Perplexity y Gemini, con mejoras especialmente visibles en las consultas de comparación y de definición.
2. Reescribir las introducciones como respuesta directa citable. Se sustituye el gancho narrativo por una frase que responde a la pregunta planteada, con una cifra, una fecha y una fuente. Se añade una definición autónoma del concepto tratado en las dos primeras líneas de cada sección. El plazo de efecto es intermedio: de 4 a 8 semanas, porque hace falta tanto que los modelos reindexen el contenido como que los bloques reescritos ganen autoridad mediante enlaces y menciones. A los 60 días, el resultado típico constatado es un aumento del número de páginas del sitio realmente citadas, a menudo de 2 a 4 páginas adicionales por sitio, en consultas donde el sitio estaba totalmente ausente.
3. Reconectar las páginas huérfanas al enlazado principal. Se identifica cada página sin enlaces entrantes y luego se añaden al menos dos enlaces contextuales desde páginas con alta autoridad interna: artículo de blog enlazado al producto, caso de éxito enlazado a la funcionalidad correspondiente, recurso enlazado al artículo que lo menciona. El plazo de efecto es el más largo: de 6 a 10 semanas, porque hace falta que el rastreo vuelva a pasar y que se produzca la redistribución de autoridad. A los 60 días, el resultado típico es un aumento del número de páginas indexadas y una mejor cobertura de las consultas long tail, las que más alimentan las respuestas generativas.
Estos tres arreglos se acumulan. Los sitios que los abordaron juntos durante el periodo de observación progresan más rápido que la suma de sus mejoras individuales, lo que sugiere un efecto umbral: estructura, citabilidad y descubribilidad se refuerzan mutuamente.
Cómo auditar tu propio sitio en 30 minutos
Esta checklist retoma los puntos del ranking, en orden de prioridad. Está diseñada para copiarse y aplicarse directamente.
Conecta primero Search Console, GA4 y tu CMS. Search Console da la cobertura de indexación y las consultas reales, GA4 indica qué páginas generan engagement y el CMS permite verificar el marcado en origen.
Revisa después, en este orden: el marcado de las páginas clave (home, producto, precios) con el validador de datos estructurados; la presencia de un FAQPage en las páginas que abordan objeciones; los títulos y meta descripciones duplicados en Search Console, sección Mejoras; las páginas indexables sin enlaces entrantes internos, cruzando el rastreo con la lista de URL del sitemap; la densidad de enlaces internos contextuales en tus diez páginas de contenido con mejor rendimiento; la indexabilidad de tu página de precios, verificando robots.txt, etiqueta noindex y renderizado JavaScript; y, por último, la presencia de una respuesta directa en las dos primeras líneas de cada sección de tus páginas estratégicas.
De los 30 minutos, dedica 10 al marcado, 10 al enlazado y las huérfanas, y 10 a la citabilidad del contenido. Es el orden de prioridad que se desprende de las 500 auditorías.
Qué hay que recordar
De estas 500 auditorías se desprenden cinco conclusiones. Primera, los problemas más frecuentes en los sitios SaaS B2B son masivamente estructurales, no de redacción: marcado, enlazado, indexabilidad, formato de respuesta. Los equipos de marketing suelen invertir en producción de contenido cuando el cuello de botella está en otro sitio.
Segunda, el marcado es el frente más desatendido, con un 87 % de sitios afectados, y también es el de plazo de efecto más corto. Es el punto de partida lógico de cualquier plan de visibilidad en IA.
Tercera, la citabilidad se trabaja. Un contenido bien escrito pero no extraíble sigue siendo invisible en los motores de respuesta. Reescribir las introducciones como respuesta directa, cifrada y autónoma es una intervención selectiva, no una rehacer todo el sitio.
Cuarta, las páginas huérfanas penalizan dos canales a la vez: diluyen el rastreo de Google y reducen la probabilidad de descubrimiento por los crawlers de las IA. Reconectarlas es barato y acumulativo.
Quinta, las mejoras llegan con los arreglos de fondo, no con las optimizaciones cosméticas. Los sitios que abordan estructura, citabilidad y enlazado en conjunto progresan más rápido que los que acumulan ajustes aislados. Estas cifras son reutilizables, siempre que se cite la metodología y sus límites.
FAQ
¿Cuáles son los problemas más frecuentes en los sitios SaaS B2B?
El top 3 extraído de las 500 auditorías es el siguiente: marcado incompleto o ausente en las páginas clave (87 %), contenido no citable (81 %) y páginas huérfanas (74 %). Estos tres problemas son estructurales: tienen que ver con la forma en que el sitio expone su contenido a las máquinas, no con la calidad de la escritura. Es la conclusión central del estudio: los equipos de marketing invierten en redacción cuando el bloqueo es técnico y arquitectónico.
¿Por qué un contenido bien escrito no lo cita ChatGPT?
Porque un motor de respuesta solo puede extraer lo que es aislable. Cuatro patrones bloquean la cita: la ausencia de respuesta directa al inicio de sección, la ausencia de definición autónoma, la ausencia de cifras con fuente y fecha, y la ausencia de formato pregunta/respuesta explícito. En las 500 auditorías, el 81 % de los sitios presenta al menos uno de estos patrones en sus páginas estratégicas. El contenido no es malo, simplemente no es extraíble fuera de contexto.
¿Cuál es el arreglo más rentable para ganar visibilidad en IA?
Añadir datos estructurados en las páginas clave: Organization en la home, Product o SoftwareApplication en la página principal, FAQPage en las páginas de objeciones y BreadcrumbList en todo el sitio. Es el arreglo con el plazo de efecto más corto, con una primera reutilización observada entre 2 y 4 semanas. A los 60 días, los sitios de la muestra que abordaron este punto primero muestran la progresión más marcada de su frecuencia de aparición en Perplexity y Gemini, sobre todo en las consultas de comparación.
¿Cuánto tiempo hace falta para ver un efecto en las citas en los LLM?
Los órdenes de magnitud observados en los sitios monitorizados son los siguientes: de 2 a 4 semanas para los datos estructurados, de 4 a 8 semanas para la reescritura de las introducciones como respuesta directa y de 6 a 10 semanas para la reconexión de las páginas huérfanas. Estos plazos dependen de la frecuencia de rastreo y de la frescura global del sitio. Las mejoras rápidas vienen, por tanto, de la estructura; las más lentas, del contenido y del enlazado.
¿Hace falta una auditoría SEO clásica o una auditoría GEO específica?
Ambas se solapan en gran medida: los cimientos técnicos (indexabilidad, enlazado, velocidad, metadatos) sirven a los dos canales. La diferencia se juega en dos puntos que pesan más para los motores de respuesta con IA: la citabilidad del contenido y los datos estructurados. Una auditoría SEO clásica suele corregir el marcado básico sin abordar el formato de respuesta, y una auditoría GEO por sí sola descuida los cimientos. El enfoque más eficaz combina las dos, empezando por los arreglos comunes.