Qué revelan 500 auditorías sobre las citas en los LLM
En los 500 sitios auditados por Mirok, la estructura de la página pesa más que el volumen de contenido en la probabilidad de ser citado por un LLM. Una página de 600 palabras dividida en bloques autónomos se recoge más a menudo que un artículo de 3.000 palabras en prosa continua. Es el resultado más claro del estudio, y contradice la intuición dominante según la cual habría que «escribir más» para existir en las respuestas generativas.
El alcance del estudio abarca tres familias de sitios: SaaS B2B (54 % de la muestra), agencias y consultoras (28 %), editores de software y plataformas técnicas (18 %). Los sitios son mayoritariamente hispanohablantes y angloparlantes, con una facturación de entre 500.000 euros y 50 millones de euros. Se observaron tres motores: ChatGPT (con búsqueda web activada), Perplexity y Gemini. Las citas se contaron sobre un panel de 40 consultas por sitio, repartidas entre consultas de decisión («mejor herramienta para…», «X vs Y»), consultas de compra («tarifa», «precio», «cuánto cuesta») y consultas de definición («qué es…»).
El método de conteo es sencillo: para cada consulta, se registran los dominios citados como fuente, se identifica la página exacta cuando el motor la expone y después se vincula esa página a un formato editorial. Un sitio se considera «citado» en cuanto una de sus páginas aparece al menos una vez en el conjunto del panel. Los resultados detallados por tipología de sitio están disponibles en nuestro análisis de las 500 auditorías Mirok sobre sitios SaaS B2B.
Metodología: cómo una página se vuelve citable
Se midieron seis criterios en cada página citada y después se compararon con las páginas del mismo sitio que nunca aparecen. El primero es la presencia de una respuesta autónoma: un párrafo o un bloque que responde a una pregunta sin depender del resto de la página. El segundo es la presencia de datos cifrados y fechados (precios, porcentajes, volúmenes, plazos). El tercero es la densidad de entidades nombradas: nombres de productos, de competidores, de tecnologías, de normativas.
Los tres criterios siguientes son técnicos. La frescura primero: una fecha de actualización visible y coherente con el contenido. La accesibilidad del crawler después: contenido renderizado en el servidor, ausencia de bloqueo en el robots.txt, sin muro de inicio de sesión en las páginas clave. El marcado por último: títulos jerarquizados, listas, tablas HTML, datos estructurados cuando tienen sentido.
Hay que plantear tres límites para ser honestos. La muestra de 500 sitios no es representativa de toda la web: está sesgada hacia empresas que ya invierten en su visibilidad. Las respuestas de los LLM varían de un día a otro, de una sesión a otra y a veces de un usuario a otro: una tasa de citación es una tendencia, no una constante. Por último, ningún motor publica sus datos propietarios de selección de fuentes: observamos correlaciones sólidas, no reglas oficiales.
El ranking de formatos: tasa de citación observada
| Formato de página | Tasa de citación observada | Porcentaje de sitios que lo tienen |
|---|---|---|
| Comparativas y páginas versus | 68 % | 41 % |
| Páginas de precios | 61 % | 79 % |
| Documentación técnica | 57 % | 33 % |
| Casos de éxito cifrados | 52 % | 46 % |
| Glosarios y definiciones | 49 % | 19 % |
| Páginas de alternativas («alternativa a X») | 44 % | 27 % |
| FAQ estructuradas | 38 % | 52 % |
| Artículos de blog genéricos | 21 % | 94 % |
Lectura inmediata: los dos formatos más citados no son los más extendidos. Las comparativas lideran aunque menos de uno de cada dos sitios las publica. Las páginas de precios están masivamente presentes, pero solo se convierten en citas cuando son extraíbles. La documentación técnica, citada en el 57 % de los casos, solo existe en un tercio de los sitios de la muestra.
Al contrario, el artículo de blog genérico es el formato más producido (94 % de los sitios) y el menos citado (21 %). El problema no es el blog, es el blog no estructurado: los artículos que consiguen citas son los que contienen una sección comparativa, una tabla, una definición aislable o una cifra fechada. El formato declarado importa menos que la estructura interna.
Consecuencia directa para una estrategia editorial: dejar de producir volumen esperando que una página enganche y empezar a producir formatos con intención clara. Un sitio que añade tres comparativas y una página de precios legible hace más por su visibilidad en IA que un sitio que duplica su ritmo de publicación. Las diferencias entre formatos son lo bastante amplias como para justificar un arbitraje explícito en el calendario editorial.
Comparativas y páginas versus: el formato más recogido
Las comparativas dominan porque responden a una intención de decisión, la que precede a la compra. Cuando un usuario le pregunta a ChatGPT «qué herramienta elegir entre A y B», el motor busca una página que plantee los criterios, los compare y decida. Una página que se limita a describir su propio producto no aporta materia comparable: se descarta en favor de un contenido de terceros que sí ha hecho el trabajo de ponerlos frente a frente.
La estructura ganadora es casi siempre la misma: una tabla HTML legible, criterios nombrados en columnas, una fila por solución y un veredicto por caso de uso en lugar de un único ganador. Las páginas que declaran «somos los mejores» sin criterios explícitos obtienen tasas de citación cercanas a las de los artículos genéricos. Las que asumen límites («menos adecuado si necesitas X») se recogen más a menudo, porque aportan un arbitraje aprovechable.
La corrección que hay que aplicar se resume en cuatro puntos. Primero, sustituir las capturas de pantalla de tablas por tablas HTML reales, legibles por un crawler. Segundo, nombrar explícitamente los criterios de comparación (precio, límites del plan, integraciones, cumplimiento normativo, plazo de implantación). Tercero, mostrar una fecha de actualización visible y mantenerla al día, porque una comparativa desactualizada pierde su valor como fuente. Cuarto, escribir un veredicto por perfil de uso, con la frase que resume la elección en una línea aislable. Este último punto conecta con los principios detallados en nuestra guía sobre las 8 correcciones GEO para estructurar tus páginas.
Páginas de precios y documentación técnica: las fuentes que prefieren las IA
La página de precios es la fuente factual de referencia. Los motores buscan en ella planes, límites cifrados, unidades (por usuario, por mes, por evento), condiciones (compromiso, exceso de uso, descuento anual). Una página de precios bien construida se cita en el 61 % de los casos en las consultas de compra, lo que la convierte en el segundo formato más recogido del estudio.
El problema más frecuente detectado en las auditorías es la extracción imposible: los precios se cargan en JavaScript, se muestran en un panel tras iniciar sesión o quedan enterrados en una imagen. Un crawler que no ve el precio no puede citarlo. La corrección consiste en incluir los precios en el HTML servido, acompañarlos de una fecha de actualización y exponer los límites de cada plan, no solo las promesas. Una página que dice «hasta 10.000 eventos al mes, y después 0,02 euros por evento adicional» es infinitamente más citable que una página que dice «precios flexibles».
La documentación técnica desempeña el mismo papel en otro terreno: es la fuente de verdad para los requisitos previos, los comandos, las versiones y las compatibilidades. Se cita en el 57 % de los casos, a menudo en consultas que el equipo de marketing nunca consideró comerciales. La corrección es estructural: dividir la doc en bloques de pregunta-respuesta, un título por problema resuelto, un comando por bloque, una versión y una fecha por página. Las páginas de doc que empiezan con tres párrafos de contexto antes de llegar al comando se ignoran sistemáticamente en favor de un foro o un repositorio de GitHub de terceros.
Casos de éxito cifrados y glosarios: los formatos infrautilizados
Estos dos formatos muestran tasas de citación altas para una presencia muy baja en la muestra. Los casos de éxito cifrados se citan en el 52 % de los casos aunque menos de uno de cada dos sitios los publica, y los glosarios en el 49 % de los casos aunque solo existen en el 19 % de los sitios. Es el principal filón de oportunidad identificado por las 500 auditorías.
Un caso de éxito citable se apoya en tres elementos: cifras fechadas, un contexto de cliente identificable (sector, tamaño, stack) y un antes/después medible. «Ayudamos a un cliente a mejorar» no produce ninguna cita. «En 60 días, un editor SaaS de 40 personas pasó de 3 a 17 citas en Perplexity sobre 40 consultas de compra» es una frase que los motores pueden recoger tal cual. La corrección es, por tanto, editorial antes que técnica: imponer un formato de cifras fechadas y un recuadro de contexto al inicio de cada caso de éxito.
Los glosarios funcionan de otra manera. Captan las consultas de definición, que representan una parte importante de las preguntas planteadas a los LLM. Una definición ganadora es corta, autónoma, empieza por el término en negrita o en título, contiene las entidades relacionadas y los sinónimos, y termina con una frase de puesta en contexto. Una página de glosario que reúne 40 definiciones de 60 palabras, cada una con su ancla, genera más citas que un artículo de fondo de 4.000 palabras sobre el mismo tema. La corrección es sencilla: crear la página, una definición por bloque, un marcado limpio y enlazar cada definición hacia la página de producto correspondiente.
La tabla de correcciones, formato por formato
| Formato | Problema más frecuente detectado | Corrección a aplicar | Esfuerzo estimado |
|---|---|---|---|
| Comparativas y versus | Tablas en imagen, veredicto ausente | Tabla HTML, criterios nombrados, veredicto por caso de uso, fecha de actualización | 4 a 6 h por página |
| Páginas de precios | Precios cargados en JavaScript u ocultos | Precios en el HTML servido, límites cifrados, fecha de actualización | 2 a 4 h |
| Documentación técnica | Contexto antes de la respuesta, sin versión | Bloques de pregunta-respuesta, comando al inicio, versión y fecha por página | 1 a 2 h por página |
| Casos de éxito cifrados | Ninguna cifra fechada, contexto difuso | Cifras fechadas, contexto de cliente, antes/después medible | 3 a 5 h por caso |
| Glosarios y definiciones | Formato ausente en el sitio | 30 a 50 definiciones de 60 palabras, una por bloque, entidades y sinónimos | 6 a 10 h en total |
| Páginas de alternativas | Copia de la comparativa sin criterios | Criterios explícitos, casos en los que la alternativa es preferible | 3 a 4 h por página |
| FAQ estructuradas | Preguntas en acordeón no indexables | Preguntas en títulos, respuestas autónomas de 2 a 4 frases | 1 a 2 h |
| Artículos de blog genéricos | Prosa continua sin bloque aislable | Insertar una tabla, una definición, una cifra fechada por artículo | 30 min por artículo |
Esta tabla es la parte del estudio más directamente reutilizable: transforma una constatación de visibilidad en una lista de tareas. En la práctica, los sitios que aplican las tres primeras filas (comparativas, precios, doc) cubren la mayoría de las consultas de compra de su mercado. Las filas siguientes sirven para ampliar la cobertura hacia las consultas de definición y de sustitución.
Un apunte de método para terminar: estas correcciones no se aplican a ciegas. Cada modificación de página debe validarse antes de publicarse y después monitorizarse para medir el efecto real sobre las citas. Es exactamente el protocolo descrito en nuestro artículo sobre la automatización con validación humana: detección, auditoría, sourcing, validación, ejecución.
Cómo auditar tus propios formatos en 7 días
El plan se resume en cinco etapas, una por día laborable, con dos días de margen para el análisis.
Día 1: inventariar tus páginas por formato. Haz una lista de todas las URL indexables y clasifícalas en ocho categorías (comparativa, precios, doc, caso de éxito, glosario, alternativa, FAQ, blog). Verás de inmediato qué formatos faltan, y ahí suele estar la ganancia más rápida.
Día 2: construir un panel de 20 consultas de compra. Diez consultas de decisión («mejor herramienta para…», «X vs Y»), cinco consultas de precio, cinco consultas de definición. Formúlalas como las plantearían tus clientes, no como te gustaría que te buscaran.
Día 3: probar esas 20 consultas en ChatGPT, Perplexity y Gemini, y anotar quién es citado en tu lugar. El resultado suele ser incómodo: descubres que tres competidores y dos directorios ocupan el espacio que pretendías.
Día 4: cruzar los resultados con tu inventario. Para cada consulta en la que no te citan, identifica el formato que ha ganado y comprueba si tienes ese formato. Las carencias de formato explican la mayoría de las ausencias.
Día 5: priorizar por intención comercial. Una comparativa que falta en tu mercado principal va antes que un glosario. Calcula el esfuerzo con la tabla de la sección anterior y pon en marcha los dos o tres primeros proyectos.
Los días 6 y 7 sirven para poner en marcha el seguimiento: sin medición repetida, no sabrás si tus correcciones funcionan. Es el papel de la monitorización continua, que relanza el panel de consultas y señala los movimientos. Para ir más rápido, el reto «14 días para que ChatGPT te cite» guía estas etapas directamente en el cockpit, y el playbook Quick Win lista las diez correcciones técnicas más frecuentes detectadas por los agentes. Si quieres industrializar el proceso en varios sitios, la lógica se describe en nuestro artículo sobre la visibilidad IA para agencias.
FAQ
¿Qué formato de contenido es el más citado por ChatGPT, Perplexity y Gemini?
En el estudio, las comparativas y páginas versus lideran con un 68 % de tasa de citación, seguidas de las páginas de precios (61 %) y de la documentación técnica (57 %). Después vienen los casos de éxito cifrados, los glosarios, las páginas de alternativas y las FAQ. El orden importa menos que el principio subyacente: una página estructurada en bloques autónomos se cita más a menudo que una página larga y no estructurada.
¿Hay que escribir más largo para que las IA te citen?
No. Las 500 auditorías muestran que la longitud no está correlacionada con la tasa de citación, mientras que la presencia de bloques aislables sí lo está, y mucho. Un párrafo que responde a una pregunta sin depender del contexto de la página es directamente reutilizable por un motor. Un artículo de 3.000 palabras en prosa continua, sin tabla, sin definición aislable y sin cifra fechada, rara vez se recoge.
¿Puede realmente citarse una página de precios en una respuesta de IA?
Sí, es una de las fuentes más recogidas en las consultas de compra, con un 61 % de tasa de citación observada. La condición es técnica: los precios y los límites de cada plan deben estar presentes en el HTML servido, sin depender de JavaScript ni de un inicio de sesión. Añade una fecha de actualización visible, porque una tarifa sin fecha pierde su valor como fuente.
¿Cuánto tiempo tarda en aparecer citas?
En las auditorías, la reindexación técnica de una página modificada suele tardar entre unos días y tres semanas. La estabilización de las citas es más lenta: cuenta de uno a tres meses para observar un movimiento claro y duradero en un panel de consultas. Por eso la monitorización continua es imprescindible: mide el efecto real en lugar de suponer que una corrección ha funcionado.
¿Cómo saber si los LLM citan mi contenido?
Prueba un panel de 20 consultas de compra en ChatGPT, Perplexity y Gemini, registra las fuentes citadas y compáralas con tus propias páginas. Repite la operación a intervalos regulares, porque las respuestas varían de una sesión a otra. La monitorización GEO de Mirok automatiza este seguimiento: los agentes relanzan el panel, detectan los movimientos de citación y señalan las oportunidades a tratar, con validación humana antes de la ejecución.