Cómo estructurar una página que un motor generativo pueda citar
Cuatro puertas deciden si un motor puede citarte: acceso, texto, bloque y atribución. Cada una con la prueba que la verifica y la documentación oficial del motor.
Un motor generativo sólo puede citar una página que pasa cuatro puertas, en este orden: su robot tiene que poder entrar, el contenido tiene que existir como texto, tiene que haber un bloque que se sostenga solo al sacarlo de la página, y dentro de ese bloque tiene que quedar claro de quién es. Si falla la primera, las otras tres dan igual. Abajo está cada puerta con la prueba concreta que la verifica y la documentación oficial del motor que la define.
¿Qué necesita un motor generativo para poder citarte?
Un motor no te da un lugar en una lista: arma una respuesta y le cuelga un puñado de fuentes. Para ser una de ellas, tu página tiene que resolver cuatro cosas distintas, y cada una se rompe por su cuenta:
- Acceso. El agente del motor puede hacer la petición HTTP y recibir tu HTML.
- Texto. Lo que quieres que citen está en el HTML, no sólo después de ejecutar JavaScript ni dentro de una imagen.
- Bloque. Existe un fragmento que responde una pregunta completa y sigue teniendo sentido fuera de la página.
- Atribución. Ese fragmento nombra al negocio, no dice "nosotros".
Casi todo el contenido de GEO habla de la tercera. Las que más vemos rotas en sitios reales son la primera y la segunda.
¿Qué bots tienen que poder entrar a tu página?
Cada motor rastrea con varios agentes, y hacen cosas distintas. Bloquear el equivocado es el fallo silencioso que más vemos:
- OpenAI documenta tres:
OAI-SearchBotpara búsqueda,GPTBotpara entrenamiento yChatGPT-Userpara visitas que dispara un usuario. Los ajustes son independientes entre sí, y OpenAI advierte que los sitios excluidos deOAI-SearchBotno aparecerán en las respuestas de búsqueda de ChatGPT. También avisa que su sistema tarda unas 24 horas en reflejar un cambio en turobots.txt. - Perplexity documenta dos:
PerplexityBotpara indexar yPerplexity-Userpara lo que pide un usuario en el momento. El segundo, dice su documentación, generalmente ignorarobots.txtporque la petición la originó una persona. - Anthropic documenta tres:
ClaudeBotpara entrenamiento,Claude-Userpara peticiones de usuario yClaude-SearchBotpara búsqueda. - Google separa dos cosas que se confunden todo el tiempo. Googlebot es el que gobierna Search.
Google-Extendedno tiene agente propio: es un token de control enrobots.txtque decide si tu contenido alimenta el entrenamiento y el grounding de Gemini, y Google aclara que no afecta tu inclusión en Google Search.
Ahí está la trampa: bloquear Google-Extended te deja intacto en Google y te saca del grounding de Gemini. Es legítimo, pero casi nunca es una decisión: es una línea heredada que nadie releyó.
Y hay una capa antes de robots.txt que rompe más sitios de los que debería: el WAF o el CDN. Perplexity dedica media página a permitir sus agentes en Cloudflare y AWS WAF. Google lo pone en su propia guía de funciones de IA: hay que asegurarse de que el rastreo esté permitido en robots.txt y en cualquier CDN o infraestructura de hosting. Un 403 del firewall se ve, desde afuera, igual que una página que no existe.
¿Tu contenido existe en texto o sólo después de ejecutar JavaScript?
Google documenta tres fases para una aplicación con JavaScript: rastreo, renderizado e indexado, con el renderizado en una cola aparte. Google sí ejecuta tu JavaScript, sólo que después.
Los demás motores no documentan una fase de renderizado en sus páginas públicas de bots. No decimos que no la tengan; decimos que no la publican, y no conviene apostar tu visibilidad a algo que nadie documentó. La recomendación de Google es explícita en el mismo documento de funciones de IA: que el contenido importante esté disponible en forma de texto.
La prueba tarda diez segundos:
curl -sL -A "Mozilla/5.0 (compatible; OAI-SearchBot/1.4; +https://openai.com/searchbot)" https://tusitio.com/pagina | grep -i "tu frase clave"
Si no sale nada, esa frase no existe para un motor que no renderiza. Revisa el código fuente, no el inspector: te enseña el DOM ya ejecutado, que es justo lo que no puedes dar por hecho.
¿Cómo se ve un bloque que un motor puede levantar?
Un motor no cita páginas, cita fragmentos. Un fragmento levantable cumple cinco cosas:
- Se sostiene solo. Sácalo de la página y sigue siendo verdad y sigue siendo comprensible.
- Nombra la entidad adentro. "HopperCat entrega el diagnóstico en 48 horas hábiles" se puede citar; "lo entregamos en 48 horas hábiles" no, porque fuera de contexto no se sabe quién lo entrega.
- Empieza por la respuesta. La primera oración responde; el resto explica.
- Trae una sola afirmación con su fuente. Dos datos entrelazados en un párrafo obligan al motor a decidir cuál cita, y muchas veces la respuesta es ninguno.
- Mide entre 40 y 90 palabras. Es nuestra regla de dedo, no una cifra oficial: más corto no dice nada y más largo se parte.
El contraejemplo típico empieza con "como vimos arriba" o "nuestro proceso": ambas convierten un párrafo correcto en material inservible en cuanto sale de la página.
¿Sirve el schema para que te citen?
Hay que ser honestos, porque la respuesta cambió este año y buena parte del contenido de GEO no lo registró.
Google dice, con todas sus letras, que no necesitas crear archivos legibles por máquina ni marcado nuevo para aparecer en AI Overviews o AI Mode, y que no hay datos estructurados especiales que agregar. Y en mayo de 2026 retiró el resultado enriquecido de FAQ: la documentación de FAQPage ahora redirige a ese aviso.
Eso no vuelve inútil al schema, lo baja de categoría. Deja de ser una táctica de visibilidad y se queda como higiene de entidad: Organization sigue describiendo sin ambigüedad quién eres, y la política de Google sigue exigiendo que los datos estructurados coincidan con el texto visible de la página.
Nosotros seguimos marcando FAQPage aquí, y la razón ya no es el resultado enriquecido: escribir una sección de preguntas obliga a producir bloques auto-contenidos, que es lo que sí mueve la aguja.
¿Y el archivo llms.txt?
llms.txt es una propuesta, hoy en su versión 2, no un estándar que los motores hayan adoptado. Google afirma en la misma guía que no necesitas archivos de texto para IA. OpenAI, en cambio, publica uno para su propia documentación.
Nuestra postura, sin adornos: cuesta veinte minutos, no hace daño, y no lo cuentes como estrategia. Si el llms.txt es lo más citable que tienes, el problema está en las páginas.
¿Cómo compruebas que un motor puede leer tu página?
Cuatro pruebas, de la más rápida a la más lenta:
curlcon el agente del motor y busca tu frase, como arriba. Detecta bloqueos de WAF y contenido que sólo existe tras JavaScript.- Lee tu
robots.txtlínea por línea contra los nombres de agente de arriba. La guía de robots de Google explica cómo se resuelven los grupos cuando hay reglas que se pisan. - Inspección de URL en Search Console para ver el HTML que Googlebot recibió de verdad, no el que tú ves. La herramienta está documentada aquí.
- Revisa tus logs de servidor buscando
OAI-SearchBot,PerplexityBotyClaude-SearchBot. Si en treinta días no aparece ninguno, no tienes un problema de contenido.
¿Qué errores de estructura te sacan de las respuestas?
Los que más encontramos, en orden de frecuencia:
- El dato que quieres que citen vive detrás de una pestaña o un acordeón que se llena por JavaScript.
- La cifra clave está sólo dentro de una imagen o de un PDF.
- Los H2 son etiquetas ("Servicios", "Nuestro método") en lugar de preguntas, así que ningún encabezado coincide con lo que alguien escribe.
- El texto vive de pronombres: tres párrafos seguidos que dicen "lo hacemos", "esto permite", "el proceso".
- La misma especificación tiene valores distintos en páginas distintas. Este nos pasó a nosotros: en agosto de 2026 encontramos nuestro propio diagnóstico gratuito publicado con tres especificaciones incompatibles en tres superficies del sitio. Un motor no puede citar con confianza una cifra que tiene tres valores, así que cita la de alguien más.
Ese último casi nadie lo audita, porque cada página pasa la revisión por separado. Hay que revisar las superficies entre sí, no sólo contra la lista.
¿Por dónde empiezas?
Corre el curl de arriba sobre tus tres páginas más importantes. Si tu frase no aparece, ya sabes en qué puerta estás atorado, y nada más importa hasta arreglarla.
El contexto que hace que esto importe: en los primeros cuatro meses de 2026, 68.01% de las búsquedas en Google en Estados Unidos terminaron sin un solo clic, contra 60.45% en 2024. La respuesta se consume donde se genera, y en esa respuesta caben pocas fuentes.
Si prefieres que lo revisemos nosotros, el diagnóstico gratuito puntúa tu sitio contra 42 puntos en cinco secciones y te devuelve los fallos ordenados por costo de arreglo: 48 horas hábiles, sin llamada obligatoria.