Que un motor de respuesta te encuentre en 2026 es, sobre todo, un problema técnico con cola de contenido, no al revés. Esta es la checklist que Polargate recorre en cada web que construye o mantiene, con la evidencia detrás de cada punto.
Casi ningún rastreador de IA ejecuta JavaScript
Empieza por aquí, porque este hecho condiciona todo lo demás. Cuando ChatGPT, Claude o Perplexity piden tu página, leen el HTML tal cual lo devuelve el servidor. No ejecutan tu JavaScript. Vercel y MERJ midieron más de 500 millones de peticiones de GPTBot y registraron cero ejecuciones de JavaScript. Si tu web es una cáscara de React que rellena un div vacío tras la hidratación, esos motores ven un div vacío.
La foto actual, rastreador a rastreador:
- Googlebot: renderiza JavaScript (Chromium permanentemente actualizado). Alimenta Search, los resúmenes de IA y AI Mode.
- Bingbot: renderiza JavaScript (motor de Edge), aunque con las SPA se defiende peor que Google. Alimenta Bing, Copilot y parte de la recuperación de ChatGPT.
- Applebot: renderiza JavaScript (rastreador de navegador). Alimenta Siri, Spotlight y Apple Intelligence.
- OAI-SearchBot, que construye el índice de búsqueda de ChatGPT: sin JavaScript.
- ChatGPT-User, la petición en vivo que se dispara cuando alguien pregunta por tu página: sin JavaScript.
- GPTBot (entrenamiento): sin JavaScript. Se descarga tus ficheros .js y nunca los ejecuta.
- Claude-SearchBot y Claude-User: sin JavaScript.
- ClaudeBot (entrenamiento): sin JavaScript. Alrededor del 24% de sus peticiones son ficheros JS que jamás ejecuta.
- PerplexityBot y Perplexity-User: sin JavaScript. Perplexity es el motor más sensible a la frescura del grupo.
- Amazonbot, Meta-WebIndexer, Bytespider: sin renderizado documentado.
- Navegadores agénticos (ChatGPT Atlas, Perplexity Comet): son Chromium de verdad, así que sí renderizan. En abril de 2026 supusieron alrededor del 70% del tráfico agéntico, con Comet en el 48% y Atlas en el 21%.
Por eso el primer punto de la lista no es una etiqueta meta, es HTML estático para cada ruta pública. En una web de noticias que reconstruyó Polargate, al rastreador se le servían 14 caracteres ("Redirecting...") y hoy recibe 11.421 caracteres de texto de artículo; el documento pasó de una cáscara de 3.559 bytes a un cuerpo real. En una web de hotel que mantenemos, Search Console mostraba solo 4 de unas 30 páginas indexadas antes del prerenderizado.
Compruébalo como lo haría un rastreador, no en las herramientas del navegador: pide la URL con el user agent del bot y busca tu H1 y tu texto en la respuesta. Si no está en el código fuente, no existe.
Deja entrar a los bots correctos, y revisa también el borde
Cada proveedor separa hoy tres tipos de agente: rastreadores de entrenamiento (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended), indexadores de búsqueda (OAI-SearchBot, Claude-SearchBot, PerplexityBot, Meta-WebIndexer) y peticiones lanzadas por el usuario (ChatGPT-User, Claude-User, Perplexity-User). OpenAI lo dice sin rodeos: una web que bloquee OAI-SearchBot no aparecerá en las respuestas de búsqueda de ChatGPT.
- Permite de forma explícita, por nombre, a los agentes de búsqueda y respuesta en robots.txt.
- Decide sobre los de entrenamiento como una cuestión de negocio aparte. Bloquearlos no te saca de las citas, pero sí te deja fuera de los pesos del modelo.
- No bloquees nunca /assets/, CSS ni JS: rompes el renderizado de Googlebot y Applebot, los dos que sí renderizan.
- Audita el borde. Un preajuste de cortafuegos que deniega "bots de IA", o un reto antibot, devuelve 403 a peticiones que no pueden resolver retos, y ahí no te salva ningún robots.txt.
- Arregla los 404. Cerca del 35% de las peticiones de GPTBot y ClaudeBot caen en URL inexistentes, así que mantén las rutas viejas redirigidas.
- Google-Extended y Applebot-Extended son tokens de uso, no rastreadores. Bloquearlos no afecta a la búsqueda ni a los resúmenes de IA.
Estos fallos son silenciosos. En una auditoría que hizo Polargate sobre la web de un cliente, un error de herencia de grupos en robots.txt estaba estrechando sin avisar qué agentes tenían permiso, junto a otros quince errores confirmados.
Pon la respuesta primero
El modo instantáneo de ChatGPT ve el title, el H1 y unos 200 caracteres posteriores. Perplexity se queda con las primeras 100 palabras, lee unas diez páginas por consulta y cita tres o cuatro. El 44,2% de las citas de ChatGPT sale del primer 30% de la página. Un vídeo de portada y un H1 que solo es un eslogan gastan ese presupuesto en nada.
La estructura que se acaba citando
- Un solo H1 que nombre la entidad y la afirmación, seguido de inmediato por una respuesta en texto plano de una o dos frases.
- H2 redactados como la pregunta que escribiría un comprador. El contenido en forma de pregunta se cita alrededor del doble, el 78,4% de las citas ligadas a preguntas sale de los encabezados, y un encabezado que coincide bien con la consulta se cita el 41% de las veces frente al 29% de uno flojo.
- Debajo de cada encabezado, una respuesta autónoma de 40 a 70 palabras, en lenguaje definitorio ("X es", "X se refiere a").
- Tablas HTML reales para comparativas y precios. Una tabla montada desde JSON en tiempo de ejecución, o exportada como imagen, no aporta nada.
- Cifras concretas con unidad y fecha, citas atribuidas y enlaces a la fuente original. El estudio GEO de Princeton y Georgia Tech, sobre 10.000 consultas, midió +41% de visibilidad al añadir citas textuales, +33% al añadir estadísticas y +28% al citar fuentes, con las mayores subidas en los sitios peor posicionados.
- Slugs en lenguaje natural. Ahrefs midió un 89,8% de tasa de cita frente al 81,1% de los opacos.
- Páginas enfocadas en lugar de una guía definitiva. Sobre 815.000 pares consulta-página, las que cubrían del 26% al 50% de las subconsultas de un motor con profundidad ganaban a las que las cubrían todas por encima.
La frescura es la señal que sí controlas
Las citas de IA son de media un 25,7% más recientes que los resultados orgánicos, y de los listados de "mejores X" que citó ChatGPT, el 79,1% se había actualizado dentro del año en curso. Un año visible en el título se correlacionó con cerca de un 30% más de citas en un estudio de 22,7 millones de citas.
- Muestra una fecha de actualización visible, refléjala en dateModified y úsala como lastmod del sitemap.
- Cámbiala solo cuando el texto cambie de verdad. Estampar la fecha del build en cada página destruye la señal y enseña a los rastreadores a ignorar tu sitemap.
- Avisa a IndexNow en cada despliegue a producción. Bing recorre las URL enviadas en minutos, y su índice alimenta a Copilot y a parte de la recuperación de ChatGPT.
- Verifica la web en Bing Webmaster Tools, no solo en Search Console.
Lo que no funciona, por mucho que lo leas
- llms.txt. Los rastreadores de consumo no lo piden, la búsqueda de Google lo ignora y ningún estudio muestra subida de citas. Sirve para herramientas de código y agentes, no como palanca de visibilidad.
- El schema como palanca. Ahrefs siguió 1.885 páginas que añadieron datos estructurados: los resúmenes de IA se movieron un -4,6%, AI Mode un +2,4% y ChatGPT un +2,2%, todo dentro del ruido. Mantén el schema exacto y mínimo para indexación y resultados enriquecidos, y no marques nunca datos que no estén visibles en la página.
- nosnippet y max-snippet en páginas que quieres que citen. Eliminan justo la elegibilidad que persigues.
- Trocear las páginas en fragmentos "para los LLM" o publicar páginas duplicadas solo para IA. Google dice que nada de eso hace falta, y el contenido paralelo oculto es un riesgo de política.
Mide donde el tráfico aparece de verdad
Los bots de IA no ejecutan JavaScript, así que la analítica de cliente no los ve nunca, y entre el 35% y el 70% de las visitas humanas llegadas desde IA aparecen sin referente alguno.
- Logs de servidor (vale un log drain de Vercel) filtrados por user agent: quién pidió qué y con qué código de estado. Alerta ante 403 y 429 a cualquier rastreador de respuesta.
- Un grupo de canales personalizado en GA4 para asistentes de IA. GA4 asigna el medio ai-assistant desde mayo de 2026, pero Perplexity sigue cayendo en Referral.
- El informe de IA generativa de Search Console, disponible en todos los sitios desde el 31 de agosto de 2026, y el informe AI Performance de Bing, el único panel de primera parte que cuenta citas por URL.
- Un panel fijo de 25 a 40 preguntas de comprador, ejecutado cada mes en varios motores, anotando mención, posición y URL citada. Las citas y las menciones de marca no van de la mano, así que mide las dos.
Nada de esto es un truco. Es la disciplina normal de servir HTML real, decir cosas ciertas en un orden legible y comprobar que las máquinas llegan a ellas.



