No es magia: cada IA busca de una forma distinta
Cuando alguien le pregunta a ChatGPT, Claude, Perplexity o Grok "¿qué empresas hacen X en Barcelona?", da la sensación de que la IA simplemente "sabe". En realidad, detrás de cada respuesta hay un mecanismo de recuperación de información muy concreto, con su propio rastreador web, su propio índice y sus propias reglas sobre qué contenido prioriza. Entender esas diferencias es la base de cualquier estrategia real de visibilidad en IA — lo contrario es adivinar.
ChatGPT
OpenAI combina varias fuentes: para la función de búsqueda en tiempo real, ChatGPT se apoya en el índice de Bing; además, OpenAI opera sus propios rastreadores — GPTBot (para entrenar modelos), OAI-SearchBot (para indexar contenido de cara a la función de búsqueda) y ChatGPT-User (cuando el propio usuario le pide a ChatGPT que navegue una página en directo). Si alguno de estos user-agents está bloqueado en tu robots.txt, ChatGPT no puede citarte ni en resultados de búsqueda ni en respuestas en directo.
Claude
Anthropic separa claramente entrenamiento y uso en tiempo real: ClaudeBot rastrea la web para entrenamiento, mientras que la herramienta de búsqueda web que usa Claude en conversación combina un motor de búsqueda con capacidad de navegar páginas concretas cuando la pregunta lo requiere. Claude tiende a priorizar fuentes con estructura clara y contenido fácil de extraer — de ahí que el marcado de datos estructurados (schema.org) y una jerarquía de encabezados limpia influyan directamente en si te cita o no.
Perplexity
Perplexity es, de los cuatro, el que más se parece a un motor de búsqueda tradicional: con PerplexityBot rastrea la web de forma continua y ejecuta una búsqueda en vivo en cada consulta, no solo cuando hace falta. Como cubrimos en un análisis anterior, Perplexity favorece de forma muy marcada el contenido reciente (los artículos de menos de 30 días reciben hasta 3,2 veces más citas) y se apoya fuertemente en Reddit como fuente. Es el motor donde la frescura del contenido importa más que en ningún otro.
Grok
Grok (xAI) tiene una arquitectura de recuperación distinta a los demás: combina un rastreador web estándar con acceso privilegiado al flujo de datos en tiempo real de X (Twitter). Además de su búsqueda web, Grok tiene una herramienta de "X Search" separada, y su modo DeepSearch ejecuta investigación en varios pasos — formula subpreguntas, busca, evalúa resultados y itera antes de responder. El resultado es que Grok cita tanto páginas web como publicaciones de X, con un peso hacia la conversación en tiempo real que ningún otro motor tiene.
El hilo común entre los cuatro: todos dependen de que tu web sea rastreable (robots.txt que no los bloquee), tenga datos estructurados completos, y —cada vez más— hable el idioma técnico que estos sistemas esperan: un archivo llms.txt, negociación de contenido en markdown, y páginas de error que no engañen al agente haciéndole creer que todo existe.
Herramientas para comprobar si tu web está lista
Ya no hace falta adivinar. Existen herramientas gratuitas, algunas muy recientes, que analizan tu web específicamente desde la perspectiva de un agente de IA:
- Is Agentic — lanzada por Vercel a finales de agosto de 2026, usa el motor de auditoría de Ora para dar una puntuación sobre 100 basada en más de 100 comprobaciones: si tus páginas de error son reales, si tu contenido es accesible sin depender de JavaScript, si tienes datos estructurados completos, si un agente puede rellenar tus formularios, y más. Solo hay que introducir el dominio.
- Google PageSpeed Insights — además de las métricas de rendimiento y SEO habituales, ahora incluye una puntuación de "Agentic Browsing" específica sobre si un agente automatizado puede navegar tu web correctamente.
- acceptmarkdown.com — comprueba si tu web responde correctamente cuando un agente pide el contenido en formato markdown (cabecera
Accept: text/markdown), cada vez más habitual entre agentes de IA para ahorrar tokens. - Google Rich Results Test y el validador de schema.org — para comprobar que tus datos estructurados (Organization, FAQPage, Article) están completos y sin errores de sintaxis.
- Comprobación manual de
llms.txt— simplemente visitatudominio.com/llms.txt. Si da 404, ningún agente tiene un resumen legible de quién eres y a qué te dedicas.
Nuestro propio caso: qué encontramos al auditarnos
Pasamos dataversesolutions.net por Is Agentic y empezamos con un 77 sobre 100. Los problemas no eran de contenido, eran técnicos y muy concretos:
- Las rutas que no existían devolvían un 404 correcto en cuanto al código de estado, pero con la página de error genérica del hosting — sin enlaces de recuperación ni contenido útil para que un agente supiera a dónde ir.
- No respondíamos con markdown cuando un agente lo pedía explícitamente vía cabecera
Accept. - Nuestros datos estructurados tenían huecos: faltaba un bloque
ContactPointcompleto y un tipoOrganizationexplícito que un validador estricto pudiera reconocer sin ambigüedad. - No teníamos páginas de "about" ni "contact" como URLs propias — solo anclas dentro de la home, invisibles para un agente que comprueba esas rutas de forma directa.
Corregimos los cuatro puntos: página de error con contenido real y negociación markdown, datos estructurados completos, y páginas de confianza dedicadas. El resultado, verificado con escaneos en vivo repetidos: por encima de 90 sobre 100.
Qué hacer esta semana
- Corre tu dominio por Is Agentic. Tarda menos de un minuto y te da una lista priorizada de qué corregir primero.
- Comprueba tu
robots.txt. Verifica que no bloquea GPTBot, ClaudeBot, PerplexityBot ni Google-Extended. - Prueba una URL que no existe. Si tu web devuelve un 200 con la app cargada igual, cualquier agente asume que todas las rutas existen.
- Revisa si tienes
llms.txt. Si no lo tienes, es de los cambios más rápidos de implementar con más impacto. - Valida tus datos estructurados con el Rich Results Test de Google.
Conclusión
Cada IA busca distinto, pero todas comparten una exigencia mínima: que tu web sea técnicamente legible para un agente, no solo para un humano con navegador. Eso ya no es una capa opcional de SEO avanzado — es la base sobre la que se construye cualquier estrategia real de visibilidad en motores de IA.
En Dataverse Solutions auditamos y corregimos estos puntos técnicos para que tu web sea encontrable tanto por Google como por los agentes de IA que cada vez más deciden a quién recomiendan.