Skip to main content
Los modelos generativos como ChatGPT, Perplexity, Claude y Gemini obtienen su conocimiento mediante dos métodos: el entrenamiento previo (lectura de datos en masa) y la búsqueda en tiempo real (navegación web inmediata para responder a una consulta del usuario). Para asegurarte de que tu sitio web sea accesible y comprensible para estos agentes, es fundamental dominar la configuración de User-Agents de IA y adoptar el nuevo estándar de la industria: llms.txt.

Tipos de rastreadores de IA

Es crucial diferenciar entre los bots que recopilan datos para entrenar modelos futuros y aquellos que navegan para responder a usuarios en vivo:
  • GPTBot: Es el rastreador de rastreo masivo utilizado para mejorar e incorporar datos en futuros modelos fundacionales de OpenAI.
  • ChatGPT-User: Se activa únicamente cuando un usuario en ChatGPT hace una pregunta que requiere navegación web en vivo o cuando se interactúa con GPTs personalizados. Nunca bloquees este agente si deseas que ChatGPT cite tu web.
  • OAI-SearchBot: Rastreador especializado para el motor de búsqueda en tiempo real de OpenAI.
  • PerplexityBot: Rastreador de alta frecuencia que examina páginas web al vuelo cuando los usuarios ejecutan consultas en Perplexity. Si bloqueas este bot, desaparecerás de las fuentes y citas de Perplexity.
  • ClaudeBot: Bot oficial de Anthropic que indexa contenido para dar contexto a Claude y verificar información web.
  • Google-Extended: Permite a los administradores web decidir si su contenido puede ser utilizado para entrenar los modelos de Gemini y Vertex AI, sin afectar su posicionamiento en la búsqueda orgánica regular de Google (Googlebot).

Configuración óptima de robots.txt para GEO

Un archivo robots.txt moderno debe equilibrar la protección de áreas privadas o sensibles con la apertura estratégica a los motores de búsqueda de IA. A continuación se muestra una plantilla recomendada:
Si utilizas Cloudflare u otro proveedor de CDN/WAF, revisa la sección de “AI Scrapers and Crawlers”. Asegúrate de que las reglas de protección contra bots no estén bloqueando por error a PerplexityBot o ChatGPT-User con desafíos de Captcha o código HTTP 403.

El estándar llms.txt

¿Qué es llms.txt?

El estándar llms.txt es una propuesta comunitaria adoptada ampliamente por la industria para proporcionar a los modelos de lenguaje información estructurada, concisa y libre de ruido visual (HTML, scripts, anuncios o estilos CSS). Se ubica directamente en la raíz de tu dominio: https://tudominio.com/llms.txt.

¿Por qué beneficia a tu marca?

  1. Ahorro de ventana de contexto: Los LLMs tienen límites de tokens. Un archivo en Markdown limpio consume un 90% menos de tokens que una página HTML completa.
  2. Mayor fidelidad de información: Le proporciona al modelo una fuente estructurada de definiciones oficiales, productos y documentación redactada directamente por el equipo de la marca.
  3. Indexación semántica directa: Motores generativos y asistentes de IA inspeccionan proactivamente la raíz del dominio en busca de este archivo para consultar y resumir la información oficial de la empresa.

Estructura recomendada de llms.txt

Un archivo llms.txt estándar se escribe en Markdown e incluye:
  • Título de la empresa (# Nombre)
  • Descripción de una línea (> Resumen)
  • Párrafo introductorio
  • Enlaces a documentación y páginas clave con descripciones breves

Archivo extendido: llms-full.txt

Opcionalmente, puedes publicar un archivo complementario llamado llms-full.txt que contenga el texto completo de tu documentación técnica o catálogo de productos concatenado en un solo archivo plano. Esto permite a herramientas como Claude Projects, NotebookLM o desarrolladores que construyen agentes sobre tu plataforma descargar todo el contexto de tu empresa en una sola llamada HTTP limpia.