llms.txt.
Tipos de rastreadores de IA
Es crucial diferenciar entre los bots que recopilan datos para entrenar modelos futuros y aquellos que navegan para responder a usuarios en vivo:OpenAI (GPTBot vs ChatGPT-User)
OpenAI (GPTBot vs ChatGPT-User)
GPTBot: Es el rastreador de rastreo masivo utilizado para mejorar e incorporar datos en futuros modelos fundacionales de OpenAI.ChatGPT-User: Se activa únicamente cuando un usuario en ChatGPT hace una pregunta que requiere navegación web en vivo o cuando se interactúa con GPTs personalizados. Nunca bloquees este agente si deseas que ChatGPT cite tu web.OAI-SearchBot: Rastreador especializado para el motor de búsqueda en tiempo real de OpenAI.
Perplexity AI (PerplexityBot)
Perplexity AI (PerplexityBot)
PerplexityBot: Rastreador de alta frecuencia que examina páginas web al vuelo cuando los usuarios ejecutan consultas en Perplexity. Si bloqueas este bot, desaparecerás de las fuentes y citas de Perplexity.
Anthropic (ClaudeBot)
Anthropic (ClaudeBot)
ClaudeBot: Bot oficial de Anthropic que indexa contenido para dar contexto a Claude y verificar información web.
Google (Google-Extended)
Google (Google-Extended)
Google-Extended: Permite a los administradores web decidir si su contenido puede ser utilizado para entrenar los modelos de Gemini y Vertex AI, sin afectar su posicionamiento en la búsqueda orgánica regular de Google (Googlebot).
Configuración óptima de robots.txt para GEO
Un archivorobots.txt moderno debe equilibrar la protección de áreas privadas o sensibles con la apertura estratégica a los motores de búsqueda de IA.
A continuación se muestra una plantilla recomendada:
El estándar llms.txt
¿Qué es llms.txt?
El estándarllms.txt es una propuesta comunitaria adoptada ampliamente por la industria para proporcionar a los modelos de lenguaje información estructurada, concisa y libre de ruido visual (HTML, scripts, anuncios o estilos CSS).
Se ubica directamente en la raíz de tu dominio: https://tudominio.com/llms.txt.
¿Por qué beneficia a tu marca?
- Ahorro de ventana de contexto: Los LLMs tienen límites de tokens. Un archivo en Markdown limpio consume un 90% menos de tokens que una página HTML completa.
- Mayor fidelidad de información: Le proporciona al modelo una fuente estructurada de definiciones oficiales, productos y documentación redactada directamente por el equipo de la marca.
- Indexación semántica directa: Motores generativos y asistentes de IA inspeccionan proactivamente la raíz del dominio en busca de este archivo para consultar y resumir la información oficial de la empresa.
Estructura recomendada de llms.txt
Un archivollms.txt estándar se escribe en Markdown e incluye:
- Título de la empresa (
# Nombre) - Descripción de una línea (
> Resumen) - Párrafo introductorio
- Enlaces a documentación y páginas clave con descripciones breves
Archivo extendido: llms-full.txt
Opcionalmente, puedes publicar un archivo complementario llamadollms-full.txt que contenga el texto completo de tu documentación técnica o catálogo de productos concatenado en un solo archivo plano.
Esto permite a herramientas como Claude Projects, NotebookLM o desarrolladores que construyen agentes sobre tu plataforma descargar todo el contexto de tu empresa en una sola llamada HTTP limpia.