> ## Documentation Index
> Fetch the complete documentation index at: https://docs.wudlet.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Rastreadores de IA y el estándar llms.txt

> Aprende a configurar tu archivo robots.txt para bots de inteligencia artificial e implementar el estándar llms.txt para facilitar la lectura de tu contenido.

Los modelos generativos como ChatGPT, Perplexity, Claude y Gemini obtienen su conocimiento mediante dos métodos: el **entrenamiento previo** (lectura de datos en masa) y la **búsqueda en tiempo real** (navegación web inmediata para responder a una consulta del usuario).

Para asegurarte de que tu sitio web sea accesible y comprensible para estos agentes, es fundamental dominar la configuración de **User-Agents de IA** y adoptar el nuevo estándar de la industria: **`llms.txt`**.

***

## Tipos de rastreadores de IA

Es crucial diferenciar entre los bots que recopilan datos para entrenar modelos futuros y aquellos que navegan para responder a usuarios en vivo:

<AccordionGroup>
  <Accordion title="OpenAI (GPTBot vs ChatGPT-User)" icon="openai">
    * **`GPTBot`**: Es el rastreador de rastreo masivo utilizado para mejorar e incorporar datos en futuros modelos fundacionales de OpenAI.
    * **`ChatGPT-User`**: Se activa únicamente cuando un usuario en ChatGPT hace una pregunta que requiere navegación web en vivo o cuando se interactúa con GPTs personalizados. **Nunca bloquees este agente si deseas que ChatGPT cite tu web**.
    * **`OAI-SearchBot`**: Rastreador especializado para el motor de búsqueda en tiempo real de OpenAI.
  </Accordion>

  <Accordion title="Perplexity AI (PerplexityBot)" icon="globe">
    * **`PerplexityBot`**: Rastreador de alta frecuencia que examina páginas web al vuelo cuando los usuarios ejecutan consultas en Perplexity. Si bloqueas este bot, desaparecerás de las fuentes y citas de Perplexity.
  </Accordion>

  <Accordion title="Anthropic (ClaudeBot)" icon="brain">
    * **`ClaudeBot`**: Bot oficial de Anthropic que indexa contenido para dar contexto a Claude y verificar información web.
  </Accordion>

  <Accordion title="Google (Google-Extended)" icon="google">
    * **`Google-Extended`**: Permite a los administradores web decidir si su contenido puede ser utilizado para entrenar los modelos de Gemini y Vertex AI, sin afectar su posicionamiento en la búsqueda orgánica regular de Google (`Googlebot`).
  </Accordion>
</AccordionGroup>

***

## Configuración óptima de robots.txt para GEO

Un archivo `robots.txt` moderno debe equilibrar la protección de áreas privadas o sensibles con la apertura estratégica a los motores de búsqueda de IA.

A continuación se muestra una plantilla recomendada:

```txt theme={null}
# Permitir a los motores de búsqueda tradicionales
User-agent: Googlebot
Allow: /

User-agent: Bingbot
Allow: /

# Permitir a los rastreadores de búsqueda en vivo de IA
User-agent: ChatGPT-User
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: ClaudeBot
Allow: /

# Permitir a los rastreadores generales de LLMs en páginas públicas
User-agent: GPTBot
Allow: /
Disallow: /admin/
Disallow: /api/
Disallow: /dashboard/

# Bloqueo selectivo de áreas privadas para todos los bots
User-agent: *
Disallow: /admin/
Disallow: /private/
Disallow: /checkout/

# Localización de mapas de sitio y archivos para LLMs
Sitemap: https://wudlet.com/sitemap.xml
```

<Tip>
  Si utilizas Cloudflare u otro proveedor de CDN/WAF, revisa la sección de **"AI Scrapers and Crawlers"**. Asegúrate de que las reglas de protección contra bots no estén bloqueando por error a `PerplexityBot` o `ChatGPT-User` con desafíos de Captcha o código HTTP 403.
</Tip>

***

## El estándar llms.txt

### ¿Qué es llms.txt?

El estándar **`llms.txt`** es una propuesta comunitaria adoptada ampliamente por la industria para proporcionar a los modelos de lenguaje información estructurada, concisa y libre de ruido visual (HTML, scripts, anuncios o estilos CSS).

Se ubica directamente en la raíz de tu dominio: `https://tudominio.com/llms.txt`.

### ¿Por qué beneficia a tu marca?

1. **Ahorro de ventana de contexto:** Los LLMs tienen límites de tokens. Un archivo en Markdown limpio consume un 90% menos de tokens que una página HTML completa.
2. **Mayor fidelidad de información:** Le proporciona al modelo una fuente estructurada de definiciones oficiales, productos y documentación redactada directamente por el equipo de la marca.
3. **Indexación semántica directa:** Motores generativos y asistentes de IA inspeccionan proactivamente la raíz del dominio en busca de este archivo para consultar y resumir la información oficial de la empresa.

### Estructura recomendada de llms.txt

Un archivo `llms.txt` estándar se escribe en Markdown e incluye:

* **Título de la empresa (`# Nombre`)**
* **Descripción de una línea (`> Resumen`)**
* **Párrafo introductorio**
* **Enlaces a documentación y páginas clave con descripciones breves**

```markdown theme={null}
# Wudlet

> Wudlet es una plataforma de optimización para motores generativos (GEO) y analítica de agentes de IA.

Wudlet permite a empresas, startups y equipos de marketing monitorear y optimizar su presencia de marca en respuestas de modelos de lenguaje como ChatGPT, Perplexity, Claude y Google AI Overviews.

## Productos y Módulos

- [Visibilidad en IA](https://wudlet.com/features/visibility): Monitoreo de menciones de marca, sentimiento y cuota de voz frente a competidores.
- [Crawler Analytics](https://docs.wudlet.com/crawler-analytics/overview): SDK para detectar y medir tráfico generado por agentes de IA y rastreadores web.
- [Biblioteca de Prompts](https://docs.wudlet.com/guides/entendiendo-los-prompts): Gestión y ejecución diaria de consultas de mercado automatizadas.

## Documentación y Enlaces Clave

- [Documentación oficial](https://docs.wudlet.com): Guías técnicas, integración de SDKs y casos de uso.
- [Guía GEO y Entidad](https://docs.wudlet.com/guides/guia-optimizacion-geo-y-entidad): Cómo estructurar la presencia de tu marca e implementar Schema.org.
- [Auditoría de Sitio para IA](https://docs.wudlet.com/guides/auditoria-y-escaneo-de-sitio-para-ia): Framework para auditar la compatibilidad de tu web con LLMs.

## Información de la Empresa

- **Fundación:** 2024
- **Sitio web:** https://wudlet.com
- **Repositorio:** https://github.com/wudlet
```

***

## Archivo extendido: llms-full.txt

Opcionalmente, puedes publicar un archivo complementario llamado **`llms-full.txt`** que contenga el texto completo de tu documentación técnica o catálogo de productos concatenado en un solo archivo plano.

Esto permite a herramientas como Claude Projects, NotebookLM o desarrolladores que construyen agentes sobre tu plataforma descargar todo el contexto de tu empresa en una sola llamada HTTP limpia.
