> ## Documentation Index
> Fetch the complete documentation index at: https://docs.wudlet.com/llms.txt
> Use this file to discover all available pages before exploring further.

# Auditoría y escaneo completo de sitio para IA

> Framework exhaustivo en 4 capas para escanear y diagnosticar el sitio web de cualquier marca, detectando deficiencias técnicas, semánticas y de entidad para GEO.

Medir el porcentaje de visibilidad en plataformas de IA es solo el punto de partida. Para optimizar la presencia digital y lograr que los motores de IA y búsqueda recomienden una marca de forma consistente, es indispensable ejecutar una **auditoría técnica y semántica completa del sitio web**.

A diferencia del SEO tradicional (que evalúa enlaces entrantes, PageRank y densidad de palabras clave), un **Escaneo para IA (GEO Audit)** analiza si tu contenido es accesible para rastreadores de modelos de lenguaje, si tu arquitectura de datos está correctamente estructurada y si tu autoridad temática está consolidada.

***

## El framework de escaneo en 4 capas

Para diagnosticar cualquier dominio, el escaneo se divide en cuatro capas de inspección secuenciales:

```
┌─────────────────────────────────────────────────────────┐
│ Capa 4: Huella Digital Externa & Autoridad de Entidad   │
├─────────────────────────────────────────────────────────┤
│ Capa 3: Arquitectura de Contenido Semántico             │
├─────────────────────────────────────────────────────────┤
│ Capa 2: Datos Estructurados y Legibilidad por Máquinas  │
├─────────────────────────────────────────────────────────┤
│ Capa 1: Accesibilidad y Rastreo de Bots de IA           │
└─────────────────────────────────────────────────────────┘
```

***

## Capa 1: Accesibilidad y rastreo de bots de IA

Si los rastreadores de inteligencia artificial no pueden leer tu código fuente en crudo, tu marca no existirá para las respuestas en tiempo real.

<AccordionGroup>
  <Accordion title="1. Permisos en robots.txt para User-Agents de IA" icon="file-code">
    Muchos sitios web bloquean por error a los agentes de búsqueda generativa. Un escaneo debe verificar que los siguientes User-Agents tengan acceso explícito a las páginas clave:

    | User-Agent        | Motor asociado | Propósito                                    |
    | :---------------- | :------------- | :------------------------------------------- |
    | `GPTBot`          | OpenAI         | Indexación de conocimiento y entrenamiento   |
    | `ChatGPT-User`    | OpenAI         | Búsqueda web en vivo solicitada por usuarios |
    | `PerplexityBot`   | Perplexity AI  | Rastreo en vivo para síntesis de respuestas  |
    | `ClaudeBot`       | Anthropic      | Rastreo de fuentes para Claude               |
    | `Google-Extended` | Google         | Control de datos para Gemini y Vertex AI     |

    **Punto de control:** Comprueba si tu archivo `robots.txt` incluye líneas como `User-agent: * Disallow: /` que estén impidiendo el acceso a estos bots.
  </Accordion>

  <Accordion title="2. Renderizado SSR vs Client-Side Rendering (SPA)" icon="code">
    Los bots de búsqueda de IA priorizan la velocidad y la eficiencia de tokens.

    <Warning>
      Muchos rastreadores de LLM descargan únicamente el HTML inicial y **no ejecutan código JavaScript pesado**. Si tu sitio es una Single Page Application (React, Vue) sin Server-Side Rendering (SSR) o prerenderizado, el bot solo verá un contenedor vacío: `<div id="root"></div>`.
    </Warning>

    **Punto de control:** Ejecuta una petición directa con `curl` o desactiva JavaScript en el navegador. Si el texto descriptivo de tu producto no está presente en el código fuente HTML original, los modelos de IA no podrán leerlo.
  </Accordion>

  <Accordion title="3. Tiempo de respuesta del servidor (TTFB)" icon="gauge-high">
    Cuando un usuario hace una pregunta en Perplexity o ChatGPT Search, el modelo tiene una ventana de tiempo de apenas 1 a 3 segundos para consultar fuentes web antes de generar la respuesta. Si tu servidor tarda más de 800ms en responder, el bot descartará tu página y citará a un competidor más rápido.
  </Accordion>
</AccordionGroup>

***

## Capa 2: Datos estructurados y legibilidad por máquinas

Los modelos de lenguaje no leen el diseño visual ni los estilos CSS; procesan texto y grafos estructurados.

<Steps>
  <Step title="Validación de Schema.org en JSON-LD">
    Un escaneo exhaustivo debe comprobar la presencia de tres esquemas vitales:

    * **`Organization`**: Debe contener `name`, `url`, `logo`, `description` y el arreglo **`sameAs`** con enlaces hacia perfiles institucionales.
    * **`SoftwareApplication` o `Product`**: Debe definir la categoría (`applicationCategory`), descripción técnica y público al que va dirigido.
    * **`FAQPage`**: Preguntas y respuestas canónicas sobre qué es el producto, cómo funciona y qué precio tiene.
  </Step>

  <Step title="Existencia del estándar llms.txt">
    Verificar si el dominio cuenta con un archivo `/llms.txt` accesible en la raíz del servidor (`https://tudominio.com/llms.txt`). Este archivo proporciona un resumen en Markdown limpio y estructurado de la documentación y propuesta de valor de la empresa, optimizado para consumo directo por LLMs.
  </Step>

  <Step title="Metadatos OpenGraph y etiquetas canónicas">
    Asegurar que las etiquetas `<meta name="description">`, `<title>`, `og:title` y `og:description` transmitan con precisión el valor central del producto en menos de 160 caracteres, sin eslóganes ambiguos.
  </Step>
</Steps>

***

## Capa 3: Arquitectura de contenido semántico

Esta capa evalúa cómo está redactada la información dentro de la página.

### Checklist de evaluación de contenido:

1. **Definición en la primera pantalla:** ¿El primer encabezado `H1` o el párrafo introductorio define explícitamente la categoría de la empresa sin jerga de marketing opaca?
2. **Tablas comparativas estructuradas:** Los LLMs extraen datos tabulares con extrema facilidad. Tener tablas comparativas (`Tu Marca vs Alternativa A vs Alternativa B`) incrementa drásticamente las probabilidades de ser citado cuando los usuarios preguntan *"¿Cuáles son las mejores alternativas a \[Competidor]?"*.
3. **Página dedicada "¿Cómo funciona?":** Una URL con estructura limpia que explique paso a paso el funcionamiento del producto.
4. **Casos de uso documentados:** Artículos o secciones que expliquen soluciones específicas para industrias concretas, permitiendo a la IA asociar tu marca a problemas puntuales.

***

## Capa 4: Huella digital externa y autoridad de entidad

La IA no solo confía en lo que tú dices en tu sitio web; valida la información cruzándola con el resto de internet.

| Factor externo                                           | Qué evalúa el escaneo                                               | Impacto en GEO                           |
| :------------------------------------------------------- | :------------------------------------------------------------------ | :--------------------------------------- |
| **Wikidata**                                             | ¿Existe un identificador Q vinculado al dominio oficial?            | **Crítico** para Knowledge Graph         |
| **Crunchbase**                                           | ¿Existe un perfil de empresa activo y con datos coincidentes?       | **Alto** para validación de startups B2B |
| **Directorios de Software (G2, Capterra, Product Hunt)** | ¿Está listado en su categoría correspondiente?                      | **Alto** para comparativas de software   |
| **Perfiles Sociales Oficiales**                          | LinkedIn, X, GitHub con el mismo nombre y dominio enlazado          | **Medio** para validación de entidad     |
| **Co-ocurrencias en prensa/blogs**                       | Menciones de la marca junto a la categoría en artículos de terceros | **Alto** para relevancia semántica       |

***

## Matriz de diagnóstico y cálculo del GEO Score (0 a 100)

Al concluir el escaneo, Wudlet asigna una puntuación ponderada basada en los factores identificados:

```
GEO Readiness Score = (Capa 1 × 25%) + (Capa 2 × 30%) + (Capa 3 × 25%) + (Capa 4 × 20%)
```

### Clasificación de hallazgos

<CardGroup cols={3}>
  <Card title="Errores Críticos (Prioridad Alta)" icon="triangle-exclamation" color="#ef4444">
    * Bloqueo de bots de IA en `robots.txt`.
    * Sitio web en SPA sin renderizado SSR.
    * Ausencia total de Schema `Organization`.
    * Falta de enlaces canónicos o metadatos básicos de entidad.
  </Card>

  <Card title="Mejoras Recomendadas (Prioridad Media)" icon="circle-exclamation" color="#f59e0b">
    * Falta de esquema `FAQPage`.
    * Perfil ausente en Wikidata o Crunchbase.
    * `sameAs` incompleto en JSON-LD.
    * Encabezados principales sin definición canónica de categoría.
  </Card>

  <Card title="Optimizaciones Avanzadas (Prioridad Baja)" icon="circle-check" color="#10b981">
    * Implementación de `/llms.txt`.
    * Publicación de páginas de comparativa frente a competidores.
    * Generación de artículos técnicos en blogs de autoridad.
  </Card>
</CardGroup>
