SEO técnico
Crawlers de IA, robots.txt y controles de contenido: qué hace cada directiva
Aprende a separar rastreo, indexación, snippets, entrenamiento y uso en productos de IA antes de bloquear bots en robots.txt.
Lectura ejecutiva
Conclusiones principales
- Mapea finalidad y propietario de cada user-agent.
- No uses robots.txt como sustituto de autenticación o noindex.
- Bloquear rastreo puede impedir que el crawler vea una directiva en el HTML.
- Prueba reglas y monitorea logs antes de ampliar el bloqueo.
“Bloquear IA” no es una única decisión técnica. Un sistema puede rastrear páginas para búsqueda, indexar contenido, generar snippets, recuperar fuentes para una respuesta, entrenar modelos o ejecutar una acción para el usuario. Cada finalidad puede usar un crawler o control distinto.
Antes de editar robots.txt, escribe la política en lenguaje humano: qué contenido, qué agente, qué finalidad y qué consecuencia acepta el negocio. Después traduce esa decisión en directivas técnicas.
Cinco usos que no deben confundirse
Rastreo
Es la solicitud automatizada de una URL. El archivo robots.txt en la raíz informa qué rutas pueden solicitar determinados user-agents. Los crawlers legítimos suelen respetarlo, pero no es un mecanismo de seguridad.
Indexación
Es la inclusión de contenido en un índice. Para leer noindex en HTML, el crawler debe acceder a la página. Bloquear la URL en robots.txt y esperar que lea noindex es contradictorio.
Exhibición de fragmentos
Directivas como nosnippet, max-snippet y data-nosnippet controlan cuánto contenido puede mostrarse en experiencias compatibles. No equivalen a retirar la página del índice.
Entrenamiento o mejora de modelos
Algunos proveedores publican tokens específicos para controlar uso en entrenamiento o mejora. El alcance depende de su documentación actual. No asumas que bloquear un crawler de búsqueda controla entrenamiento, ni al revés.
Recuperación para respuestas y agentes
Productos de IA pueden consultar la web para fundamentar respuestas o ejecutar tareas. El acceso puede ocurrir por crawler de búsqueda, bot propio, navegador automatizado o solicitud iniciada por el usuario. La política debe considerar descubrimiento y utilidad para clientes.
Qué hace robots.txt
Un archivo básico puede permitir todo:
User-agent: *
Disallow:
O bloquear un área:
User-agent: ExampleBot
Disallow: /area-experimental/
El archivo controla rutas, no interpreta intención editorial. Reglas amplias pueden alcanzar páginas de producto, documentación y contenido que debería seguir siendo descubrible.
La guía de robots.txt de Google explica que no es el método para mantener páginas fuera del índice ni proteger información sensible.
Qué hace noindex
Usa una meta tag cuando la página puede accederse, pero no debe aparecer en un índice:
<meta name="robots" content="noindex">
Para archivos no HTML, un encabezado X-Robots-Tag puede cumplir una función equivalente:
X-Robots-Tag: noindex
El crawler debe recibir la respuesta para procesar la directiva. Si el contenido es privado, noindex tampoco basta.
Controles de snippet
nosnippetevita fragmentos en contextos compatibles.max-snippetlimita la cantidad de texto.data-nosnippetexcluye partes específicas del HTML.
Estos controles tienen consecuencias de descubrimiento y clic. Una página sin fragmento puede seguir siendo elegible, pero pierde contexto. Prueba por tipo de página.
Googlebot y Google-Extended son distintos
Google documenta Google-Extended como token de producto para controlar usos en ciertos sistemas de IA. La empresa afirma que no afecta inclusión ni ranking en Google Search. Los recursos generativos dentro de Search usan controles relacionados con Googlebot y previews.
Consulta la lista actual de crawlers y tokens de Google al implementar. Agentes, productos y alcances cambian.
Crea un inventario antes de bloquear
| Campo | Pregunta |
|---|---|
| User-agent | ¿Qué identificador aparece en la solicitud? |
| Propietario | ¿Quién publica la documentación? |
| Finalidad | ¿Búsqueda, entrenamiento, respuesta, agente u otro uso? |
| Contenido | ¿Qué rutas y tipos de página? |
| Valor | ¿Ayuda a descubrimiento, clientes o socios? |
| Riesgo | ¿Existe uso no deseado, coste o exposición? |
| Control | ¿robots.txt, autenticación, meta, encabezado o firewall? |
| Responsable | ¿Quién aprueba y revisa la regla? |
Sin inventario, las reglas se acumulan y permanecen después de que cambia la estrategia.
Verifica identidad y comportamiento
El texto del user-agent puede falsificarse. Cuando el proveedor ofrece DNS reverso o rangos publicados, úsalos antes de confiar o crear excepciones.
Analiza logs para entender volumen, páginas, estados, impacto de infraestructura y comportamiento después de una regla. Los logs muestran solicitudes; no prueban cómo se usará el contenido.
Evita bloqueos amplios sin prueba
Una regla Disallow: / parece simple, pero puede causar efectos comerciales. Documentación, soporte y catálogo pueden dejar de servir como fuentes para clientes que usan asistentes.
Implementa progresivamente: define la política, elige contenido de bajo riesgo, valida sintaxis, monitorea logs y descubrimiento, confirma que crawlers esenciales siguen accediendo y amplía solo si el resultado coincide con la decisión.
Políticas por tipo de contenido
- Contenido público de adquisición: puede beneficiarse del descubrimiento.
- Documentación pública: puede mejorar soporte y adopción.
- Contenido licenciado: puede requerir límites contractuales.
- Área autenticada: debe protegerse en el servidor.
- Staging: necesita autenticación, no solo
Disallow. - Filtros infinitos: pueden necesitar gestión de rastreo.
Audita los controles
Registra robots.txt, meta robots, encabezados y controles de preview. Compara origen y renderizado. Revisa si CDN, WAF o desafíos bloquean agentes más allá de la política.
Conecta cada regla con una razón de negocio. Una directiva sin propietario ni justificación debe investigarse, no eliminarse automáticamente.
La gobernanza de crawlers es continua. El objetivo no es permitir todo ni bloquear todo, sino alinear acceso, descubrimiento, derechos y utilidad con controles que correspondan a cada finalidad.
Respuestas directas
Preguntas frecuentes
¿robots.txt evita que una URL aparezca en Google?
No necesariamente. La URL puede descubrirse por enlaces y aparecer sin contenido. Para impedir indexación, usa noindex permitiendo el acceso a la directiva, o restringe el acceso en el servidor.
¿Google-Extended afecta Google Search?
La documentación de Google afirma que Google-Extended no afecta inclusión ni ranking en Google Search. Controla usos específicos en productos de IA descritos por Google.
¿Bloquear un bot protege contenido privado?
No. robots.txt es una instrucción pública y voluntaria. El contenido privado necesita autenticación y controles de acceso en el servidor.