# Deja de adivinar qué crawlers de IA están pegando de verdad a tu sitio
Tus logs de servidor tienen la respuesta a una pregunta que probablemente todavía no te has hecho: qué crawlers de IA están visitando tu sitio de verdad, qué están trayendo y si tu robots.txt los está frenando o dejándolos pasar. Esto no lo ves en Google Search Console ni en ninguna plataforma de analytics: tienes que leer los logs crudos tú mismo, y la mayoría no sabe por dónde empezar.
Por eso esto está roto. Tu sitio puede estar siendo scrapeado por 15 modelos de IA distintos cada semana, alimentando datasets de entrenamiento a los que no diste consentimiento, y al mismo tiempo bloqueando crawlers legítimos que podrían traer tráfico. Necesitas visibilidad de lo que pasa de verdad a nivel de servidor, y la necesitas rápido.
Qué es el Analizador de logs de bots de IA
El Analizador de logs de bots de IA es una herramienta gratis en el navegador que parsea tus logs de acceso del servidor y te muestra exactamente qué crawlers de IA visitaron tu sitio, qué URLs pidieron y si recibieron un 200 (éxito), un 403 (bloqueado) u otro código de estado. Subes o pegas tus logs directo en la herramienta: sin login, y los datos no se envían a ningún lado. Todo corre en local en tu navegador, así que tus logs se quedan privados.
La herramienta identifica crawlers de OpenAI, Anthropic, Google, Apify y decenas de otras empresas de IA y operaciones de scraping de datos. Los categoriza, les pone timestamp y te dice su tasa de éxito en un formato limpio y legible.
Por qué importa para el SEO
Primero, necesitas saber si se te está escapando contenido hacia el entrenamiento de IA sin permiso. Si un crawler como ChatGPTBot o CCBot pega a tu sitio con un status 200, tu contenido se está indexando para entrenar modelos de IA. Algunas empresas lo quieren; otras no. No puedes tomar esa decisión si no sabes que está pasando.
Segundo, bloquear los crawlers equivocados te cuesta dinero de verdad. Googlebot y Googlebot-Image de Google son los únicos crawlers que importan para el ranking en búsqueda orgánica: Google recrawlea la mayoría de los sitios cada 3-7 días según las señales de frescura. Si tu robots.txt es demasiado restrictivo y bloquea tráfico legítimo por accidente, vas a ver crawl budget desperdiciado e indexación más lenta. He auditado sitios donde un developer demasiado agresivo bloqueó la mitad del crawl budget con un solo patrón de regex.
Tercero, el scraping agresivo de IA puede frenar tu sitio. Si 40 instancias distintas de crawlers pegan a tu servidor cada hora, son 40 requests por hora que atiendes con cero valor SEO. En hosting compartido o en sitios con poco margen de recursos de servidor, esto importa.
Cómo usarlo
- Consigue tus logs de acceso del servidor. Pídeselos a tu proveedor de hosting o accede por cPanel, SSH o el dashboard de tu CDN. Suelen estar en
/var/log/apache2/access.log(Apache) o/var/log/nginx/access.log(Nginx). Toma las últimas 24-48 horas de logs. - Entra a https://scrawl.tools/tools/ai-bot-log-analyzer y pega tus logs directo en el área de texto. Sin registro, sin espera. La herramienta procesa todo ahí mismo.
- Lee el reporte. Vas a ver un desglose por tipo de crawler, URLs golpeadas, códigos de estado y timestamps. Exporta o saca una captura de lo que necesites.
Qué te dicen los resultados
El reporte te da cuatro datos críticos. Nombre del crawler: te dice quién está visitando. ChatGPTBot es OpenAI, CCBot es Commoncrawl, Googlebot es Google. Path de la URL: ¿qué páginas tuyas pidieron? Si están martillando tus endpoints /api/ o paths /admin/, eso es una alerta de seguridad. Código de estado: un 200 significa que pasaron; un 403 significa que tu robots.txt o .htaccess los bloqueó; un 429 significa que les aplicaste rate limit (bien). Timestamp: ¿cuándo visitaron? Si se agrupa alrededor de horarios específicos, es señal de una operación de scraping programada.
También vas a ver stats acumuladas: cuántos requests por crawler, tasa de éxito en porcentaje y qué user-agents pasaron más tiempo en tu sitio. La mayoría de los sitios se sorprende de cuántos crawlers de IA distintos aparecen. He visto sitios golpeados por más de 20 bots distintos en un solo día.
3 errores que comete la mayoría
*Error 1: Bloquear todo con una regla genérica `User-agent: .** Esto lo veo todo el tiempo en archivos robots.txt. Si escribes User-agent: * / Disallow: /`, estás bloqueando a Google, Bing y a cualquier otro crawler. Usa los resultados del Analizador de logs de bots de IA para entender qué crawlers de verdad quieres bloquear, y luego escribe reglas dirigidas solo para esos user-agents. El problema real es que la mayoría bloquea primero y piensa en las consecuencias después.
Error 2: No revisar los códigos de estado. Un crawler que aparece en tus logs con status 403 no está accediendo a tu contenido: tu servidor lo rechazó. Eso está bien. Pero si ves ChatGPTBot con status 200 y no querías estar en el entrenamiento de GPT, tienes un problema. La mayoría se pierde esta distinción por completo y asume que cualquier crawl registrado significa que hubo acceso.
Error 3: Ignorar crawlers legítimos. Algunos sitios se ponen nerviosos con cualquier crawler que no sea Google y bloquean todo lo demás sin criterio. Eso es demasiado. Los crawlers de Google, los de Bing y los de otros buscadores grandes siempre deberían recibir un 200. Si bloqueas Googlebot por accidente, te estás haciendo daño en tu propio SEO.
Qué hacer después
Después de analizar tus logs, decide si quieres bloquear o permitir crawlers de IA específicos. Puedes bloquearlos en robots.txt, vía .htaccess (Apache) o la config de tu servidor web (Nginx), o a nivel de CDN según tu setup. Si necesitas ayuda con la implementación técnica, el Tester de robots.txt de Google te deja validar que tus reglas nuevas funcionan de verdad antes de desplegarlas.
Corre este análisis cada 30 días. Los patrones de tráfico de crawlers de IA cambian: salen modelos nuevos, los viejos se deprecan, la intensidad del scraping varía. Lo que viste el mes pasado no va a coincidir con lo del mes que viene. Saca tus logs, pégalos y sigue la tendencia.