Saltar al contenido
SCRAWL

Comprobador de acceso para crawlers de IA

Revisa si crawlers de IA pueden pedir una URL: robots.txt, llms.txt, schema y HTML. No llama a ChatGPT.

Guía paso a paso
Acceso de crawlers de IA — robots.txt, llms.txt y HTML | Scrawl

Lee robots.txt, busca llms.txt y mira señales en el HTML. No pregunta a ChatGPT ni a Perplexity si ya citan la página. Separa crawlers de entrenamiento (GPTBot, Google-Extended) de los de recuperación (OAI-SearchBot, PerplexityBot). Para ver qué bots llegaron de verdad, analiza los access logs. Para redactar llms.txt, usa el generador.

Entrenamiento no es citación

GPTBot y Google-Extended se usan para opt-out de entrenamiento. Bloquearlos no te saca de las respuestas en vivo. Esas dependen de bots de recuperación y de lo que el buscador ya indexó. Google-Extended no es un user-agent de access log.

llms.txt no es obligatorio

Es un archivo propuesto en la raíz para orientar a sistemas que lo lean. No hay una obligación de Google. Esta auditoría solo dice si la URL del archivo responde.

HTML pobre

Una página que es casi todo JavaScript puede puntuar bajo en extracción aunque se vea llena en el navegador. El chequeo mira el HTML recibido, no una captura visual.

Preguntas frecuentes

¿Esto prueba que ChatGPT ve mi sitio?

Prueba si las reglas y el HTML lo permiten. No hace una pregunta a ChatGPT.

¿Bloquear Google-Extended baja mi ranking?

Google dice que Google-Extended controla el entrenamiento de Gemini, no el ranking de búsqueda.

¿Qué bots cubre?

Los de la lista de la herramienta: entrenamiento y recuperación (OpenAI, Anthropic, Perplexity y similares). La lista está en el resultado, no es infinita.

¿Necesito llms.txt?

No es requisito. Si lo publicas, el generador arma el archivo y esta auditoría comprueba que responda.