Guillaume Duvernay

Open source

cloudflare-ai-crawl-history

Cloudflare te dice qué rastreadores de IA leen tus páginas. Después, lo olvida. Esta herramienta lo conserva.

Un Cloudflare Worker que se ejecuta cada cuatro horas y guarda en archivos de tu propio bucket R2 qué bot de IA verificado ha leído cada página. Un único Worker cubre todos tus sitios y estos no necesitan ejecutar ningún código para ello.

Rol
Autor
Año
2026
Stack
Cloudflare Workers, R2, DuckDB

El panel lo olvida

Todas las solicitudes de GPTBot, ClaudeBot o PerplexityBot pasan por Cloudflare, que comprueba la IP del rastreador y lo identifica. Para la mayoría de los sitios, esa es la única forma de saber de primera mano cómo los utilizan los motores de IA. Pero los datos desaparecen a los 30 días, así que no puedes comparar este trimestre con el anterior ni ver qué cambió tres meses después de publicar algo.

Qué bots, qué páginas

Por sitio, por página y por bot, cada cuatro horas, en archivos comprimidos con gzip en tu bucket R2. Un informe local responde a las preguntas habituales: quién rastrea tu sitio, qué páginas consulta y cómo evoluciona día a día. Primero comprueba el estado de los datos y te indica qué periodos faltan antes de que confíes en una cifra. La API de Cloudflare trunca los resultados silenciosamente al llegar a 10.000 grupos, así que, si un periodo alcanza ese límite, se divide y se vuelve a consultar.

¿Leen tus versiones Markdown?

Si ofreces una versión Markdown de cada página o un archivo llms.txt, el mismo archivo histórico muestra qué bots las consultan realmente. En una bolsa de trabajo con 14,984 versiones Markdown, ClaudeBot solicitó la versión .md el 49.8% de las veces y GPTBot, el 41.5%. meta-externalagent realizó 38,445 solicitudes sin solicitar ninguna. llms.txt no recibió ninguna solicitud durante los tres primeros días y medio.

49.8%de las consultas de ClaudeBot fueron a la versión .md en una bolsa de trabajo

41.5%de las consultas de GPTBot fueron a la versión .md

12objetos guardados por sitio y día