AI 爬虫日志怎么分析:从是否来过到抓了什么
robots.txt 正确,不代表 AI 一定抓到了内容
很多技术 GEO 检查停在 robots.txt:确认 GPTBot、OAI-SearchBot、ClaudeBot、PerplexityBot 没被禁止,就认为抓取没有问题。
但允许访问只是第一步。
服务器日志才能回答更具体的问题:爬虫是否真的来过、访问了哪些 URL、返回什么状态码、多久来一次、是否浪费在无价值页面上。
日志里要看哪些字段
常见访问日志至少包含:
- 请求时间
- URL 路径
- HTTP 方法
- 状态码
- User-Agent
- 来源 IP
- 响应大小
- 响应时间
先识别爬虫身份
可以根据 User-Agent 初步筛选已知 AI 爬虫,但不要只靠字符串。User-Agent 可以被伪造。
对于重要分析,建议结合官方公布的 IP 验证方式、反向 DNS 或 CDN 机器人识别能力。
还要区分不同用途的爬虫。训练、搜索检索和用户触发访问可能不是同一个机器人,访问政策和价值也不同。
四个核心指标
1. 抓取覆盖
在核心页面集合中,有多少页面被目标爬虫访问过?
重点检查产品、FAQ、对比、案例、文档和博客,而不是只看全站总 URL。
2. 状态码分布
统计 200、301、404、403、429 和 5xx。
大量 403 或 429 说明防护策略可能误伤;大量 404 说明 sitemap、内链或旧 URL 仍在引导爬虫访问失效页面。
3. 抓取新鲜度
新页面发布后多久首次被访问?重要页面多久被重新抓取?
如果新品页和价格页长期没有重新访问,AI 可能继续使用旧信息。
4. 抓取资源分配
爬虫是否大量访问参数页、筛选页、重复分页、登录页或低价值归档?
如果大量抓取资源被重复 URL 消耗,应检查 canonical、内链、sitemap 和参数规则。
建立核心 URL 清单
不要从数万条日志里盲目找规律。先维护一份核心 URL 清单,并按页面类型分类:
- 品牌实体
- 产品和定价
- Comparison Hub
- FAQ 和文档
- 案例和证据
- 博客和研究
发现问题后怎么处理
如果核心页面从未被访问:
- 检查 sitemap
- 增加来自高权重页面的内链
- 检查 robots 和 noindex
- 确认正文服务端可见
- 检查 CDN 和 WAF 规则
- 检查速率限制
- 验证机器人识别
- 对合法爬虫配置合理访问策略
- 统一 canonical
- 清理站内重复链接
- 优化参数 URL
- 从 sitemap 移除无价值页面
不要把抓取等同于引用
日志只能证明访问发生过,不能证明页面进入模型知识、搜索索引或最终回答。
因此日志数据要和 AI 查询测试、引用来源、页面更新记录一起看。
抓取是可见性的技术前提,不是最终结果。
建议监测节奏
每周检查异常状态码和新页面发现情况。
每月汇总不同爬虫的访问趋势、核心页面覆盖、重复抓取和响应性能。
新品发布、网站迁移、CDN 规则调整后,应单独做一次检查。
结论
AI 爬虫日志分析能把技术 GEO 从配置检查推进到真实行为检查。
不要只问是否允许爬虫,而要继续问:它有没有来、抓了什么、哪里失败、重要页面是否及时更新。