跳到主要内容
CiteCheckup logoCiteCheckup

robots.txt 检查器

抓取公开 robots.txt 或直接粘贴内容。测试你关心的确切路径和用户代理,查看最终生效的规则。

robots 规则结果

输入网址或粘贴文件,即可查看具体命中规则和 AI 抓取工具矩阵。

工具只分析你提供的文本或公开 robots.txt 响应,不证明抓取工具一定会访问或索引页面。

这个 robots.txt 检查器会核对什么

先确认响应是不是文件

检查抓取到的内容是否真的是可解析的 robots.txt。空内容、HTML 页面或没有有效指令的响应会标为未知,不会被默认为全部允许。

按组读取指令

识别 User-agent、Allow、Disallow 和 Sitemap,并保留组内的空行与注释,不把它们误认为新组的开始。

确认实际生效的规则

用你填写的用户代理和路径计算命中规则,同时展示多个常见 AI 抓取代理的规则与依据,便于定位差异。

找到实际生效的规则

  1. 定位命中规则

    先输入真正关心的路径和代理名称,再阅读命中规则所属的完整组,而不是只看文件顶部。

  2. 收窄规则范围

    删除误伤范围过大的 Disallow,或增加有明确目的的 Allow,并修正缺少冒号、缺少 User-agent 等语法问题。

  3. 重新核对响应

    发布文件后用相同路径和用户代理重新测试;如果响应本身仍像错误页,先处理响应问题。

结果能说明什么,不能说明什么
  • 结果只说明工具观察到的 robots.txt 响应和规则,不证明抓取、索引或 AI 引用一定会发生。
  • AI 抓取代理名称只是用户代理字符串,不是对所有服务商行为的实时监测。
  • 跨域跳转仍受公开网址和 SSRF 安全边界约束,工具不会为了继续抓取而放宽限制。

robots.txt 常见问题

空行会结束当前 robots 规则组吗?

不会。空行和纯注释不会结束组,直到遇到下一个 User-agent 组或文件结束。

为什么结果会是未知而不是允许?

无效响应或无法可靠解析的语法不能证明允许访问,因此工具不会把它轻率显示为已允许。

这个工具能判断 AI 是否会引用页面吗?

不能。它只测试指定用户代理和路径在文本规则中的结果,不观察服务商的索引、排序或引用行为。

结构化数据测试工具

如果页面能抓取但含义不清,再检查 JSON-LD 的结构和字段。

测试结构化数据

如何让 AI 引用网页

把抓取可达性与页面答案、证据和责任信息分开处理。

阅读指南

完整网页检查

当问题不止robots.txt时,用30项检查查看页面结构、内容和发布者信息。

检查网址