在线Robots文件检测工具
站长工具
一键获取并分析网站robots.txt文件,解析爬虫规则,测试URL是否被允许抓取,诊断SEO问题,支持语法高亮与规则可视化
快捷样例
Robots.txt 检测
工具说明
工具介绍
在线 Robots.txt 文件检测工具,一键获取目标站点的 robots.txt 内容,智能解析 User-agent/Disallow/Allow/Sitemap/Crawl-delay 等全部指令,支持 URL 抓取测试(选择不同爬虫)、SEO 问题自动诊断、语法高亮显示,是站长排查爬虫屏蔽和优化 SEO 的必备工具。
Robots.txt 标准字段
| User-agent | 指定规则适用的爬虫名称,* 表示所有爬虫 | Disallow | 禁止爬虫抓取的 URL 路径 | Allow | 允许爬虫抓取的 URL 路径(优先于 Disallow) |
|---|---|---|---|---|---|
| Sitemap | 声明站点地图的完整 URL 地址 | Crawl-delay | 爬虫抓取间隔(秒),Google 不支持此指令 | Host | 指定站点主域名(仅 Yandex 支持) |
使用场景
| 场景 | 说明 |
|---|---|
| 新站 SEO 检查 | 网站上线后检查 robots.txt 是否正确配置,确保搜索引擎可正常抓取 |
| 爬虫屏蔽排查 | 发现网站流量下降时,检查是否误屏蔽了搜索引擎爬虫 |
| 竞品分析 | 查看竞争对手的 robots.txt 配置,了解其 SEO 策略 |
| 规则验证 | 测试特定 URL 是否被 robots.txt 允许抓取,避免误屏蔽重要页面 |
| Sitemap 检查 | 确认 robots.txt 中是否正确声明了 Sitemap 地址 |
| 安全审计 | 检查是否通过 robots.txt 暴露了敏感路径(如后台管理入口) |
常见问题
Q1: robots.txt 文件是什么?
robots.txt 是网站根目录下的纯文本文件,用于告诉搜索引擎爬虫哪些页面可以抓取、哪些不可以。它是搜索引擎爬虫访问网站时第一个检查的文件。
Q2: robots.txt 能阻止网页被索引吗?
robots.txt 只能阻止爬虫抓取页面内容,但不能阻止已收录的 URL 出现在搜索结果中(只是没有摘要)。如需完全阻止索引,应使用 noindex meta 标签或 X-Robots-Tag HTTP 头。
Q3: 为什么检测结果显示"未找到 robots.txt"?
说明该站点没有在根目录放置 robots.txt 文件。此时搜索引擎爬虫会默认允许抓取所有页面。这不影响网站正常运行,但建议添加 robots.txt 以更好地控制爬虫行为。
Q4: Disallow: / 和 Disallow: /admin 有什么区别?
Disallow: / 会屏蔽整个网站的所有页面;Disallow: /admin 只屏蔽 /admin 路径下的页面。前者会严重影响 SEO,后者是常见的合理配置。
Q5: 多个 User-agent 规则冲突时怎么处理?
搜索引擎会优先匹配最具体的 User-agent(如 Googlebot 优先于 *),在同组规则中 Allow 优先于 Disallow(当两者路径长度相同时)。
Q6: robots.txt 文件大小有限制吗?
Google 和 Bing 最多读取 robots.txt 的前 500KB。超出部分会被忽略。建议保持文件精简,定期清理过期规则。