• 用******户 使用了工具 Base64编解码
  • 开******发 使用了工具 MD5加密
  • 工******程 使用了工具 时间戳转换
  • 程******序 使用了工具 JSON格式化
  • 设******计 使用了工具 图片压缩
  • 产******品 使用了工具 URL编解码
  • 测******试 使用了工具 正则表达式
  • 运******维 使用了工具 密码生成器

在线Robots文件检测工具

站长工具
一键获取并分析网站robots.txt文件,解析爬虫规则,测试URL是否被允许抓取,诊断SEO问题,支持语法高亮与规则可视化
便民工具SEOrobots.txt爬虫检测搜索引擎网站诊断
快捷样例
百度www.baidu.com
淘宝www.taobao.com
GitHubgithub.com
知乎www.zhihu.com
掘金juejin.cn
W3Cschoolwww.w3ctool.com
Robots.txt 检测
工具说明

工具介绍

在线 Robots.txt 文件检测工具,一键获取目标站点的 robots.txt 内容,智能解析 User-agent/Disallow/Allow/Sitemap/Crawl-delay 等全部指令,支持 URL 抓取测试(选择不同爬虫)、SEO 问题自动诊断、语法高亮显示,是站长排查爬虫屏蔽和优化 SEO 的必备工具。

Robots.txt 标准字段

User-agent指定规则适用的爬虫名称,* 表示所有爬虫Disallow禁止爬虫抓取的 URL 路径Allow允许爬虫抓取的 URL 路径(优先于 Disallow)
Sitemap声明站点地图的完整 URL 地址Crawl-delay爬虫抓取间隔(秒),Google 不支持此指令Host指定站点主域名(仅 Yandex 支持)

使用场景

场景说明
新站 SEO 检查网站上线后检查 robots.txt 是否正确配置,确保搜索引擎可正常抓取
爬虫屏蔽排查发现网站流量下降时,检查是否误屏蔽了搜索引擎爬虫
竞品分析查看竞争对手的 robots.txt 配置,了解其 SEO 策略
规则验证测试特定 URL 是否被 robots.txt 允许抓取,避免误屏蔽重要页面
Sitemap 检查确认 robots.txt 中是否正确声明了 Sitemap 地址
安全审计检查是否通过 robots.txt 暴露了敏感路径(如后台管理入口)

常见问题

Q1: robots.txt 文件是什么?

robots.txt 是网站根目录下的纯文本文件,用于告诉搜索引擎爬虫哪些页面可以抓取、哪些不可以。它是搜索引擎爬虫访问网站时第一个检查的文件。

Q2: robots.txt 能阻止网页被索引吗?

robots.txt 只能阻止爬虫抓取页面内容,但不能阻止已收录的 URL 出现在搜索结果中(只是没有摘要)。如需完全阻止索引,应使用 noindex meta 标签或 X-Robots-Tag HTTP 头。

Q3: 为什么检测结果显示"未找到 robots.txt"?

说明该站点没有在根目录放置 robots.txt 文件。此时搜索引擎爬虫会默认允许抓取所有页面。这不影响网站正常运行,但建议添加 robots.txt 以更好地控制爬虫行为。

Q4: Disallow: / 和 Disallow: /admin 有什么区别?

Disallow: / 会屏蔽整个网站的所有页面;Disallow: /admin 只屏蔽 /admin 路径下的页面。前者会严重影响 SEO,后者是常见的合理配置。

Q5: 多个 User-agent 规则冲突时怎么处理?

搜索引擎会优先匹配最具体的 User-agent(如 Googlebot 优先于 *),在同组规则中 Allow 优先于 Disallow(当两者路径长度相同时)。

Q6: robots.txt 文件大小有限制吗?

Google 和 Bing 最多读取 robots.txt 的前 500KB。超出部分会被忽略。建议保持文件精简,定期清理过期规则。