在线Robots文件检测工具
站长工具
在线检测和分析网站robots.txt文件,解析User-agent、Disallow、Allow等指令,支持URL抓取权限检测
获取robots.txt
robots.txt内容
工具说明
工具介绍
在线Robots文件检测工具,支持获取网站的robots.txt文件,解析User-agent、Disallow、Allow、Sitemap、Crawl-delay等指令,提供URL抓取权限检测功能,帮助站长了解搜索引擎爬虫访问规则。
robots.txt指令说明
| User-agent | 指定规则适用的搜索引擎爬虫名称,*表示所有爬虫 | Disallow | 禁止爬虫访问的路径 |
|---|---|---|---|
| Allow | 允许爬虫访问的路径(优先级高于Disallow) | Crawl-delay | 设置爬虫抓取间隔(秒) |
| Sitemap | 指定网站地图的URL | #注释 | 以#开头的行为注释,不被解析 |
使用步骤
输入域名
输入网站域名,点击获取robots.txt
查看内容
查看获取的robots.txt内容,可手动修改
解析规则
点击解析按钮,查看规则组和指令
检测URL
输入URL检测是否允许被搜索引擎抓取
功能特性
自动获取目标网站的robots.txt文件
解析User-agent、Disallow、Allow等指令,支持通配符
检测robots.txt中的错误和警告
输入任意URL判断是否被robots.txt允许抓取
常见问题
Q1: 为什么获取不到robots.txt?
可能的原因:网站没有设置robots.txt文件、服务器拒绝访问、网络连接问题。请检查域名是否正确。
Q2: Allow和Disallow哪个优先级高?
当Allow和Disallow规则同时匹配时,更具体的规则优先。通常Allow规则会覆盖Disallow规则,建议将Allow放在Disallow之前。
Q3: 通配符*和$有什么作用?
*匹配任意字符,$匹配URL结尾。例如:/*\.php$ 匹配所有以.php结尾的URL。
Q4: 为什么某些爬虫不遵守robots.txt?
robots.txt是协议而非法律,恶意爬虫可能会忽略规则。建议对敏感目录使用密码保护或IP限制。