• 用******户 使用了工具 Base64编解码
  • 开******发 使用了工具 MD5加密
  • 工******程 使用了工具 时间戳转换
  • 程******序 使用了工具 JSON格式化
  • 设******计 使用了工具 图片压缩
  • 产******品 使用了工具 URL编解码
  • 测******试 使用了工具 正则表达式
  • 运******维 使用了工具 密码生成器

在线Robots文件检测工具

站长工具
在线检测和分析网站robots.txt文件,解析User-agent、Disallow、Allow等指令,支持URL抓取权限检测
站长工具SEOrobots.txt搜索引擎爬虫网站优化
获取robots.txt
robots.txt内容
工具说明

工具介绍

在线Robots文件检测工具,支持获取网站的robots.txt文件,解析User-agent、Disallow、Allow、Sitemap、Crawl-delay等指令,提供URL抓取权限检测功能,帮助站长了解搜索引擎爬虫访问规则。

robots.txt指令说明

User-agent指定规则适用的搜索引擎爬虫名称,*表示所有爬虫Disallow禁止爬虫访问的路径
Allow允许爬虫访问的路径(优先级高于Disallow)Crawl-delay设置爬虫抓取间隔(秒)
Sitemap指定网站地图的URL#注释以#开头的行为注释,不被解析

使用步骤

输入域名
输入网站域名,点击获取robots.txt
查看内容
查看获取的robots.txt内容,可手动修改
解析规则
点击解析按钮,查看规则组和指令
检测URL
输入URL检测是否允许被搜索引擎抓取

功能特性

常见问题

Q1: 为什么获取不到robots.txt?

可能的原因:网站没有设置robots.txt文件、服务器拒绝访问、网络连接问题。请检查域名是否正确。

Q2: Allow和Disallow哪个优先级高?

当Allow和Disallow规则同时匹配时,更具体的规则优先。通常Allow规则会覆盖Disallow规则,建议将Allow放在Disallow之前。

Q3: 通配符*和$有什么作用?

*匹配任意字符,$匹配URL结尾。例如:/*\.php$ 匹配所有以.php结尾的URL。

Q4: 为什么某些爬虫不遵守robots.txt?

robots.txt是协议而非法律,恶意爬虫可能会忽略规则。建议对敏感目录使用密码保护或IP限制。