蜘蛛日志在线分析工具
站长工具
在线分析网站蜘蛛爬取日志,识别搜索引擎爬虫,统计访问次数、状态码分布、抓取深度等数据
日志输入
工具说明
工具介绍
在线蜘蛛日志分析工具,支持分析Nginx、Apache等标准Web服务器日志,自动识别搜索引擎爬虫(Baiduspider、Googlebot等),统计访问次数、状态码分布、抓取深度等数据,帮助站长了解网站被搜索引擎抓取的情况。
支持的爬虫类型
| Baiduspider | 百度搜索引擎爬虫 | Googlebot | 谷歌搜索引擎爬虫 | 360Spider | 360搜索引擎爬虫 | Sogou | 搜狗搜索引擎爬虫 |
|---|---|---|---|---|---|---|---|
| Bingbot | 必应搜索引擎爬虫 | Yahoo Slurp | 雅虎搜索引擎爬虫 | YandexBot | Yandex搜索引擎爬虫 | DuckDuckBot | DuckDuckGo爬虫 |
使用步骤
复制日志
从服务器日志中复制蜘蛛爬取记录
粘贴内容
将日志内容粘贴到输入框中
开始分析
点击开始分析按钮
查看报告
查看爬虫分布、状态码、抓取深度等统计
功能特性
自动识别多种搜索引擎爬虫
统计爬虫类型、状态码、抓取深度等
识别抓取错误(4xx、5xx状态码)
展示被爬取最多的页面TOP10
常见问题
Q1: 支持什么格式的日志?
支持Nginx、Apache、IIS等主流Web服务器的标准日志格式,需要包含IP地址、请求方法、URL、状态码、User-Agent等字段。
Q2: 为什么没有识别到蜘蛛?
请检查日志中是否包含User-Agent字段,爬虫识别是基于User-Agent中包含的爬虫名称进行匹配的。
Q3: 抓取深度是什么意思?
抓取深度指URL路径的层级,例如/是深度1,/blog/post是深度2,深度越深说明爬虫爬取越深入。
Q4: 如何减少404错误?
定期检查网站链接,修复失效链接,设置301重定向,更新sitemap.xml,确保搜索引擎抓取的都是有效页面。