当前位置: 沐风博客 >> SEO问答 >>正文

蜘蛛爬取情况通过什么方式查看准确

重点导读:想要更加准确知道蜘蛛抓取数据,查看网站日志是最靠谱的,其他的各种工具也都是基于网站日志,提取里面的数据,但这些工具显然没有纯手工那么准确。
发布人:沐风 - 发布时间:2021-10-14 09:54:58 - 地址:http://www.tangmengyun.com/seo/3019.html - 浏览:2671

问题:蜘蛛爬取情况通过什么方式查看准确?

回答:想要更加准确知道蜘蛛抓取数据,查看网站日志是最靠谱的,其他的各种工具也都是基于网站日志,提取里面的数据,但这些工具显然没有纯手工那么准确。

这里有个问题要注意:虽然网站日志里面能够统计到所有的蜘蛛抓取记录,但这里面也有些是伪蜘蛛,并不是真正的搜索引擎蜘蛛,对于这些要过滤掉。但如果“蜘蛛”的ip很多,要识别起来就得费些时间了。

以下是百度搜索提供的鉴别方法:

建议您使用DNS反查方式来确定抓取来源的ip是否属于百度,根据平台不同验证方法不同,如linux/windows/os三种平台下的验证方法分别如下:

1、在linux平台下,您可以使用host ip命令反解ip来判断是否来自Baiduspider的抓取。Baiduspider的hostname以 *.baidu.com 或 *.baidu.jp 的格式命名,非 *.baidu.com 或 *.baidu.jp 即为冒充。

$ host 123.125.66.120 

120.66.125.123.in-addr.arpa domain name pointer 

baiduspider-123-125-66-120.crawl.baidu.com.

host 119.63.195.254

254.195.63.119.in-addr.arpa domain name pointer 

BaiduMobaider-119-63-195-254.crawl.baidu.jp.

2  在windows平台或者IBM OS/2平台下,您可以使用nslookup ip命令反解ip来 判断是否来自Baiduspider的抓取。打开命令处理器 输入nslookup xxx.xxx.xxx.xxx(IP地 址)就能解析ip, 来判断是否来自Baiduspider的抓取,Baiduspider的hostname以 *.baidu.com 或 *.baidu.jp 的格式命名,非 *.baidu.com 或 *.baidu.jp 即为冒充。

3  在mac os平台下,您可以使用dig 命令反解ip来 判断是否来自Baiduspider的抓取。打开命令处理器 输入dig xxx.xxx.xxx.xxx(IP地 址)就能解析ip, 来判断是否来自Baiduspider的抓取,Baiduspider的hostname以 *.baidu.com 或 *.baidu.jp 的格式命名,非 *.baidu.com 或 *.baidu.jp 即为冒充。

关于如何手动分析网站日志的问题,沐风SEO之前写过网站日志如何分析的文章,里面做了详细的介绍,大家可以去看下。

当然也有些工具可以很方便的统计出网站日志的信息,只不过这些工具统计到的没有手动统计的那么详细,大家可以根据具体的情况去选择是利用工具还是手动。但相对来说,手动分析网站日志得到的数据会更加准确。

这里再提醒下:网上有人提到了降权蜘蛛、新站蜘蛛、权重蜘蛛等等,这些纯属胡说八道,大家不要轻易相信这些所谓的大师说法!

分析蜘蛛抓取为网站收录服务的,如果网站收录都正常的话,没有必要频繁的去统计蜘蛛抓取。如果觉得网站收录情况不好,这时候可以去分析网站日子,看看是不是有些页面没有被蜘蛛抓取到。如果没有被抓取,可以通过提交链接、增加站内锚文本链接、外链等方式来提升抓取率,进而提升页面收录


沐风SEO博客讲解SEO相关知识,包括解释SEO是什么,SEO有什么作用以及怎么做SEO等!

提醒:SEO更重要的是实战,理论结合实战才能真正掌握SEO,沐风SEO会尽量把SEO的每个细节都讲到,具体掌握多少还得看大家自己的努力! - ICP备案号 湘ICP备2022004497号