怎样准确推断请求是搜索引擎爬虫（蜘蛛）发出的请求？

zoukankan html css js c++ java

怎样准确推断请求是搜索引擎爬虫（蜘蛛）发出的请求？
站点常常会被各种爬虫光顾，有的是搜索引擎爬虫，有的不是，通常情况下这些爬虫都有UserAgent，而我们知道UserAgent是能够伪装的，UserAgent的本质是Http请求头中的一个选项设置，通过编程的方式能够给请求设置随意的UserAgent。

所以通过UserAgent推断请求的发起者是否是搜索引擎爬虫（蜘蛛）的方式是不靠谱的，更靠谱的方法是通过请求者的ip相应的host主机名是否是搜索引擎自己家的host的方式来推断。

要获得ip的host，在windows下能够通过nslookup命令，在linux下能够通过host命令来获得，比如：

这里我在windows下运行了nslookup ip 的命令，从上图能够看到这个ip的主机名是crawl-66-249-64-119.googlebot.com。这说明这个ip是一个google爬虫，google爬虫的域名都是 xxx.googlebot.com.

我们也能够通过python程序的方式来获得ip的host信息，代码例如以下：

import socket def getHost(ip): try: result=socket.gethostbyaddr(ip) if result: return result[0], None except socket.herror,e: return None, e.message

上述代码使用了socket模块的gethostbyaddr的方法获得ip地址的主机名。

经常使用蜘蛛的域名都和搜索引擎官网的域名相关，比如：

百度的蜘蛛一般是baidu.com或者baidu.jp的子域名
google爬虫一般是googlebot.com的子域名
微软bing搜索引擎爬虫是search.msn.com的子域名
搜狗蜘蛛是crawl.sogou.com的子域名

基于以上原理，我写了一个工具页面提供推断ip是否是真实搜索引擎的工具页面，该页面上提供了网页推断的工具和常见的google和bing的搜索引擎爬虫的ip地址。

页面地址：http://outofmemory.cn/tools/is-search-engine-spider-ip/

本文提供的代码是python代码，通过JAVA代码也是能够实现的，原理是一样的。
查看全文

相关阅读:
验证guid()类型值的函数
 jquery时期到计时插件
 最简单快速的Apache二级域名实现方法
 线程和线程的常用方法
 Mobile WEB前端研发流程
 HTML5标莶使用初级技巧
 前端开发中常见的HTML5标签乱用案例
 iPad应用的10大用户体验设计准则
 移动平台3G手机网站前端开发布局技巧汇总
 分享HTML 5的参考手册，演讲稿，电子书和教程

原文地址：https://www.cnblogs.com/zfyouxi/p/4296860.html