开发目的
验证IP地址是否属于Google和Bing官方爬虫,支持批量处理、结果缓存和表格导出功能
在网站运营中,识别真正的Google和Bing爬虫至关重要。恶意爬虫常伪装成Googlebot和Bingbot窃取数据,而官方推荐的验证方法繁琐且无法批量操作。为解决这一痛点,我们开发了这款工具,帮助网站管理员:
- 批量验证可疑IP的真实性
- 防止虚假爬虫引发的安全风险
- 优化服务器资源分配
- 满足SEO优化中的爬虫分析需求
基本功能
核心验证机制
- 官方网段校验
实时拉取Google和Bing官方公布的bot网段(来自多个JSON源),检查IP是否在授权范围内 - 双重DNS验证
- PTR反向查询:解析IP对应的主机名
- 正向A记录验证:检查主机名解析结果是否与原始IP一致
- 后缀检测:验证主机名以
.googlebot.com.或.msn.com.结尾
- 智能批量处理
- 支持多种分隔符:换行/逗号/空格分隔的IP输入
- 自动过滤无效地址:排除私有IP、保留地址等非常规IP
- 异步队列处理:每个IP检测间隔0.5-1.5秒随机延迟,避免请求封锁
功能一览

导出结果查看详细检查内容

开发设计
架构亮点
-
分层验证逻辑
async function validateGooglebot(ip) { const cidrs = await getCachedCIDRs(); // 带缓存的网段获取 const inRange = checkIPInCIDR(ip, cidrs); const ptrRecord = await dnsLookup(ip, "PTR"); const aRecord = await dnsLookup(ptrHostname, "A"); return inRange && validSuffix(ptrRecord) && aRecord.includes(ip); } -
性能优化设计
- CIDR缓存:网段数据本地存储24小时,减少90%冗余请求
- 结果缓存:IP验证结果存储7天,支持离线查看历史记录
- 请求调度:自动暂停/恢复机制防止资源过载
-
容错机制
- 跨域代理:通过corsproxy.io解决官方数据源跨域限制
- 重试策略:DNS查询失败时自动重试(最多3次)
- 超时处理:所有网络请求设置5秒超时阈值
数据流示意图

其中实时检测部分有四重校验逻辑,如下图所示

在线体验地址:https://mrxn.net/botcheck/index.html


