爬虫介绍
本页介绍 Lume搜索 的抓取程序(爬虫)身份与抓取规则,供网站站长、服务器管理员和其他搜索引擎了解。我们只抓取公开网页的正文用于检索,不抓取需要登录的内容。
爬虫身份
- 名称:LightBot
- User-Agent:
Mozilla/5.0 (compatible; LightBot/1.0; +https://so.0816y.com/bot.php) - 用途:为 Lume搜索 收录公开网页,建立搜索索引
- 本页地址:
https://so.0816y.com/bot.php - 联系方式:lume_1.0@foxmail.com
抓取规则
- 遵守目标站点
robots.txt中的 Allow / Disallow 与 Crawl-delay 规则; - 同一域名两次请求之间至少间隔 2 秒,不发起并发轰炸;
- 抓取深度最多 3 层(0 = 只抓入口页),索引总量上限 1000000 个页面;
- 单页等待 5 秒超时即放弃,单页最多保存 2,097,152 字节(约 2 MB);
- 仅索引 HTML 正文,不抓取图片、音视频与二进制附件;不抓取后台、隐私与登录后内容;
- 自动跳过用户资料页等低价值页面(如 /author/、用户空间),只抓帖子与正文。
如何屏蔽我们
在站点根目录放置或修改 robots.txt,加入以下任意规则即可:
User-agent: LightBotDisallow: /
或对所有爬虫统一声明:
User-agent: * Disallow: /
我们定期同步 robots 规则,被声明屏蔽的地址不会再抓取。