关于本站
这里是独立博客网站圈的「时光博物馆」——记录每一个曾经或正在闪耀的独立博客,用截图留住它们的历史瞬间。
⚙️ 技术介绍
💻 前端PHP + MySQL + 原生 HTML/CSS/JS,轻量无框架
🕷️ 爬虫zmobot_img —— 基于 Playwright + 真实 Chrome 内核的网页截图引擎,完整渲染、忠实还原页面样貌
📸 截图使用真实 Chrome 无头浏览器整页渲染截图,启用反自动化伪装以获取真实页面内容,自动识别并跳过验证/拦截页;遵循「5 天」抓取间隔,尊重目标站点
🧠 智能识别自动识别 301/302 跳转与访问异常,并校验跳转目标安全性
🤖 关于 zmobot_img
📖 简介zmobot_img 是本站的网页截图爬虫,基于 Playwright 驱动真实 Chrome 无头浏览器,对收录网站首页进行完整渲染并截图保存,自动识别并跳过验证/拦截页面。
💎 价值忠实记录网站在特定时间点的样貌,为独立博客圈留下一份可回溯的数字档案。
🕊️ 原则抓取遵循间隔限制,绝不打扰目标站点。
🧭 状态与抓取逻辑说明
🔄 抓取流程系统先用 curl 探测网站是否可达(先 https,失败再试 http,兼容部分站点 TLS 兼容问题);可达且返回 200 后用 Playwright 驱动真实 Chrome 内核完整渲染截图(模拟真实访客访问,自动执行页面脚本并通过常见验证挑战;截图前会识别验证/拦截页,命中则不保存假截图)。每次任务结果都会计入「连续失败次数 / 连续跳转次数」,用于自动打标。
✅ 正常可正常访问、前台可见,按「5 天」间隔抓取。
⚠️ 异常判定仅当连续 10 次截图失败,或连续 5 次跳转到其他网站时才标记异常;期间只要有一次成功即重新计数并标回正常。
🔀 跳转处理站内跳转(www/裸域、http/https、首页→内部页)视为本站并正常截图;跳转到其他网站则在 5 次以内视为正常但不截图(避免截到别家网站),满 5 次标异常。
🌐 抓取失败的可能原因单次失败不代表网站真的挂了——可能是网络波动(机房到目标站链路抖动/丢包/超时)、目标站的防火墙/WAF/CC 防护/地域封锁/UA 拦截/Cloudflare 交互式人机验证(勾选/滑动验证码,需真人操作)(导致网站实际正常但从我们这边访问失败)、CDN 拦截(对非常规请求返回 567/403)、目标站自身服务器错误或维护(5xx/404)、或跳转循环。因此采用「连续 20 次」计数而非一次判死,最大限度避免误标。
🔁 重试机制失败/跳转计数中的网站每轮任务都会重新探测累计;一旦累计满阈值标为异常,该网站即移出定时抓取任务、不再自动重试(避免持续打扰);如站长确认网站已恢复正常,可重新收录并恢复定时抓取。
🆔 识别标识
🤖 User-Agent
Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/148.0.0.0 Safari/537.36 ZengMoBot/1.0🌍 语言头
Accept-Language: zh-CN,zh;q=0.9,en;q=0.8🛡️ 站长如何放行(白名单)
🤖 UA 白名单在 Nginx / CDN / 防火墙中放行包含
ZengMoBot 的 User-Agent 即可(推荐,最精确)📋 Nginx 示例
if ($http_user_agent ~* "ZengMoBot") { set $bypass 1; }⚖️ 版权与合规
🖼️ 截图用途本站展示的均为收录网站的缩略图快照,仅作信息索引与导航用途
🛑 申请删除若您是收录站点的站长,不希望快照被展示,可通过「举报/停抓」提交申请,我们将尽快移除
🛑 停止抓取如果您不希望本站收录您的网站,请前往「举报/停抓」页面提交停抓申请
©️ 版权归属各网站内容版权归原网站及其所有者所有,本站不持有任何收录网站的原创内容版权
📮 联系站长
📧 联系邮箱
(已隐藏,防垃圾邮件抓取)点击图片放大/还原 · 点击空白处关闭