项目地址:https://github.com/zhegexiaohuozi/seimi-render | 欢迎 Star

它到底是什么

SeimiRender 是一个基于 Chromium 的网页渲染服务。它的更原始前身是开源项目 SeimiAgent,SeimiRender 是其现代化升级版。

你只需要提交一个 URL,它就会用真实浏览器行为去渲染页面——执行 JS、等待异步内容加载、跑完 SPA 路由——然后把渲染后的完整结果交还给你:HTML、Markdown 正文、PDF、截图,甚至是结构化的搜索引擎结果 JSON。

它默认以 offscreen 无头模式运行,不需要显示器。这意味着:

  • ✅ 它不会抢占你的鼠标和键盘焦点
  • ✅ 它不会在任务栏闪烁打扰你
  • ✅ 你本地浏览器的操作不会干扰它的渲染结果
  • ✅ 它的渲染也不会干扰你正在看的页面

AI 有 AI 的浏览器,你有你的浏览器,井水不犯河水。

更关键的是,它原生支持 MCP 协议。这意味着 ZCode、Claude Code、Cursor、Codex 这些主流 AI Agent 客户端,开箱即用就能把它当成一个"网页渲染工具"来调用——Agent 自己决定什么时候该开网页、读什么内容,全程不需要你手写 URL 或解析 HTML。

接入只需几行配置:

{
  "mcpServers": {
    "seimi-render": {
      "type": "http",
      "url": "http://127.0.0.1:8090/mcp"
    }
  }
}

配好之后,你直接对 Agent 说一句"帮我查一下北京种植牙哪些医院靠谱",Agent 就会自动规划:调搜索引擎拿结构化结果 → 挑几条点进去渲染全文 → 综合给你一个像样的回答。整个过程,屏幕上静悄悄的

凭借"真实浏览器渲染 + 登录态继承 + HAR 录制 + 反爬对抗 + MCP 原生接入"这套组合拳,SeimiRender 在复杂动态页面的数据获取上有一组天然契合的应用方向:

  • 📊 社交舆情监控:渲染微博等信息流页面,实时抓取热搜、话题与用户内容,做品牌舆情追踪、负面预警、KOL 内容归档。
  • 🛒 商品竞品监控:带登录态渲染电商平台,拿到会员价、真实到手价与库存,实现全网比价、降价/补货预警、竞品分析。
  • 📈 股票行情跟踪:渲染金融站点并录制 HAR 逆向行情接口,截图 K 线配合视觉分析,做个股跟踪、财报采集、舆情-股价关联分析。

这三类场景的共同点在于——数据都藏在 JS 动态渲染、登录态校验和隐藏接口背后,而这正是 SeimiRender 的主场。后文会逐一展开。


复杂动态页面数据获取:SeimiRender 的真正主场

如果说"渲染一个静态页面"是任何工具都能做到的事,那么复杂动态页面才是 SeimiRender 真正拉开差距的主场——也是它作为数据基础设施最有价值的能力。

现实世界里,真正有用的数据几乎都不在"静态 HTML"里。它们藏在:

  • JS 异步加载的接口响应里(Ajax / fetch / WebSocket 推送)
  • SPA 单页应用的路由切换后(首屏 HTML 是空壳,内容全靠 JS 渲染)
  • 滚动加载 / 点击展开 / 延迟渲染的交互逻辑背后
  • 登录态校验之后才能看到的个人化内容里
  • 反爬机制(验证码、行为检测、指纹识别)的层层防护之下

传统爬虫面对这些场景,基本束手无策——拿到的往往是一堆空壳 HTML,或者干脆被拦截。而 SeimiRender 用真实 Chromium 内核渲染,这些问题天然被化解:

难点传统爬虫SeimiRender
JS 异步加载拿不到数据(首屏空壳)等待 JS 执行完成,拿到完整 DOM
SPA 路由只能抓首屏真实执行路由,渲染目标视图
滚动/懒加载需手动模拟真实浏览器行为,可配置 settle 等待
登录态难以继承Chrome 插件一键同步登录 cookie,加密持久化
反爬指纹容易被识别stealth 模式伪装统一桌面环境,内置会话预热与重试
动态接口定位猜接口、硬编码HAR 录制全程网络流量,接口一览无余

下面用三个典型数据源,说明 SeimiRender 如何把它们变成可被 Agent 自由驱动的数据流

📊 微博 / 社交平台 —— 公开舆情监控

微博这类社交平台,信息流高度动态化:热搜榜单实时变动、话题广场靠 JS 滚动加载、用户主页内容异步渲染、评论和转发数据都藏在接口调用里。

传统方式的痛点:

  • 热搜接口频繁变更,硬编码抓取脚本维护成本极高
  • 话题广场的内容需要滚动才能加载,普通请求拿不全
  • 部分内容需要登录态才能完整查看
  • 平台反爬严格,IP 容易被流控

SeimiRender 的解法:

  • 渲染即所得:直接渲染微博页面,JS 执行完成后拿到完整的、用户能看到的内容,无需逆向任何接口
  • 登录态继承:用 Chrome 插件同步微博登录 cookie 后,可以渲染需要登录才能查看的完整信息流、个人主页、关注内容
  • 反爬对抗:stealth 指纹统一 + Google 级别的会话预热逻辑 + 命中验证页自动退避重试 + 运行时代理热切换,多层防护降低被风控概率
  • HAR 录制:开启 record_network 后,一次渲染录下所有网络请求,那些藏在 JS 里的数据接口(XHR/fetch)会被完整捕获,方便后续精确定位真正的数据 API,建立稳定的数据采集链路

应用方向: 品牌舆情监控、话题热度追踪、负面信息预警、KOL 内容归档。配合 Agent,可以做到"自动渲染 → 提取正文 → 情感分析 → 生成日报"的闭环。

🛒 电商平台 —— 商品竞品监控

电商页面是动态渲染的重灾区:商品列表靠滚动加载、价格和库存实时变化、评论分页异步拉取、促销信息强依赖 JS 渲染、不同登录态看到的价格和优惠各不相同。

传统方式的痛点:

  • 商品价格、库存是 JS 动态注入的,静态请求拿不到
  • 评论需要翻页/滚动,普通抓取只能拿到第一页
  • 个性化推荐和千人千面的价格,没有登录态拿不到真实数据
  • 各平台反爬策略各异,维护多套抓取脚本成本高

SeimiRender 的解法:

  • 真实价格/库存渲染:等 JS 执行完毕后,页面上的价格、库存、促销标签都是真实浏览器渲染出的最终状态,所见即所得
  • 登录态比价:同步电商平台的登录 cookie 后,可以拿到会员价、Plus 专享价、个人优惠券后的真实到手价——这是无登录态爬虫永远拿不到的关键数据
  • HAR 录制定位真实接口:电商平台的商品数据接口往往有签名校验,逆向困难。用 SeimiRender 录一次 HAR,所有 XHR 请求的 URL、参数、响应体全部可见,直接逆向出数据接口的调用方式,后续可绕过页面直接调接口批量拉取,效率成倍提升
  • 代理池规避 IP 风控:运行时 POST /proxy 热切换代理,配合自建代理池,彻底避开单 IP 高频访问被风控

应用方向: 竞品价格监控、全网比价、库存预警、评论情感分析、促销活动追踪。可以搭建"定时渲染目标商品 → 提取价格库存 → 对比历史 → 触发预警"的自动化工作流。

📈 股票 / 金融数据 —— 行情跟踪与分析

金融数据站点普遍采用重度 SPA 架构:实时行情靠 WebSocket 推送、K 线图由 Canvas/JS 绘制、财务报表分页异步加载、研报内容登录后可见、数据接口普遍带签名和时间戳防重放。

传统方式的痛点:

  • K 线图是 Canvas 绘制的,源数据在 JS 变量或接口里,页面 HTML 里根本没有
  • 实时行情走 WebSocket,HTTP 爬虫抓不到
  • 财务数据接口带签名校验(token / 时间戳 / 加密参数),逆向成本极高
  • 不同账户看到的自选股、持仓数据各不相同

SeimiRender 的解法:

  • 渲染 + HAR 双管齐下:先用 SeimiRender 渲染行情页并录制 HAR,行情数据接口(含 WebSocket 握手、XHR 拉取的 K 线数据)会被完整记录——URL、请求参数、响应 JSON 全部可见,直接定位到数据源
  • 截图保存 K 线:对于 Canvas 绘制的 K 线图,直接用 output=screenshot 保存为图片,配合 AI 视觉模型做技术形态识别,绕过数据接口逆向
  • 登录态拉取个性化数据:同步券商/财经平台的登录态后,可渲染自选股列表、个人持仓、Level-2 行情等登录后才可见的数据
  • 多源聚合:配合 browser_search 工具,Agent 可以同时从搜索引擎 + 财经资讯页 + 行情页多路获取信息,做"舆情 + 行情"的综合分析

应用方向: 个股行情跟踪、历史 K 线归档、财报数据采集、研报自动抓取、舆情-股价关联分析。结合 Agent 可以实现"定时采集 → 数据清洗 → 趋势分析 → 异动预警"的智能投研工作流。


为什么这些场景非 SeimiRender 不可

把上面三类场景的需求抽象出来,你会发现它们有共同的底层诉求,而这正是 SeimiRender 的能力拼图:

1. 真实浏览器渲染 —— 解决"数据藏在 JS 里"

无论是微博的信息流、电商的价格,还是股票的行情,核心数据都不是静态 HTML。SeimiRender 基于 Chromium,完整执行 JS、等待异步内容、跑通 SPA 路由,渲染出的就是用户真实看到的内容。

可配置的 settle_msloadFinished 后额外等待 JS 执行的毫秒数)让你能针对不同站点的加载特性做精细调节——内容密集的站点多等一会儿,确保所有异步数据都渲染到位。

2. 登录态继承 —— 解决"数据藏在登录后"

微博的个人主页、电商的会员价、股票的自选股——大量关键数据需要登录态。SeimiRender 自带的 Chrome 插件一键同步功能,把浏览器里的登录 cookie 同步到渲染服务:

  • 按域名聚合,勾选需要的域名一键 POST
  • cookie 加密落盘(data/cookies.dat),重启自动恢复,同步一次长期可用
  • GET /cookies 只返回域名计数不含 value,防止会话泄露

这让 SeimiRender 不仅是"能渲染页面",而是"能以你的身份渲染页面"。

3. HAR 录制 —— 解决"数据藏在接口里"

这是 SeimiRender 最硬核、也最被低估的能力。

开启 --remote-debugging-port,渲染时带 record_network=true,SeimiRender 会通过 CDP(Chrome DevTools Protocol)录制页面加载的全部网络流量——所有 HTTP 请求与响应,含 headers、状态码、响应体、timing——产出标准 HAR 1.2 文件

对于信息挖掘,这意味着:

  • 微博的数据接口、电商的商品 API、股票的行情 XHR——一次渲染全部暴露
  • 请求的 URL、参数、签名、响应 JSON,清清楚楚
  • 拿到接口结构后,可绕过页面直接批量调用,效率远超反复渲染
  • HAR 可导入 Chrome DevTools / Charles / haralyzer 分析

Agent 侧的闭环同样顺滑:render_urlrecord_network=trueget_har 取 HAR JSON → 直接分析。整个"渲染 + 录制 + 取结果"链路,Agent 一气呵成。

4. 反爬对抗工程化 —— 解决"数据藏在风控后"

社交、电商、金融平台都有反爬。SeimiRender 在工程层面做了系统化对抗:

  • stealth 模式(默认开启):统一 UA / screen / WebGL / canvas 指纹,伪装成一致的 Chrome 桌面环境,融入人群绕过基础检测
  • 会话预热:进程启动先加载一次目标站点拿到会话 cookie,再接业务请求,规避冷启动风控高危窗口
  • 命中验证页自动退避重试:以 Google /sorry/ 为例,命中后全新 page 重试,重试耗尽明确返回 blocked 标记,调用方可据此换引擎/走代理
  • 运行时代理热切换--proxy / POST /proxy 随时改上游代理,无需重启,可接入代理池彻底避开 IP 流控
  • 反爬失败类型化:响应里 error 前缀 blocked: + blocked:true 双标记,让调用方显式区分"反爬拦截"与"超时/网络错",采取不同策略

5. MCP 原生接入 —— 解决"数据要能被 Agent 自由调度"

以上所有能力,都通过 MCP 协议暴露给 AI Agent。5 个工具按语义层级从高到低排列:

工具典型场景
browser_search关键词搜索,返回去广告的结构化结果(舆情监控搜话题、竞品搜商品)
get_web_content读单篇文章正文(抓研报、抓商品详情)
render_url全功能渲染,任意 URL + 任意输出(截图 K 线、渲染动态页)
get_har取网络录制(逆向微博/电商/股票的隐藏接口)
get_render_result轮询补取慢站点结果

Agent 自己决定调用哪个工具、什么时候调用、怎么组合——你只需要用自然语言描述目标


让 Agent 帮你搭建闭环数据工作流

基于以上能力,你可以让 AI Agent 帮你把 SeimiRender 包装成针对特定领域的数据工作流

以舆情监控为例,你可以定义一个自定义 Skill,让 Agent 自动完成:

定时触发
  → browser_search 搜索品牌关键词(多引擎)
  → get_web_content 逐条读取相关文章正文
  → 情感分析(正面/负面/中性)
  → 汇总生成舆情日报
  → 负面预警即时通知

或者商品竞品监控:

维护目标商品 URL 列表
  → render_url 渲染各平台商品页(带登录态,拿真实到手价)
  → 提取价格、库存、促销信息
  → 对比历史价格曲线
  → 降价/补货自动预警
  → 每周生成竞品分析报告

这些工作流的"数据获取"环节,全部由 SeimiRender 在后台静默完成——不抢你的浏览器,不弹窗,不闪烁。而"理解、分析、决策"环节,交给 AI Agent。

这正是 SeimiRender 的定位:它不是又一个爬虫工具,而是 AI 时代的数据获取基础设施。


上手成本极低

免编译直接下载https://github.com/zhegexiaohuozi/seimi-render/releases

启动服务(macOS 示例):

build/seimi-render.app/Contents/MacOS/seimi-render --http-port 8088 --ws-port 8089

接入 Agent:把上面的 MCP 配置贴进你的 Agent 客户端即可。配置 JSON 可在管理后台「配置示例」标签页一键复制。

自带图形化管理后台(浏览器访问根路径),运行监控、渲染测试、cookie 管理、接口文档一应俱全。


SeimiRender —— 让你的 AI,在属于它自己的浏览器里,安静地把数据活干漂亮。

标签: none

添加新评论