BrowserBC – Einsia AI 旗下开源的浏览器操作轨迹生成 Skill
BrowserBC,一个由 Einsia AI 旗下 Navers Lab 匠心打造的开源项目,正以前所未有的方式革新着 Web Agent 的能力。它的核心使命是将人类在浏览器中的每一次操作轨迹,升华为可重复利用的自然语言技能(Skill)。这使得 Web Agent 能够“克隆”人类积累的操作经验,从而在面对同类任务时,展现出惊人的效率。
BrowserBC 的独特之处
BrowserBC 的出现,打破了以往 Web Agent 只能死板执行指令的局限。用户只需在浏览器中亲手完成一次任务,系统便能智能地将这段操作“蒸馏”成一份结构化的“技能卡”。这份技能卡可以被赋予给任何模型执行,真正实现了“做一次,复用无数次”的强大能力。
BrowserBC 的核心功能
- 轨迹捕捉:通过便捷的浏览器扩展,BrowserBC 能够全面记录用户完成任务的全过程。这包括对页面每一次截图的保存、DOM 结构的快照、用户发生的每一次动作(如点击、输入、页面跳转)、以及系统给出的反馈和最终页面状态。
- 智能提炼:原始的用户操作轨迹往往包含大量冗余和干扰信息。BrowserBC 会对这些嘈杂的轨迹进行智能清洗和去噪,并按照语义将它们切分成一系列连贯的子过程。随后,这些子过程会被转化为结构化的自然语言技能卡(Skill Card)。在这个过程中,BrowserBC 刻意剥离了依赖于具体坐标或选择器的脆弱细节,而是专注于保留“该做什么”、“如何判断任务完成”、“遇到问题该如何应对”等具有迁移性的过程性知识。
- 技能图谱管理:面对海量的技能,BrowserBC 提供了一个可扩展的技能图谱(skill graph)来组织它们。通过对技能进行语义相似度分析,系统能够自动合并、特化以及链接相关的技能,有效避免了不必要的重复和冗余。
- 技能检索与执行:当 Agent 需要执行任务时,它会根据检索到的技能卡指导,结合实时的页面状态进行自主操作,而不是简单地机械复刻过去的坐标。
- 本地化部署:BrowserBC 提供了 Journey Forge Local 版本,该版本完全基于 Python 运行,所有数据都存储在本地,确保了用户的数据隐私。同时,它还支持与 Claude Code 和 Claude Desktop 的集成。
想要加入我们的 AI 开源项目交流群?请关注微信公众号并回复“开源”。
如何体验 BrowserBC
- 配置并启动本地服务器:首先,复制提供的配置文件,并填入您的 LLM API Key。随后,启动服务器,您就可以通过访问 http://127.0.0.1:8099/ 来使用控制面板了。
- 构建并加载浏览器扩展:在
extension目录下,安装必要的依赖并执行构建命令。接着,在 Chrome 浏览器扩展管理页面,启用开发者模式,然后加载extension/dist/chrome-mv3目录下的扩展。 - 录制您的任务:利用刚刚安装的浏览器扩展,开始录制您在浏览器中的操作。完成录制后,请为您的任务标记清晰的意图,并将其上传。
- 自动化技能提炼:后台的自动化流水线将高效地完成原子化(atomize)、分类(classify)、分桶(bucket)、蒸馏(distill)和安装(install)等一系列步骤。整个过程通常在 1 到 3 分钟内即可生成一份可用的技能。
- 使用您的新技能:
- 对于 Claude Code 用户:生成的技能会自动安装到您本地的
~/.claude/skills/目录下。 - 对于 Claude Desktop 用户:您可以从控制面板下载生成的技能
.zip文件。然后,在 Claude Desktop 的 Settings → Skills 菜单中上传该文件即可。
- 对于 Claude Code 用户:生成的技能会自动安装到您本地的
- 配置浏览器执行(可选):如果您希望 Claude Desktop 能够真正执行点击、输入或导航等操作,您可以在控制面板中配置 Playwright MCP。
BrowserBC 的核心优势
- 技能的跨平台迁移性:BrowserBC 生成的技能本质上是自然语言形式的“过程性先验知识”,这意味着它们可以在不同的模型之间传递和复用。一次强大的模型蒸馏,就能让更多的小模型以更低的成本进行复用。
- 摆脱脆弱细节的束缚:BrowserBC 并非简单地克隆页面坐标或 DOM 选择器,而是专注于克隆“做什么”以及“如何判断完成”。这种设计使得技能在面对页面布局变化时,依然能够举一反三,保持其有效性。
- 显著提升任务成功率:在 WebArena-Hard 测试集上,BrowserBC 将任务成功率从 60.5% 提升至 81.4%,增幅高达 20.9%。而在 ClawBench 测试集中,成功率更是从 32.9% 飙升至 68.4%,提升了 35.5%。
- 优化交互效率:平均而言,BrowserBC 将工具调用次数从 31.2 次减少到 22.7 次,削减了 27.3% 的不必要尝试,有效降低了试探性导航带来的效率损耗。
- 跨越边界的迁移潜力:BrowserBC 的过程性先验知识,不仅限于浏览器环境。初步研究表明,这些知识甚至可以迁移到 OSWorld 这样的桌面操作系统环境中。
- 保障数据隐私安全:对于本地部署版本,所有用户数据都严格存储在本地,仅在技能蒸馏过程中调用配置的 LLM API,最大限度地保护了用户的数据隐私。
BrowserBC 的官方资源
- 项目博客:https://lab.einsia.ai/browserbc/
- GitHub 仓库:https://github.com/Einsia/Browser-BC
- 研究论文:https://lab.einsia.ai/browserbc/paper
BrowserBC 与竞品的对比分析
| 维度 | BrowserBC | 传统 RPA / 按键精灵 | Playwright / MCP 工具 | 通用 Web Agent(如 Claude/Codex) |
|---|---|---|---|---|
| 核心定位 | 人类轨迹 → 可复用技能 | 录制坐标 → 机械回放 | 浏览器控制 API | 从零探索网页 |
| 复用方式 | 自然语言技能卡,语义化复用 | 固定坐标/选择器回放 | 需编写代码脚本 | 每次任务重新摸索 |
| 页面变化适应性 | 强(剥离脆弱细节) | 极弱(布局一变即失效) | 中等(需维护选择器) | 强(实时感知页面) |
| 知识积累 | 可积累技能图,持续扩展 | 脚本堆积,难以管理 | 依赖代码库维护 | 无积累,每次从零开始 |
| 执行成本 | 强模型蒸馏一次,小模型便宜复用 | 运行成本低 | 开发成本高 | 每次需调用最强模型 |
| 数据隐私 | 本地部署,数据不出机器 | 本地运行 | 本地/云端均可 | 通常依赖云端 API |
BrowserBC 的应用场景
- 旅行预订与比价:在 Airbnb、Booking 等预订平台上,BrowserBC 可以帮助 Agent 自动输入旅行时间、地点、人数,应用各种筛选条件(如评分、价格、设施),并分析搜索结果,找出最适合的住宿选项。
- 电商购物与筛选:在各大购物平台,BrowserBC 能够指导 Agent 完成商品搜索、应用多重筛选(价格区间、品牌、用户评分)、对比商品详情、添加到购物车直至完成最终结算的整个流程。
- 后台管理操作:对于电商后台、内容管理系统(CMS)或各类管理面板,BrowserBC 可以自动化执行如商品上架、订单处理、库存更新、用户权限配置等重复性的管理任务。
- 社区论坛互动:在 Reddit 等社区论坛,BrowserBC 可以协助 Agent 进行话题搜索、帖子筛选、参与讨论、信息收集,甚至执行版主的管理操作。
- 跨站点信息整合:当任务需要从多个网站收集、对比和整合信息时,例如跨平台比价、多源数据汇总、竞品动态监控等,BrowserBC 都能发挥重要作用。
- 开发工具使用:在 GitHub、GitLab 等开发者平台上,BrowserBC 可以指导 Agent 执行代码仓库操作(如登录、创建项目、提交 Issue、发起合并请求)、CI/CD 配置,或进行文档查阅。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...


