BrowserBC

BrowserBC – Einsia AI 旗下开源的浏览器操作轨迹生成 Skill

BrowserBC,一个由 Einsia AI 旗下 Navers Lab 匠心打造的开源项目,正以前所未有的方式革新着 Web Agent 的能力。它的核心使命是将人类在浏览器中的每一次操作轨迹,升华为可重复利用的自然语言技能(Skill)。这使得 Web Agent 能够“克隆”人类积累的操作经验,从而在面对同类任务时,展现出惊人的效率。

BrowserBC 的独特之处

BrowserBC 的出现,打破了以往 Web Agent 只能死板执行指令的局限。用户只需在浏览器中亲手完成一次任务,系统便能智能地将这段操作“蒸馏”成一份结构化的“技能卡”。这份技能卡可以被赋予给任何模型执行,真正实现了“做一次,复用无数次”的强大能力。

BrowserBC 的核心功能

  • 轨迹捕捉:通过便捷的浏览器扩展,BrowserBC 能够全面记录用户完成任务的全过程。这包括对页面每一次截图的保存、DOM 结构的快照、用户发生的每一次动作(如点击、输入、页面跳转)、以及系统给出的反馈和最终页面状态。
  • 智能提炼:原始的用户操作轨迹往往包含大量冗余和干扰信息。BrowserBC 会对这些嘈杂的轨迹进行智能清洗和去噪,并按照语义将它们切分成一系列连贯的子过程。随后,这些子过程会被转化为结构化的自然语言技能卡(Skill Card)。在这个过程中,BrowserBC 刻意剥离了依赖于具体坐标或选择器的脆弱细节,而是专注于保留“该做什么”、“如何判断任务完成”、“遇到问题该如何应对”等具有迁移性的过程性知识。
  • 技能图谱管理:面对海量的技能,BrowserBC 提供了一个可扩展的技能图谱(skill graph)来组织它们。通过对技能进行语义相似度分析,系统能够自动合并、特化以及链接相关的技能,有效避免了不必要的重复和冗余。
  • 技能检索与执行:当 Agent 需要执行任务时,它会根据检索到的技能卡指导,结合实时的页面状态进行自主操作,而不是简单地机械复刻过去的坐标。
  • 本地化部署:BrowserBC 提供了 Journey Forge Local 版本,该版本完全基于 Python 运行,所有数据都存储在本地,确保了用户的数据隐私。同时,它还支持与 Claude Code 和 Claude Desktop 的集成。

想要加入我们的 AI 开源项目交流群?请关注微信公众号并回复“开源”。

如何体验 BrowserBC

  • 配置并启动本地服务器:首先,复制提供的配置文件,并填入您的 LLM API Key。随后,启动服务器,您就可以通过访问 http://127.0.0.1:8099/ 来使用控制面板了。
  • 构建并加载浏览器扩展:在 extension 目录下,安装必要的依赖并执行构建命令。接着,在 Chrome 浏览器扩展管理页面,启用开发者模式,然后加载 extension/dist/chrome-mv3 目录下的扩展。
  • 录制您的任务:利用刚刚安装的浏览器扩展,开始录制您在浏览器中的操作。完成录制后,请为您的任务标记清晰的意图,并将其上传。
  • 自动化技能提炼:后台的自动化流水线将高效地完成原子化(atomize)、分类(classify)、分桶(bucket)、蒸馏(distill)和安装(install)等一系列步骤。整个过程通常在 1 到 3 分钟内即可生成一份可用的技能。
  • 使用您的新技能

    • 对于 Claude Code 用户:生成的技能会自动安装到您本地的 ~/.claude/skills/ 目录下。
    • 对于 Claude Desktop 用户:您可以从控制面板下载生成的技能 .zip 文件。然后,在 Claude Desktop 的 Settings → Skills 菜单中上传该文件即可。
  • 配置浏览器执行(可选):如果您希望 Claude Desktop 能够真正执行点击、输入或导航等操作,您可以在控制面板中配置 Playwright MCP。

BrowserBC 的核心优势

  • 技能的跨平台迁移性:BrowserBC 生成的技能本质上是自然语言形式的“过程性先验知识”,这意味着它们可以在不同的模型之间传递和复用。一次强大的模型蒸馏,就能让更多的小模型以更低的成本进行复用。
  • 摆脱脆弱细节的束缚:BrowserBC 并非简单地克隆页面坐标或 DOM 选择器,而是专注于克隆“做什么”以及“如何判断完成”。这种设计使得技能在面对页面布局变化时,依然能够举一反三,保持其有效性。
  • 显著提升任务成功率:在 WebArena-Hard 测试集上,BrowserBC 将任务成功率从 60.5% 提升至 81.4%,增幅高达 20.9%。而在 ClawBench 测试集中,成功率更是从 32.9% 飙升至 68.4%,提升了 35.5%。
  • 优化交互效率:平均而言,BrowserBC 将工具调用次数从 31.2 次减少到 22.7 次,削减了 27.3% 的不必要尝试,有效降低了试探性导航带来的效率损耗。
  • 跨越边界的迁移潜力:BrowserBC 的过程性先验知识,不仅限于浏览器环境。初步研究表明,这些知识甚至可以迁移到 OSWorld 这样的桌面操作系统环境中。
  • 保障数据隐私安全:对于本地部署版本,所有用户数据都严格存储在本地,仅在技能蒸馏过程中调用配置的 LLM API,最大限度地保护了用户的数据隐私。

BrowserBC 的官方资源

BrowserBC 与竞品的对比分析

维度BrowserBC传统 RPA / 按键精灵Playwright / MCP 工具通用 Web Agent(如 Claude/Codex)
核心定位人类轨迹 → 可复用技能录制坐标 → 机械回放浏览器控制 API从零探索网页
复用方式自然语言技能卡,语义化复用固定坐标/选择器回放需编写代码脚本每次任务重新摸索
页面变化适应性强(剥离脆弱细节)极弱(布局一变即失效)中等(需维护选择器)强(实时感知页面)
知识积累可积累技能图,持续扩展脚本堆积,难以管理依赖代码库维护无积累,每次从零开始
执行成本强模型蒸馏一次,小模型便宜复用运行成本低开发成本高每次需调用最强模型
数据隐私本地部署,数据不出机器本地运行本地/云端均可通常依赖云端 API

BrowserBC 的应用场景

  • 旅行预订与比价:在 Airbnb、Booking 等预订平台上,BrowserBC 可以帮助 Agent 自动输入旅行时间、地点、人数,应用各种筛选条件(如评分、价格、设施),并分析搜索结果,找出最适合的住宿选项。
  • 电商购物与筛选:在各大购物平台,BrowserBC 能够指导 Agent 完成商品搜索、应用多重筛选(价格区间、品牌、用户评分)、对比商品详情、添加到购物车直至完成最终结算的整个流程。
  • 后台管理操作:对于电商后台、内容管理系统(CMS)或各类管理面板,BrowserBC 可以自动化执行如商品上架、订单处理、库存更新、用户权限配置等重复性的管理任务。
  • 社区论坛互动:在 Reddit 等社区论坛,BrowserBC 可以协助 Agent 进行话题搜索、帖子筛选、参与讨论、信息收集,甚至执行版主的管理操作。
  • 跨站点信息整合:当任务需要从多个网站收集、对比和整合信息时,例如跨平台比价、多源数据汇总、竞品动态监控等,BrowserBC 都能发挥重要作用。
  • 开发工具使用:在 GitHub、GitLab 等开发者平台上,BrowserBC 可以指导 Agent 执行代码仓库操作(如登录、创建项目、提交 Issue、发起合并请求)、CI/CD 配置,或进行文档查阅。
阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...