WikiSkill

AI工具10小时前更新 AI工具集
0 0 0

WikiSkill 是什么

WikiSkill图注:WikiSkill 在 arXiv 上的论文摘要页

WikiSkill 是 Google Research 与弗吉尼亚理工(Virginia Tech)联合团队在 2026 年 8 月 27 日于 arXiv 上公开的一篇论文(arXiv:2608.27454)所提出的 AI Agent 技能进化框架,论文标题为 “WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution”。它的核心目标很直白:让 Agent 不再”用完即忘”,而是把每一次执行轨迹沉淀为持久化知识,再从知识里生长出可复用的技能。和此前流行的 Trace2Skill、EvoSkill、SkillOpt 等”执行—修改技能—回滚”循环的方案相比,WikiSkill 最关键的差异是把”沉淀知识”和”可执行技能”严格分层,让失败本身也成为下一轮迭代的输入。

论文作者 Liyan Tang、Cyrus Rashtchian、Chun-Sung Ferng、Andrew Tomkins、Da-Cheng Juan、Tu Vu 把这一框架的核心灵感归于 Andrej Karpathy 在 2026 年 4 月提出的 “LLM Wiki” 思想——把知识以 Markdown wiki 的形式持续维护,让经验以可复利的方式累积;WikiSkill 相当于把这种 wiki 思想搬进了 Agent 的开发流水线。截至 2026 年 9 月初,论文本身尚未发布开源代码,框架以论文 + 评测方法的形式提供给社区参考。

WikiSkill图注:WikiSkill 三层工作空间与五个基准上的平均成绩(编译自 arXiv 2608.27454)

WikiSkill 的主要功能

  1. 三层工作空间:把 Agent 的工作目录拆成 Raw Layer(不可变原始轨迹)、Wiki Layer(持久化结构化知识,永不回滚)、Skills Layer(当前生效的可执行技能,可回滚),三层权限、生命周期、更新逻辑完全隔离。
  2. 持久化模式沉淀:Wiki 层用 patterns/ 目录的 Markdown 文件记录通用失败模式与成功策略,用 logs.md 记录每一次技能提案的变更和验证结果,用 skill-impact.md 跟踪每个技能对验证分数的影响,避免在已被否决的方向上重复尝试。
  3. 四组件进化闭环:Inference Agent(执行)→ Wiki Maintainer(根因分析 + 知识更新)→ Skill Proposer(基于 wiki 提一个原子化修改)→ Gating(在验证集上跑分、仅当分数提升才接受);被拒绝的提案只回滚 Skill 层,Wiki 层保留全部记录。
  4. 严格权限隔离:执行阶段的 Inference Agent 被禁止访问 Wiki 层,避免”执行时直接抄 wiki 答案”污染轨迹;只有 Skill Proposer 可以读取 wiki 索引和具体 pattern。消融实验显示该约束能让平均得分从 60.9% 提升到 63.7%。
  5. 跨模型技能迁移:在一个模型上迭代出的技能可以被另一个不同参数量、不同家族的目标模型直接调用;论文实验中 Qwen-3.6-27B 演化出的 Spreadsheet 技能把 Qwen-3.5-9B 在该任务上的表现从 24.3% 提升到 50.5%,超过该模型自身演化的技能。

如何使用 WikiSkill

  1. 建立三层目录:在 Agent 工作空间下分别创建 raw/wiki/patterns/skills/ 三层目录,并在 wiki/ 下放好 logs.mdskill-impact.mdindex.md 三个元文件,分别承担演化日志、技能影响表、pattern 索引的角色。
  2. 配置 Inference Agent:让执行 Agent 在训练任务上跑当前生效的技能集,产出轨迹全部写入 raw/;执行阶段禁止其读取 Wiki 层,只能直接消费 Skills 层注入的技能内容。
  3. 设置 Wiki Maintainer:用 LLM 驱动 Wiki 维护器,对失败轨迹做根因分析并新增 / 更新 patterns/,对成功轨迹提炼可复用策略,并在 logs.md 末尾追加本轮摘要。
  4. 设置 Skill Proposer:给 Proposer 工具调用能力(read_file / create_skill / edit_skill),并其每次只提一个原子化改动;新建或修改技能时同步写好 SKILL.mdPURPOSE.md,后者明确引用激发此次改动的 pattern。
  5. 配置 Gating & Rollback:在的验证集上评估候选技能,仅当分数高于历史最佳才接受;不接受时回滚 Skill 层到上一稳定版本,但 Wiki 层照常保留这次尝试的记录。
  6. 循环迭代与审计:典型一次完整演化跑 7–8 轮迭代,每轮都要在 skill-impact.md 中追加本次提案的 diff、验证分数和 accept/reject 决定,构成完整的可审计链路。

WikiSkill 的使用场景

  1. 数学与公式推理:在 LiveMath 等多步数学推理任务上,WikiSkill 能把 Gemini-3.5-Flash 的得分从 33.0% 提升到 72.6%,非常适合需要长链推理 + 工具调用辅助计算的科研与教育场景。
  2. 电子表格与办公自动化:在 SpreadsheetBench 上,技能可以沉淀”透视表生成””批量公式应用”等模式,论文中 Qwen-3.6-27B 演化出的表格技能让 Qwen-3.5-9B 的得分翻倍,非常适合企业财务、运营、报表自动化场景。
  3. 长文档问答与知识检索:在 OfficeQA 等长上下文 QA 任务上,技能可以沉淀”多线索检索—拼接—回答”的标准操作流程,帮助 Agent 在上千页文档里保持稳定检索质量,适合法律、合规、技术文档检索场景。
  4. 具身交互与环境决策:在 ALFWorld 模拟环境里,技能可以编码”取物—检查—放置”等操作 SOP,论文实验显示这些技能在不同模型间迁移也能保留绝大部分增益,适合机器人、虚拟助手等需要长链条操作的场景。
  5. 多模型团队的技能复用:当企业同时使用多种大模型(如 Gemini、Qwen、Gemma 等)时,可以用强模型”探”技能、弱模型”用”技能,把不同模型家族的能力通过技能这条通道打通,降低多模型适配成本。

WikiSkill 的常见问题解答

WikiSkill 和普通的 RAG / 记忆系统有什么区别?
RAG 和记忆系统解决的是”存什么、怎么检索”,但经验用完就丢;WikiSkill 把经验沉淀成结构化 Wiki,再用 Wiki 驱动技能演化,让失败本身也成为下一轮迭代的输入。它不修改模型权重,只通过外部知识沉淀与技能迭代来提升 Agent 表现。
9B 模型真的能超过 27B 模型吗?
在论文默认配置下可以。Qwen-3.5-9B 加上 WikiSkill 演化出的技能后,平均准确率达到 47.4%,超过 Qwen-3.6-27B 不带任何技能的 39.4%。WikiSkill 团队强调这是”发现有用程序性知识”和”执行这些知识”两种能力解耦的结果,并非简单用知识替代模型规模。
WikiSkill 已经有开源实现了吗?
截至 2026 年 9 月初,论文作者尚未发布官方开源代码。但工程实现并不复杂,核心就是文件系统 + LLM 工具调用 + 循环编排,社区已有按论文思路自建实现的案例,论文也给出了可直接落地的目录结构、组件 prompt 与编排流程作为参考。

WikiSkill 论文与资源

WikiSkill 的核心资源是其 arXiv 论文,可通过以下链接访问:

论文实验覆盖了 Qwen-3.5-4B/9B、Qwen-3.6-27B、Gemma-4-31B、Gemini-3.5-Flash 等五个模型,评测基准包括 LiveMath、SealQA、SpreadsheetBench、OfficeQA、ALFWorld 五个数据集,并与 Trace2Skill、EvoSkill、SkillOpt 三个主流基线做了对比。

OpenI AI时代点评

WikiSkill 真正有意思的地方不在某一个具体数字,而在于它把 Agent 技能的”演化”从单次轨迹的局部调整,推到了”系统化长期知识沉淀”的层级。失败不再是需要绕开的尴尬记录,而是一笔会被下次提案主动检索的资产;9B 模型加 WikiSkill 能跑赢 27B 模型,说明”知道怎么想”和”想得快”确实是两件事,前者甚至比模型规模更具杠杆效应。对企业 AI 团队来说,WikiSkill 提供了一个相对低成本、可复利的工程模板:哪怕你暂时不打算走 arXiv 那条学术路线,也可以把”三层目录 + 持久化 Wiki + 验证 gating”这套最小可行实现搬进自己的 Agent 平台,让多模型、多业务线共享一份持续生长的”内部 Wiki”。如果想进一步理解当前 Agent 生态中各家的工程实践,可以参考 OpenI 上收录的 ArkClaw 智能体MetaGPT:多智能体框架AutoGLM 沉思 – AI 智能体Coze 智能体文心智能体平台 AgentBuilder 等框架与平台,从”技能/工具管理”维度横向对比,体会 WikiSkill 把”沉淀”做成一等公民的差异。

阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...