WikiSkill 是什么
图注:WikiSkill 在 arXiv 上的论文摘要页
WikiSkill 是 Google Research 与弗吉尼亚理工(Virginia Tech)联合团队在 2026 年 8 月 27 日于 arXiv 上公开的一篇论文(arXiv:2608.27454)所提出的 AI Agent 技能进化框架,论文标题为 “WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution”。它的核心目标很直白:让 Agent 不再”用完即忘”,而是把每一次执行轨迹沉淀为持久化知识,再从知识里生长出可复用的技能。和此前流行的 Trace2Skill、EvoSkill、SkillOpt 等”执行—修改技能—回滚”循环的方案相比,WikiSkill 最关键的差异是把”沉淀知识”和”可执行技能”严格分层,让失败本身也成为下一轮迭代的输入。
论文作者 Liyan Tang、Cyrus Rashtchian、Chun-Sung Ferng、Andrew Tomkins、Da-Cheng Juan、Tu Vu 把这一框架的核心灵感归于 Andrej Karpathy 在 2026 年 4 月提出的 “LLM Wiki” 思想——把知识以 Markdown wiki 的形式持续维护,让经验以可复利的方式累积;WikiSkill 相当于把这种 wiki 思想搬进了 Agent 的开发流水线。截至 2026 年 9 月初,论文本身尚未发布开源代码,框架以论文 + 评测方法的形式提供给社区参考。
图注:WikiSkill 三层工作空间与五个基准上的平均成绩(编译自 arXiv 2608.27454)
WikiSkill 的主要功能
- 三层工作空间:把 Agent 的工作目录拆成 Raw Layer(不可变原始轨迹)、Wiki Layer(持久化结构化知识,永不回滚)、Skills Layer(当前生效的可执行技能,可回滚),三层权限、生命周期、更新逻辑完全隔离。
- 持久化模式沉淀:Wiki 层用
patterns/目录的 Markdown 文件记录通用失败模式与成功策略,用logs.md记录每一次技能提案的变更和验证结果,用skill-impact.md跟踪每个技能对验证分数的影响,避免在已被否决的方向上重复尝试。 - 四组件进化闭环:Inference Agent(执行)→ Wiki Maintainer(根因分析 + 知识更新)→ Skill Proposer(基于 wiki 提一个原子化修改)→ Gating(在验证集上跑分、仅当分数提升才接受);被拒绝的提案只回滚 Skill 层,Wiki 层保留全部记录。
- 严格权限隔离:执行阶段的 Inference Agent 被禁止访问 Wiki 层,避免”执行时直接抄 wiki 答案”污染轨迹;只有 Skill Proposer 可以读取 wiki 索引和具体 pattern。消融实验显示该约束能让平均得分从 60.9% 提升到 63.7%。
- 跨模型技能迁移:在一个模型上迭代出的技能可以被另一个不同参数量、不同家族的目标模型直接调用;论文实验中 Qwen-3.6-27B 演化出的 Spreadsheet 技能把 Qwen-3.5-9B 在该任务上的表现从 24.3% 提升到 50.5%,超过该模型自身演化的技能。
如何使用 WikiSkill
- 建立三层目录:在 Agent 工作空间下分别创建
raw/、wiki/patterns/、skills/三层目录,并在wiki/下放好logs.md、skill-impact.md、index.md三个元文件,分别承担演化日志、技能影响表、pattern 索引的角色。 - 配置 Inference Agent:让执行 Agent 在训练任务上跑当前生效的技能集,产出轨迹全部写入
raw/;执行阶段禁止其读取 Wiki 层,只能直接消费 Skills 层注入的技能内容。 - 设置 Wiki Maintainer:用 LLM 驱动 Wiki 维护器,对失败轨迹做根因分析并新增 / 更新
patterns/,对成功轨迹提炼可复用策略,并在logs.md末尾追加本轮摘要。 - 设置 Skill Proposer:给 Proposer 工具调用能力(
read_file/create_skill/edit_skill),并其每次只提一个原子化改动;新建或修改技能时同步写好SKILL.md和PURPOSE.md,后者明确引用激发此次改动的 pattern。 - 配置 Gating & Rollback:在的验证集上评估候选技能,仅当分数高于历史最佳才接受;不接受时回滚 Skill 层到上一稳定版本,但 Wiki 层照常保留这次尝试的记录。
- 循环迭代与审计:典型一次完整演化跑 7–8 轮迭代,每轮都要在
skill-impact.md中追加本次提案的 diff、验证分数和 accept/reject 决定,构成完整的可审计链路。
WikiSkill 的使用场景
- 数学与公式推理:在 LiveMath 等多步数学推理任务上,WikiSkill 能把 Gemini-3.5-Flash 的得分从 33.0% 提升到 72.6%,非常适合需要长链推理 + 工具调用辅助计算的科研与教育场景。
- 电子表格与办公自动化:在 SpreadsheetBench 上,技能可以沉淀”透视表生成””批量公式应用”等模式,论文中 Qwen-3.6-27B 演化出的表格技能让 Qwen-3.5-9B 的得分翻倍,非常适合企业财务、运营、报表自动化场景。
- 长文档问答与知识检索:在 OfficeQA 等长上下文 QA 任务上,技能可以沉淀”多线索检索—拼接—回答”的标准操作流程,帮助 Agent 在上千页文档里保持稳定检索质量,适合法律、合规、技术文档检索场景。
- 具身交互与环境决策:在 ALFWorld 模拟环境里,技能可以编码”取物—检查—放置”等操作 SOP,论文实验显示这些技能在不同模型间迁移也能保留绝大部分增益,适合机器人、虚拟助手等需要长链条操作的场景。
- 多模型团队的技能复用:当企业同时使用多种大模型(如 Gemini、Qwen、Gemma 等)时,可以用强模型”探”技能、弱模型”用”技能,把不同模型家族的能力通过技能这条通道打通,降低多模型适配成本。
WikiSkill 的常见问题解答
- WikiSkill 和普通的 RAG / 记忆系统有什么区别?
- RAG 和记忆系统解决的是”存什么、怎么检索”,但经验用完就丢;WikiSkill 把经验沉淀成结构化 Wiki,再用 Wiki 驱动技能演化,让失败本身也成为下一轮迭代的输入。它不修改模型权重,只通过外部知识沉淀与技能迭代来提升 Agent 表现。
- 9B 模型真的能超过 27B 模型吗?
- 在论文默认配置下可以。Qwen-3.5-9B 加上 WikiSkill 演化出的技能后,平均准确率达到 47.4%,超过 Qwen-3.6-27B 不带任何技能的 39.4%。WikiSkill 团队强调这是”发现有用程序性知识”和”执行这些知识”两种能力解耦的结果,并非简单用知识替代模型规模。
- WikiSkill 已经有开源实现了吗?
- 截至 2026 年 9 月初,论文作者尚未发布官方开源代码。但工程实现并不复杂,核心就是文件系统 + LLM 工具调用 + 循环编排,社区已有按论文思路自建实现的案例,论文也给出了可直接落地的目录结构、组件 prompt 与编排流程作为参考。
WikiSkill 论文与资源
WikiSkill 的核心资源是其 arXiv 论文,可通过以下链接访问:
- arXiv 论文:https://arxiv.org/abs/2608.27454
- PDF 直链:https://arxiv.org/pdf/2608.27454
论文实验覆盖了 Qwen-3.5-4B/9B、Qwen-3.6-27B、Gemma-4-31B、Gemini-3.5-Flash 等五个模型,评测基准包括 LiveMath、SealQA、SpreadsheetBench、OfficeQA、ALFWorld 五个数据集,并与 Trace2Skill、EvoSkill、SkillOpt 三个主流基线做了对比。
OpenI AI时代点评
WikiSkill 真正有意思的地方不在某一个具体数字,而在于它把 Agent 技能的”演化”从单次轨迹的局部调整,推到了”系统化长期知识沉淀”的层级。失败不再是需要绕开的尴尬记录,而是一笔会被下次提案主动检索的资产;9B 模型加 WikiSkill 能跑赢 27B 模型,说明”知道怎么想”和”想得快”确实是两件事,前者甚至比模型规模更具杠杆效应。对企业 AI 团队来说,WikiSkill 提供了一个相对低成本、可复利的工程模板:哪怕你暂时不打算走 arXiv 那条学术路线,也可以把”三层目录 + 持久化 Wiki + 验证 gating”这套最小可行实现搬进自己的 Agent 平台,让多模型、多业务线共享一份持续生长的”内部 Wiki”。如果想进一步理解当前 Agent 生态中各家的工程实践,可以参考 OpenI 上收录的 ArkClaw 智能体、MetaGPT:多智能体框架、AutoGLM 沉思 – AI 智能体、Coze 智能体、文心智能体平台 AgentBuilder 等框架与平台,从”技能/工具管理”维度横向对比,体会 WikiSkill 把”沉淀”做成一等公民的差异。


