GenEvolve

GenEvolve – 美团等推出的自演进图像生成 Agent

GenEvolve:驱动图像生成迈向智能自演进的新纪元

GenEvolve,一个汇聚了香港科技大学(广州)、美团以及新加坡国立大学智慧结晶的革新性项目,它不仅仅是一个图像生成工具,更是一个能够自我学习、不断进化的智能体(Agent)。GenEvolve 将开放式的图像生成过程,巧妙地转化为一系列工具协同工作的视觉轨迹,Agent 通过深度挖掘文本信息、精准检索视觉参考,并调用其内置的生成知识库,最终构建出能够被任何先进生成器渲染的“Prompt-Reference Program”。

GenEvolve 的核心能力概览

  • 文本探索引索(search): Agent 能够主动搜寻外部的翔实信息,为生成内容注入真实世界的知识,例如精确描绘历史建筑的细节、还原公众人物的样貌,或是准确复制商品的结构特征。
  • 图像参阅检索(image_search): 通过对海量视觉数据的智能检索,Agent 可以获取具有参考价值的图像,从而捕捉地标的独特风貌、人物的姿态神韵,以及材质的细腻质感。
  • 生成知识赋能(query_knowledge): Agent 能够激活其内部的生成技能库,应对诸如文字的精准渲染、复杂空间的合理布局、以及材质保持一致性等高难度挑战。
  • Prompt-Reference Program 的智能编排: Agent 能够将前述各工具的输出进行有机整合,生成一套可执行的生成程序,这套程序能够被任何具备参考条件的生成器高效地解析和渲染。

GenEvolve 的技术精髓剖析

  • 两阶段的精细化训练

    • 监督式微调(SFT)作为启航: 在高质量的“教师”轨迹引导下,对 Qwen3-VL-8B-Instruct 模型进行监督式微调,使其初步掌握基础的工具调用逻辑和程序编写方式。
    • 自我进化(Rollout)的持续打磨: 针对同一生成请求,Agent 会生成多条不同的执行轨迹。这些轨迹被渲染成图像后,会经过视觉和文本判分器的双重评估。随后,利用 GRPO(Proximal Policy Optimization)算法对轨迹进行优化,以提升其整体奖励。
  • 视觉经验的深度蒸馏(Visual Experience Distillation): Agent 会对比同一请求下最优与最差的执行轨迹,从中提炼出结构化的“决策指南”。通过 token 级别的反向 KL 散度约束,将“教师”模型在决策上的偏好“蒸馏”给“学生”模型。这一过程使得 Agent 能够养成在面对相似请求时,如何高效搜索、选择恰当参考、以及组织约束条件的智能决策习惯。

关注微信公众号,回复“开源”,即可加入AI开源项目交流群,与同行一同探索前沿技术。

如何驾驭 GenEvolve,开启您的创意之旅

  • 代码获取: 首先,从 GitHub 平台克隆 GenEvolve 的全部代码至您的本地开发环境。
  • 环境搭建: 运行 pip install -r requirements.txt 命令,安装项目运行所需的所有 Python 库。
  • 模型下载: 前往 HuggingFace,下载 MeiGen-AI/GenEvolve 仓库下的 Qwen3-VL-8B Agent 策略权重。
  • 工具配置: 配置您的搜索引擎 API 密钥,以激活 searchimage_search 工具的功能。
  • 知识加载: 将包含八项生成技能的 Markdown 文件放置到指定目录下,以便 query_knowledge 工具能够顺利读取。
  • 生成器选择: 在 Qwen-Image-Edit 或 Nano Banana Pro 这两个后端生成器中,选择您偏好的一个,并配置相应的密钥。
  • Agent 初始化: 创建 GenEvolveAgent 的实例,并传入模型路径、所选生成器名称以及工具列表。
  • 输入您的创意: 调用 agent.run() 方法,将您对图像生成的自然语言描述输入其中。
  • 轨迹执行与优化: Agent 将自动执行文本证据搜寻、视觉参考检索、生成知识调用等一系列动作,并最终合成 prompt-reference program。
  • 图像生成呈现: 将 Agent 生成的程序输入到您配置好的生成器后端,即可获得最终的精美图像。

GenEvolve 的卓越之处,何以脱颖而出

  • 生成器通用性设计: Agent 的策略不与任何特定生成器绑定,一套 Agent 策略可以灵活搭配开源的 Qwen-Image-Edit 或性能强大的 Nano Banana Pro。
  • 闭环式自我进化机制: GRPO 和视觉经验自蒸馏的结合,构建了一个“更强的策略 → 更好的轨迹 → 更丰富的经验 → 未来的持续改进”的良性循环。
  • 精细化的信用分配机制: 相较于仅提供标量奖励的传统强化学习方法,SDL(Structured Decision Learning)提供了 token 级别的指导,能够明确指出一条轨迹的优秀之处体现在工具计划、参考选择还是约束条件的编写上。
  • 跨基准的强大泛化能力: 在 WISE 知识密集型基准测试中,GenEvolve 在未进行领域内微调的情况下,其 8B 开源策略的表现已超越了 GPT-4o。

GenEvolve 项目的开放获取途径

  • 官方网站: https://ephemeral182.github.io/GenEvolve/
  • GitHub 仓库: https://github.com/MeiGen-AI/GenEvolve
  • HuggingFace 模型库: https://huggingface.co/MeiGen-AI/GenEvolve

GenEvolve 与同类竞品深度对比

对比维度GenEvolveGen-Searcher
核心机制工具协同编排视觉轨迹 → 生成 Prompt-Reference Program → 跨越不同生成器进行渲染搜索增强 → 直接生成
Agent 架构包含 search、image_search 和 query_knowledge 三种工具的协同闭环主要侧重于搜索工具的调用
训练方法SFT 冷启动 + GRPO 轨迹优化 + 视觉经验自蒸馏(SDL)未公开明确的多阶段训练机制
自我进化支持:通过 GRPO 和 SDL 实现“更强策略→更好轨迹→更丰富经验”的闭环演进不支持:缺乏持续性的优化机制
生成器可迁移性核心优势:同一 Agent 输出可适配 Qwen-Image-Edit 或 Nano Banana Pro绑定特定生成器后端
开源程度全栈开源:模型权重、运行时、工具、数据集、评测基准开源程度有限
KScore0.36630.3493

GenEvolve 的广泛应用场景展望

  • 知识密集型图像生成: 在需要引入外部世界知识的场景下,如生成真实地标(埃菲尔铁塔、故宫)、公众人物肖像、特定商品细节,或重现历史。Agent 通过搜索工具来弥补生成器可能出现的“幻觉”或细节错误。
  • 质量约束型图像生成: 对于商业设计、广告海报、教育插图等对文字渲染、精确计数、空间布局、属性绑定、解剖结构准确性、材质逼真度以及美学风格有严格要求的场景。
  • 参考一致性图像生成: 在需要输出内容与参考图保持身份一致(如角色设计)、材质特殊(如金属或丝绸质感),或风格统一(如特定画家风格)的系列化内容生产、IP 衍生创作等领域,GenEvolve 能够确保高度的一致性。
  • 模糊需求梳理与程序化生成: GenEvolve 能够将用户模糊的描述转化为一套清晰、可执行的生成程序,明确需要搜索什么、参考什么、以及施加何种约束,从而显著降低了用户进行 Prompt Engineering 的门槛。
阅读原文
© 版权声明

相关文章

AI聚合视觉工厂

暂无评论

暂无评论...