CoinVE-200K – 腾讯开源的大规模组合指令视频编辑数据集
在AI视频创作领域,腾讯视频智创团队近期带来了一项突破性进展——开源了名为 CoinVE-200K 的大规模组合指令视频编辑数据集。这一成果不仅在数据规模上达到了业界领先水平,更通过配套的 22B 参数模型 CoinVE-Edit 与系统化评测基准 CoinVE-Bench,成功填补了行业内关于组合式视频编辑在数据资源、算法模型及评价体系方面的多重空白。
CoinVE-200K 的核心亮点在于其极高的内容密度与品质。该数据集涵盖了 20 万组 1080p 高清视频编辑样本对,每一组样本均包含 2 至 5 条原子级编辑指令,支持添加、移除、修改以及风格化等多种复杂操作。其编辑对象覆盖了人物、物体乃至背景等全维度场景,视频时长最长可达 201 帧,为模型处理多意图联合任务提供了坚实支撑。
在技术实现层面,CoinVE-200K 采用了一套严谨且高效的生产流程。首先,通过 Qwen3.6-27B 模型对视频内容进行深度解析,精准定位可编辑区域;随后利用 SAM 系列掩码生成技术与多模态扩散模型合成关键帧,并经由 Gemini 进行严格的二次质量审核,确保每一条样本都在指令遵循度、视觉美感及帧间一致性上达到高标准。模型架构上,CoinVE-Edit 引入了多模态理解模块与区域解耦注意力机制,通过 Feature Connector 与 Q-Blending 技术,实现了多条指令在特定时空区域内的精准解耦与同步执行,有效规避了指令间的相互干扰。
为了全面衡量编辑效果,CoinVE-Bench 评测体系应运而生。它采取了“多模态大模型核对表”与“专用算法评估器”驱动的模式,从指令精确度、物理规律自然度、语义保持度以及技术质量等 4 大维度、11 项细分指标出发,对模型性能进行全方位“体检”。其表现优异,在多项关键指标上已超越了现有的主流闭源方案。
对于开发者而言,使用 CoinVE-200K 的流程清晰便捷。用户仅需通过 ModelScope CLI 工具下载数据集,即可获取包含原始视频、编辑后视频及各类时空掩码的元数据文件。无论是进行深度学习模型的训练微调,还是在 CoinVE-Bench 上复现基准测试,该开源项目都提供了开箱即用的支持。此外,该项目在影视后期、广告物料制作以及短视频创作等实际应用场景中展现出了巨大的潜能,能够帮助创作者通过自然语言指令,轻松完成以往需要专业软件才能实现的复杂视觉编辑任务。
目前,CoinVE-200K 已在 GitHub、HuggingFace 等平台全面开源,相关技术论文也已发布,为视频编辑领域的学术研究与工程实践提供了重要的参考范式。感兴趣的开发者可以前往项目官网获取更多详细信息,或通过社交渠道加入交流群,共同探讨视频生成与编辑技术的未来。


