WeMM-Embedding是什么
WeMM-Embedding 是腾讯微信视觉团队开源的通用多模态 Embedding 模型家族,提供 2B、4B、9B 三种参数规格,全部基于 Qwen3.5 多模态大模型构建。它能把文本、图像、视频、视觉文档以及任意交错的多模态输入,统一编码到同一个共享稠密向量空间,在权威多模态嵌入基准 MMEB-v2 排行榜中位列第一,并已在微信视频号、公众号及搜索等核心业务场景完成生产级部署。
WeMM-Embedding 官方 GitHub 仓库(Tencent/WeMM-Embedding)
传统图像-文本 Embedding 通常只为两种模态搭一座”固定的桥”,而现实中的检索需求早已复杂得多:查询可能是文字加图片,候选可能是视频、公众号文章甚至图文混排内容。WeMM-Embedding 的思路是让图像、视频和文字从一开始就在同一个模型同处理,在序列末尾嵌入专用的 <embedding> 标识符,取其末层隐藏状态并做 L2 归一化作为向量输出,同一输入中还允许插入多个标识符,一次前向计算即可同时得到多种粒度的表示。
WeMM-Embedding的主要功能
- 全模态统一表征:纯文本、视觉媒体与图文混排的复杂输入均可无缝转化为同一语义空间的向量,无需为不同模态单独开发编码器。
- 动态维度调节:借助 Matryoshka 表示学习,单次推理即可输出 64 到 4096 维的嵌套向量,其中 256 维即可保留约 99% 的性能,大幅优化存储与计算成本。
- 多领域广泛适配:覆盖信息检索、智能分类、视觉问答,以及 Agent 工具调用、图形界面理解、记忆检索等多元化任务。
- 领先基准表现:MMEB-v2 上 2B/4B/9B 总分分别达到 77.9、79.2、80.6,其中 2B 版本已超越此前领先的 8B 开源基准。
- 工业级部署兼容:适配 Transformers、Sentence Transformers、vLLM、SGLang 等主流框架,便于快速集成进生产流水线。
基准成绩背后更有说服力的是实战记录:在微信内部 26 项任务上,WeMM-Embedding-2B 的平均成绩达到 72.0,显著高于同规模对照基线的 60.9,覆盖分类、搜索、跨领域内容匹配、文章相关性与视频相关性五大类任务;官方表示模型已在相关业务中完成 14 项线上 A/B 测试并取得一致提升,每天线上调用量已达十亿量级。也就是说,这不是一篇”榜单模型”论文的附属品,而是先在微信搜索与推荐系统里跑通了、再反向开源的成熟组件。
WeMM-Embedding如何使用
- 获取代码与权重:克隆 GitHub 仓库 Tencent/WeMM-Embedding,并从 Hugging Face 的 tencent/wemm-embedding 集合页下载所需规模的模型权重。
- 安装依赖:进入仓库目录后用 pip 安装依赖,官方建议锁定 transformers 5.2.0 版本以保证环境一致。
- 调用模型:通过 Transformers 或 Sentence Transformers 示例脚本,传入文本、图像或视频路径,并指定目标维度即可生成 Embedding。
- 按需降维:利用 Matryoshka 特性,直接截取高维向量的前 d 维并重新做 L2 归一化,即可获得性能损失极小的低维表征,无需重新推理。
- 服务化部署:生产环境推荐用 vLLM 或 SGLang 框架封装为服务,满足高并发、低延迟的业务需求,具体启动参数以仓库文档为准。
Tencent/WeMM-Embedding 仓库页面,2B/4B/9B 权重均已开放下载
WeMM-Embedding的使用场景
由于文本、图像、视频共用一个向量空间,WeMM-Embedding 可以直接替换系统中”每个模态一套模型”的老架构,以下场景均是它的典型用武之地:
- 跨模态语义检索:实现文本、图像、视频之间的精准互搜,可用于版权保护与海量内容资产管理。
- 推荐与个性化:驱动视频号、公众号及电商内容的召回与排序特征构建,实现更精准的用户画像与内容匹配。
- 视觉文档解析:对图表、发票、PDF 等视觉文档做语义向量化,赋能企业级知识库与自动化办公流程。
- AI Agent 支持:为智能体提供 GUI 定位、工具查找与长短期记忆检索能力,提升复杂任务的执行成功率。
- 多模态内容审核:自动识别图像与视频中的敏感信息,提升内容安全监测的准确率与聚类效率。
在训练侧,团队采用两阶段策略:第一阶段用数亿组异构”来源-目标”配对数据完成大规模模态对齐,配合 InfoNCE 对比学习与 CoSENT 排序损失;第二阶段引入硬负样本挖掘、重排序器监督和跨尺度蒸馏(双向 KL 散度),让小参数模型有效继承大模型的知识,并通过 Semantic-ID 重采样与多模态大模型自动清洗来平衡语义分布、修正数据噪声。想了解文本嵌入方向的其他选择,可以对比 Gemini Embedding 文本嵌入模型;部署环境与模型托管可参考 魔搭ModelScope开源模型即服务平台。
WeMM-Embedding的常见问题解答
- WeMM-Embedding 支持哪些输入类型?
- 支持文本、图像、视频、视觉文档以及任意交错的多模态输入,所有类型都会被编码到同一个共享向量空间,输出经过 L2 归一化,可直接用于相似度计算、检索、分类与推荐。
- 向量维度应该如何选择?
- 借助 Matryoshka 表示学习,一次推理即可得到 64 到 4096 维的嵌套向量;对成本敏感的场景选 256 维即可保留约 99% 的性能,对精度要求极高的检索再使用更高维度,降维时只需截取向量前 d 维并重新归一化,无需重新推理。
- WeMM-Embedding 收费吗?可以商用吗?
- 模型已在 GitHub 与 Hugging Face 开源,权重可免费下载并私有化部署,具体许可条款以官方仓库说明为准,使用时只需自行承担推理算力成本。
WeMM-Embedding官网网址
GitHub 代码库:https://github.com/Tencent/WeMM-Embedding
HuggingFace 权重集合:https://huggingface.co/collections/tencent/wemm-embedding
学术论文地址:https://arxiv.org/pdf/2608.24053
OpenI AI时代点评
WeMM-Embedding 最打动人的不是榜首分数,而是它对工程现实的尊重:2B 版本就能追平 8B 基线,256 维向量即可保留 99% 的性能,再配上 vLLM/SGLang 的服务化支持,把检索与推荐系统最关心的存储、延迟和成本问题一次性纳入了设计。经过微信视频号、公众号、搜索等亿级流量场景和 14 项线上 A/B 测试的验证,它的落地含金量在开源 Embedding 模型中相当少见。这是一份可以直接拿来用的开源答卷,尤其是 2B 模型搭配 256/512 维短向量的组合,几乎就是为亿级索引的成本曲线量身定制。同类国产多模态模型还可关注 紫东太初 – 多模态大模型 与 清华开源模型ChatGLM-6B可本地 部署方案。


