2026 年 8 月,腾讯微信视觉团队在 GitHub 开源了多模态嵌入模型家族 WeMM-Embedding(仓库 Tencent/WeMM-Embedding,Apache-2.0 协议,当前 1.1k star、80 fork)。这套模型提供 2B、4B、9B 三个尺寸,用一套模型把文本、图像、视频、视觉文档统一编码成向量,在 MMEB-v2 和 MMEB-v3 两个多模态检索基准上都拿到公开权重中的最高平均分。对做检索的团队来说,它意味着可以用同一个向量库同时支撑图文与视频搜索,而不再需要为每种模态分别维护一套 embedding 服务。

一套模型,四种输入

WeMM-Embedding 的输入覆盖文本、图像、视频、视觉文档,以及图文交错的多模态内容;音频输入目前不支持。所有输入的向量都取自模型最后一层隐藏状态在专用 token 位置的值,再做 L2 归一化。

仓库提供 Transformers 与 Sentence Transformers 两种推理入口,对图片、视频、文本分别取向量的调用方式一致:

python examples/transformers_inference.py \
  --model /path/to/WeMM-Embedding-2B \
  --image /path/to/image.jpg \
  --video /path/to/video.mp4 \
  --dimension 2048

三个尺寸,支持维度裁剪

模型 Zoo 共三档:WeMM-Embedding-2B / 4B / 9B,全部支持 Matryoshka 维度裁剪——2B 可从 2048 维截到 64 维,4B 最高 2560 维,9B 最高 4096 维。裁剪后的向量只需重新归一化即可继续使用,不需要重新训练。

裁剪的代价很小:在 MMEB-v2 上,2B 模型截到 256 维,仍保留全维图像与视频性能的 98.7%。存储与带宽受限的场景可以显著压缩向量规模,而不损失太多精度。

榜单成绩:MMEB-v2 与 MMEB-v3 双榜第一

MMEB-v2 覆盖 78 个数据集,图像与视频任务用 Hit@1、视觉文档用 NDCG@5 评估。WeMM-Embedding 三个尺寸的平均分分别为 77.9(2B)、79.2(4B)、80.6(9B),全部高于同尺寸的 Qwen3-VL-Embedding(2B 73.2)、GME(2B 55.4)与 VLM2Vec(2B 47.8);9B 的 80.6 也超过了未开源权重的 DME-Medium(9B 78.4)。

MMEB-v3 扩展到 190 个任务,纳入文本、智能体与跨模态检索任务。WeMM-Embedding 的 V3-All 平均分为 56.0(2B)、58.2(4B)、59.5(9B),其中 2B 已经超过 Qwen3-VL-Embedding 8B 的 53.5。

服务化部署

除单机推理外,仓库给出了 vLLM(0.27.0)与 SGLang(0.5.9)的服务化启动命令,两者均已官方支持,可以作为 embedding 服务接入现有检索链路,实测版本对应的 wrapper 脚本在 scripts/ 目录下。

结论

如果检索系统需要同时处理图文、视频或视觉文档,WeMM-Embedding 是目前公开权重里榜单成绩最高的可选方案之一:三个尺寸覆盖不同预算,Matryoshka 裁剪允许在容量与精度之间权衡,Apache-2.0 协议允许商用。小流量场景从 2B 起步、256 维向量即可覆盖多数需求;精度敏感场景再升级到 4B 或 9B。技术报告见 arXiv 2608.24053,评测代码与数据脚本随仓库一并发布。