微信AI开源多模态嵌入模型WeMM-Embedding,提供2B、4B、9B三个版本。该模型支持文本、图像、视频、视觉文档及任意交错的多模态混合输入,具备强兼容能力。其核心采用多模态同构技术,可同时深度理解文字与多种视觉信息,提升跨模态检索与理解效果。
微信AI于9月4日开源多模态嵌入模型WeMM-Embedding,含2B、4B、9B三个版本,支持文本、图像、视频、视觉文档等交错输入,可在统一语义空间比较检索,已在朋友圈搜索、视频号推荐等场景落地。
腾讯微信视觉团队开源多模态嵌入模型WeMM-Embedding,支持文本、图像等多模态输入,提供2B、4B、9B三个版本以适应不同部署需求,采用统一技术架构与训练策略,旨在为AI开发者提供支撑,推动垂直领域创新应用。