微信AI開源多模態嵌入模型WeMM-Embedding,提供2B、4B、9B三個版本。該模型支持文本、圖像、視頻、視覺文檔及任意交錯的多模態混合輸入,具備強兼容能力。其核心採用多模態同構技術,可同時深度理解文字與多種視覺信息,提升跨模態檢索與理解效果。
微信AI於9月4日開源多模態嵌入模型WeMM-Embedding,含2B、4B、9B三個版本,支持文本、圖像、視頻、視覺文檔等交錯輸入,可在統一語義空間比較檢索,已在朋友圈搜索、視頻號推薦等場景落地。
騰訊微信視覺團隊開源多模態嵌入模型WeMM-Embedding,支持文本、圖像等多模態輸入,提供2B、4B、9B三個版本以適應不同部署需求,採用統一技術架構與訓練策略,旨在爲AI開發者提供支撐,推動垂直領域創新應用。