MiniMax推出音乐生成模型MiniMax-Music3,输入歌词与音乐描述即可生成最长5分钟完整歌曲,输出32kHz、16-bit立体声WAV。其采用分层自回归架构,两模型分工:全局语言模型Global LLM参数8B,逐帧预测首个RVQ码本,负责歌曲长程语义与结构变化;该模型由Qwen3-8B初始化,训练时先让嵌入层和输出层适配音乐。
Anthropic签署欧盟AI法案实践准则,承诺自2026年8月起,所有新发布的Claude模型将在全球范围嵌入内容标识,覆盖API、Claude、Claude Code等全线产品。现有模型设过渡期并推进回溯适配。文本输出采用隐式水印,不影响可读性与内容含义。
Neon与Castform公司联手,用强化学习训练4B开源小模型,在文档搜索上准确率媲美甚至超越GPT-5.6Sol,推理成本仅其百分之一。背后是搜索范式革新:从嵌入式向量匹配转向智能体式搜索,让模型自主执行检索流程。
马斯克旗下xAI于7月21日推出免费插件Grok For Excel,已登陆微软应用商店,兼容Word与PowerPoint。该插件将Grok大模型深度嵌入Office,用户只需在Excel中框选数据区域,即可直接调用Grok进行分析,如同内置的数据分析员,贴近真实办公场景。
先进的多模态嵌入和重排名模型,支持文本、图像和视频。
Gemini Embedding 是一种先进的文本嵌入模型,通过 Gemini API 提供强大的语言理解能力。
多语言嵌入模型,用于视觉文档检索。
最新推出的多语言通用嵌入模型,在多个领域表现卓越。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
Baidu
128
$6
$24
$2
$20
TomoroAI
TomoroAI/tomoro-colqwen3-embed-4b是一款先进的ColPali风格多模态嵌入模型,能够将文本查询、视觉文档(如图像、PDF)或短视频映射为对齐的多向量嵌入。该模型结合了Qwen3-VL-4B-Instruct和Qwen3-Embedding-4B的优势,在ViDoRe基准测试中表现出色,同时显著减少了嵌入占用空间。
nightmedia
这是一个实验性的量化大语言模型,采用Deckard(qx)量化方法,嵌入层为3位量化。该模型通过范数保持双投影消除(NPBA)技术重构,不仅移除了安全限制机制,还增强了模型的认知深度和推理能力。
magiccodingman
这是一个实验性的混合量化模型,采用MXFP4_MOE混合权重技术,在保持接近Q8精度的同时,实现了更小的文件大小和更高的推理速度。模型探索了MXFP4与高精度嵌入/输出权重的组合,在密集模型上取得了精度近乎无损的优化效果。
这是一个基于Qwen3 4B模型的混合量化版本,采用MXFP4_MOE混合权重技术,在保持近乎无损精度的同时实现了更小的文件大小和更高的推理速度。该模型通过精心组合MXFP4和高精度嵌入/输出权重,达到了接近Q8量化的精度水平,同时具备Q4-Q6级别的吞吐量。
Synthyra
Profluent - E1 是对 Profluent Bio 公司 E1 模型的忠实实现,由 Synthyra 发布。它是一个专注于蛋白质序列处理的预训练语言模型,集成了 Hugging Face AutoModel 兼容性,并提供高效的嵌入功能,旨在简化生物信息学任务中的蛋白质序列分析和表示学习。
Profluent-E1 是对 Profluent 官方 E1 模型的忠实实现,集成了 Hugging Face AutoModel 兼容性,专注于蛋白质序列的表示学习。它能够生成高质量的蛋白质序列嵌入,支持掩码语言建模、序列分类和标记分类等任务,并提供了便捷的嵌入提取和微调功能。
sd2-community
Stable Diffusion v2-1-unclip是基于Stable Diffusion 2.1微调的扩散模型,能够接受文本提示和CLIP图像嵌入,用于创建图像变体或与文本到图像的CLIP先验结合使用。
Tarka-AIR
Tarka-Embedding-350M-V1是一个拥有3.5亿参数的文本嵌入模型,能够生成1024维的密集文本表示。该模型针对语义相似性、搜索和检索增强生成(RAG)等下游应用进行了优化,支持多种语言并具有长上下文处理能力。
ekacare
Parrotlet-e是一款先进的多语言医学嵌入模型,专门针对印度各语言中的医学术语进行优化。它基于BAAI/bge-m3进行微调,在超过1800万对多语言医学术语对上进行训练,支持12种印度语言和英语,对临床文档中的缩写、拼写变体和口语表达具有很强的鲁棒性。
AbstractPhil
MM-VAE Lyra是一个专门用于文本嵌入转换的多模态变分自编码器,采用几何融合技术。它结合了CLIP-L和T5-base模型,能够有效处理文本嵌入的编码和解码任务,为多模态数据处理提供创新解决方案。
samwell
NV-Reason-CXR-3B GGUF是NVIDIA NV-Reason-CXR-3B视觉语言模型的量化版本,专为边缘设备部署优化。这是一个30亿参数的模型,专注于胸部X光分析,已转换为GGUF格式并进行量化处理,可在移动设备、桌面设备和嵌入式系统上高效运行。
labhamlet
WavJEPA是基于波形的联合嵌入预测架构的音频基础模型,利用高级语义表示学习解决语音单元或标记级表示学习的不足。在众多下游基准任务中显著优于最先进的时域音频基础模型,同时所需计算资源大幅减少。
Tarka-Embedding-150M-V1是一个具有1.5亿参数的嵌入模型,可生成768维的密集文本表示。它针对语义相似性、搜索和检索增强生成(RAG)等多种下游应用进行了优化,专注于捕捉深层上下文语义,以支持跨不同领域的通用文本理解。
hetbhagatji09
这是一个基于MiniLM架构的轻量级句子嵌入模型,专门用于生成高质量的句子向量表示。模型采用MultipleNegativesRankingLoss进行训练,在句子相似度计算和特征提取任务上表现出色。
s3dev-ai
这是Google embeddinggemma-300m基础模型的各种GGUF格式量化版本,专门为高效部署和不同场景使用而优化。该模型专注于句子嵌入和相似度计算任务。
nvidia
Llama Nemotron Embedding 1B模型是NVIDIA开发的专为多语言和跨语言文本问答检索优化的嵌入模型,支持26种语言,能够处理长达8192个标记的文档,并可通过动态嵌入大小大幅减少数据存储占用。
redis
这是一个由Redis发布的、针对语义缓存任务优化的双编码器句子嵌入模型。它基于sentence-transformers/all-MiniLM-L6-v2微调,可将文本映射到384维向量空间,专门用于提升LangCache语义缓存系统的查询匹配精度。
KaLM-Embedding
KaLM-Embedding-V2.5是一款通用且轻量级的嵌入模型,通过卓越的训练技术和数据,在同类规模模型中达到最优性能,甚至能与规模大3-26倍的模型相媲美。支持多语言和多种嵌入维度选择。
pierre-tassel
Rapido NER 是一个强大的多语言命名实体识别器和实体嵌入模型,以猫 Rapido 命名。该模型提供强大的多语言 NER 性能,支持实体聚类和检索,处理文档内聚类以及长上下文等任务。
Rapido NER是一个强大的多语言命名实体识别和实体嵌入模型,支持55种语言,集成了编码器、基于注意力的提及池化、类型投影层和条件随机场解码,专门用于解决命名实体识别领域的常见问题。
Claude Context是一个MCP插件,通过语义代码搜索为AI编程助手提供整个代码库的深度上下文,支持多种嵌入模型和向量数据库,实现高效代码检索。
一个MCP服务器,通过向量嵌入和语义相似性为任何AI模型提供智能搜索Claude Agent Skills的能力,实现渐进式技能发现和跨平台技能共享
该项目是一个基于Model Context Protocol (MCP)标准的文档处理服务器,通过构建向量数据库和MCP接口,使AI助手能够访问外部文档资源,突破大语言模型的知识限制。项目包含文档处理流水线和MCP服务端两大组件,支持多种嵌入模型和文件格式,可应用于最新技术文档查询、私有代码库理解等场景。
一个基于MCP协议的语义代码搜索服务器,支持OpenAI和Ollama两种嵌入模型,能够索引本地项目或Git仓库,提供企业级的私有化代码搜索解决方案。
一个MCP服务器项目,提供基于token数量自动选择OpenAI O3或Google Gemini 2.5 Pro模型的服务,支持文件路径递归嵌入提示词,适用于代码审查和复杂问题解决。
MCPHub是一个可嵌入的模型上下文协议(MCP)解决方案,用于AI服务集成。它提供统一的配置和管理方式,支持多种AI框架(如OpenAI Agents、LangChain、Autogen),简化MCP服务器与AI应用的连接。
基于PostgreSQL和Voyage嵌入模型的代码语义搜索MCP服务器,提供代码片段搜索、文件列表和内容检索功能
一个用于苹果笔记语义搜索的MCP服务,支持本地嵌入模型、全文搜索和向量存储。
一个基于FAISS的本地向量数据库MCP服务器,提供文档嵌入、语义搜索和RAG功能,支持多种文档格式和自定义嵌入模型。
基于语义理解的代码搜索MCP服务器,使用本地嵌入模型和向量数据库实现智能代码检索,替代传统文本搜索工具
Insights Knowledge Base (IKB) MCP Server 是一个即插即用的免费知识库,内置10,000+高质量洞察报告,支持本地安全存储和私有文档解析。项目优化了数据处理效率,提供每周报告更新,并计划未来集成嵌入模型和增强报告系统。
MCP聊天分析服务器是一个基于模型上下文协议(MCP)的服务,提供聊天对话的语义分析功能,包括向量嵌入搜索、知识图谱构建和会话模式分析。
Storm MCP服务器是一个开放协议,实现LLM应用与RAG数据源及工具的无缝集成,支持自定义嵌入模型和向量数据库连接,提供上下文共享、工具系统、文件管理等功能。
这是一个基于Rust实现的MCP内存服务,提供记忆存储与检索功能,支持多种存储后端和嵌入模型,通过JSON-RPC协议与客户端通信。
一个为OpenAI API实现的MCP服务器,提供标准化接口连接Augment与OpenAI语言模型,支持聊天补全、模型列表和嵌入生成等功能。
使用开源嵌入模型、向量数据库和Gemini大语言模型构建的RAG系统,支持本地文档处理与动态更新索引。
一个基于Qdrant向量数据库的机器控制协议(MCP)服务器,支持文本存储、语义搜索及FastEmbed嵌入模型集成。
esp-mcp-server是一个轻量级、可嵌入的HTTP服务器,为Espressif的AI辅助开发工具实现模型上下文协议(MCP)。
Brain Server是一个基于MCP协议的知识嵌入与向量搜索服务,提供高质量文本向量化、语义搜索和知识管理功能,支持多种嵌入模型和Docker部署。
一个基于Node.js的向量搜索项目,使用LanceDB数据库和Ollama嵌入模型实现文档相似性搜索功能