Hume AI开源TADA语音生成模型,采用文本-声学双对齐架构,显著提升TTS系统效率与可靠性。通过实现文本token与声学表示1:1严格同步,有效解决了传统LLM-based TTS中的内容幻觉问题。经超千个样本测试验证,模型表现优异。
瞳行科技推出国内首款AI助盲眼镜,集成阿里通义千问大模型,为视障人士提供实时出行辅助。产品由眼镜、手机、遥控指环和盲杖协同工作,通过双摄像头实现300毫秒低延迟路况播报,支持识别公交牌、路标及环境概述。技术总监陈刚表示,大模型压缩70%研发成本,加速算法落地。眼镜还具备本地文本识别功能。
Meta首席AI科学家杨立昆离职后首次公开表示,大公司重金投入大型语言模型是战略错误,无法实现真正智能。他指出LLM仅能统计补全文本,缺乏物理世界理解、长期推理和规划能力,注定无法达到人类智能水平。他认为下一代突破应依靠“世界模型”。
腾讯优图实验室开源Youtu-Embedding文本表示模型,提升企业智能客服和知识库管理效率。该模型通过精确信息提取,避免大模型在特定领域生成误导性答案,解决通用语料导致的不相关回复问题,有效应对跨领域表现不佳现象。
利用GPT-3模型将非结构化文本数据转换为结构化知识图谱表示
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
Baidu
128
$6
$24
$2
$20
Bytedance
$1.2
$3.6
4
nvidia
NVIDIA Nemotron Parse v1.1 是一款先进的文档解析模型,专门用于理解文档语义并提取具有空间定位的文本和表格元素。它能够将非结构化文档转换为机器可读的结构化表示,克服了传统OCR在处理复杂文档布局时的局限性。
Tarka-AIR
Tarka-Embedding-350M-V1是一个拥有3.5亿参数的文本嵌入模型,能够生成1024维的密集文本表示。该模型针对语义相似性、搜索和检索增强生成(RAG)等下游应用进行了优化,支持多种语言并具有长上下文处理能力。
Tarka-Embedding-150M-V1是一个具有1.5亿参数的嵌入模型,可生成768维的密集文本表示。它针对语义相似性、搜索和检索增强生成(RAG)等多种下游应用进行了优化,专注于捕捉深层上下文语义,以支持跨不同领域的通用文本理解。
ShantanuT01
基于BERT-tiny架构的轻量级AI生成文本检测模型,专门用于从RAID数据集中识别AI生成的文本内容。模型输出分数表示文本是人类生成的可能性。
MagicalAlchemist
BGE-M3是由BAAI开发的多功能文本嵌入模型,支持多语言、多粒度、多功能的文本表示学习,能够同时处理稠密检索、稀疏检索和多向量检索等多种检索模式。
mlx-community
EmbeddingGemma 300M 4bit是Google开发的轻量级文本嵌入模型,专门针对MLX框架优化。该模型能够将文本转换为高质量的向量表示,适用于各种自然语言处理任务,特别是句子相似度计算和特征提取。
csuhan
通过文本对齐表示实现视觉理解与生成的统一模型
GeoGPT-Research-Project
GeoEmbedding是一款专为地球科学领域设计的文本嵌入模型,基于高性能大语言模型构建,能够为地球科学文本生成准确且具有上下文感知能力的向量表示。
Leo1212
这是一个基于allenai/longformer-base-4096微调的sentence-transformers模型,用于生成句子和段落的768维密集向量表示,适用于语义文本相似度、语义搜索等任务。
Tevatron
基于Qwen2.5-Omni-7B构建的多模态嵌入模型,支持跨语言文本、图像、音频和视频的统一嵌入表示
yuriyvnv
BGE-m3是一款专为法律应用定制的特定领域文本嵌入模型,能够将法律文档、句子和查询转换为密集向量表示,精准捕捉法律语言中的细微语义关系。
DeepMostInnovations
专为印地语文本训练的自定义前沿句子嵌入模型,采用先进的Transformer架构与专用池化策略,可生成高质量的印地语句子语义表示。
zhibinlan
LLaVE-7B是基于LLaVA-OneVision-7B模型的70亿参数多模态嵌入模型,具备文本、图像、多图像和视频的嵌入表示能力。
LLaVE-2B是基于Aquila-VL-2B模型的20亿参数多模态嵌入模型,具有4K tokens的上下文窗口,支持文本、图像、多图像和视频的嵌入表示。
vidore
基于Qwen2.5-VL-3B-Instruct与ColBERT策略的视觉检索模型,能够生成文本和图像的多向量表示,用于高效文档检索。
KenLi315
Conan-embedding-v1 是由腾讯BAC团队开发的中文文本嵌入模型,专注于中文文本的语义表示和相似度计算。
tsystems
基于Qwen2-VL-2B-Instruct与ColBERT策略的视觉检索模型,能够生成多向量文本与图像表示
yydxlv
基于Qwen2-VL-7B-Instruct与ColBERT策略的视觉检索模型,支持多向量文本与图像表示
ntphuc149
ViLegalBERT是一个专门针对越南法律文本优化的预训练语言模型,通过在大量越南法律语料库上对PhoBERT-base-v2进行持续预训练而开发。该模型具备1.35亿参数,专注于越南法律术语和概念的理解,为法律领域的各种NLP任务提供高质量的上下文表示。
mertcobanov
这是一个基于microsoft/mpnet-base微调的sentence-transformers模型,用于句子和段落的向量表示,支持语义文本相似度等任务。