面壁智能另辟蹊径,专注端侧AI,将大模型压缩进手机、汽车等终端。28岁CTO曾国洋早年主导训练中国首个大语言模型CPM-1,如今致力推动轻量化智能落地移动设备。
轻量级端到端OCR模型HyOCR-1.5发布,在保持轻量化同时大幅提升性能与效率。作为首个全栈开源OCR模型,它全面开放权重、训练配方、数据构造方法及推理加速框架,显著降低开发门槛,让开发者可轻松复现、微调,并在消费级显卡或笔记本上部署。
xAI推出Voice Agent Builder测试版,通过零代码平台和自研Grok Voice模型,将企业级语音智能体搭建缩短至两分钟。其核心为高度集成的端到端架构,解决了传统方案语音转文字等多环节割裂的痛点,大幅降低了开发与运营门槛。
百度开源3B参数端到端OCR模型Unlimited OCR,专攻书籍论文等长文档。项目上线5天GitHub Star破万,登顶四项趋势榜。技术上,推理激活约570M参数,创新引入Reference Sliding Window Attention机制,突破逐页拼接限制,支持数十页一次性连续解析,大幅提升长文档处理效率。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$1
$10
256
Baidu
128
$6
$24
$2
$20
$8
$240
52
Bytedance
$1.2
$3.6
4
BAAI
Emu3.5是北京智源人工智能研究院开发的原生多模态模型,能够跨视觉和语言联合预测下一状态,实现连贯的世界建模和生成。通过端到端预训练和大规模强化学习后训练,在多模态任务中展现出卓越性能。
lightonai
LightOnOCR-1B-1025是一款紧凑的端到端视觉语言模型,专门用于光学字符识别和文档理解。它在同权重级别中实现了最先进的准确率,同时比大型通用视觉语言模型更快、成本更低。
stepfun-ai
Step-Audio 2 是一款端到端的多模态大语言模型,专为满足行业级音频理解和语音对话需求而设计。具备先进的语音和音频理解能力、智能语音对话功能、工具调用和多模态检索增强生成能力,在多个音频理解和对话基准测试中取得了领先的性能。
LiquidAI
LFM2-Audio-1.5B是Liquid AI推出的首个端到端音频基础模型,专为低延迟和实时对话设计。该模型仅15亿参数,能够实现无缝的对话交互,其能力可与参数规模大得多的模型相媲美。
Emova-ollm
EMOVA是一种端到端全能模态大语言模型,支持视觉、听觉和语音功能,能够生成具有情感控制的文本和语音响应。
EMOVA是一种端到端全能模态大语言模型,支持视觉、听觉和语音功能,具备情感语音对话能力。
EMOVA是一种端到端全能模态大语言模型,支持视觉、听觉和语音功能,无需依赖外部模型即可实现多模态理解和生成。
facebook
Meta公司开发的Kuwaa语(blh)文本转语音模型,属于大规模多语言语音计划的一部分,采用VITS端到端语音合成架构
Meta公司开发的哈里亚纳维语文本转语音模型,属于大规模多语言语音(MMS)项目的一部分,采用VITS端到端语音合成架构。
Meta公司开发的邦板牙语文本转语音模型,属于大规模多语言语音项目的一部分,采用VITS端到端语音合成架构。
Meta公司开发的荷兰语文本转语音模型,属于大规模多语言语音项目的一部分,采用VITS端到端语音合成架构。