AIBase
首页
AI 资讯
AI 产品库
GEO 平台
MCP 服务
模型算力广场
ZH

AI资讯

查看更多

Stream-Omni:同时支持各种模态组合交互,开启文本、视觉、语音结合

中科院计算所推出Stream-Omni多模态大模型,支持文本、视觉、语音三种模态交互。创新采用针对性模态对齐技术,减少对大规模三模态数据的依赖,实现语音与文本的实时转换。模型支持任意模态组合,在视觉理解和语音交互方面表现优异,虽在拟人化方面有待改进,但为多模态智能交互提供了新思路。相关论文和代码已开源。

10.5k 1 天前
Stream-Omni:同时支持各种模态组合交互,开启文本、视觉、语音结合
AIBase
智启未来,您的人工智能解决方案智库
English简体中文繁體中文にほんご
友情链接:
AI Newsletters AI ToolsMCP ServersAI NewsAI MarketingLLM LeaderboardAI Ranking
© 2026AIBase
商务合作网站地图