据外媒消息,微软计划今年8月在Teams中推出AI会议助手Facilitator,它能实时解析对话,自动发现未解答的疑问和表述模糊之处,并在聊天窗口补充相关信息,以完善沟通。该工具默认关闭,需用户手动开启,不会主动发言。
OpenAI在ChatGPT中测试新型语音模型Bidi 1,用户已在网页及App端发现。它打破传统线性问答模式,支持实时打断与插话,实现更自然流畅的双向对话,预示语音交互的“降维打击”式进化,公司正筹备更大规模测试。
NBA中国推出首个官方大模型应用“NBA Chat”,基于阿里巴巴千问大模型技术,为球迷提供全天候篮球知识问答与互动服务。用户通过“NBA 中国”APP即可实时对话,查询历史数据、解析比赛等,标志着职业篮球赛事在数字化互动体验上的关键进展。
腾讯会议正式上线AI同传功能,首次向所有用户开放中英文实时翻译,旨在提升跨国会议及远程协作的沟通效率。该功能将翻译时延控制在3秒以内,实现发言与翻译几乎同步,有效解决传统同传中的延迟和断档问题,帮助参会者更顺畅对话,避免信息遗漏和误解。
Getsolved是一款集文本流畅度提升、原创性审查与实时数据AI对话于一体的智能工作空间。
talat是私人会议笔记应用,实时转录对话,数据存本地。
实时字幕和语音输入,适用于桌面端各类对话,支持翻译和多语言。
Kael是支持文件上传和实时流式响应的AI对话助手,助力研究工作。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
Baidu
128
$6
$24
256
$8
$240
52
Bytedance
$1.2
$3.6
4
nari-labs
Dia2是由Nari Labs开发的流式对话文本转语音(TTS)模型,支持实时语音生成,无需完整文本即可开始生成音频,能够根据对话上下文进行调整,实现自然流畅的对话体验。
Dia2是由Nari Labs开发的流式对话文本转语音(TTS)模型,支持实时语音生成,无需完整文本即可开始生成音频,专为自然对话场景设计。
nineninesix
KaniTTS是一款专为实时对话式AI应用优化的高速、高保真文本转语音模型,采用两阶段管道结合大型语言模型和高效音频编解码器,实现卓越的速度和音频质量。该模型支持西班牙语,具有4亿参数,采样率为22kHz。
KaniTTS是一款专为实时对话式人工智能应用优化的高速、高保真阿拉伯语文本转语音模型。它采用两阶段流水线架构,结合大语言模型与高效音频编解码器,实现卓越的速度和音频质量,能够满足对话式AI、无障碍辅助、研究等多领域的语音合成需求。
KaniTTS是一款专为实时对话式AI应用优化的高速、高保真文本转语音模型,通过独特的两阶段架构结合大语言模型与高效音频编解码器,实现低延迟与高质量语音合成,实时因子低至0.2,比实时速度快5倍。
KaniTTS Pretrain v0.3是一款高速、高保真的文本转语音模型,专为实时对话式人工智能应用优化,采用两阶段管道架构,结合大语言模型和高效音频编解码器,实现极低延迟和高品质语音合成。
KaniTTS是一款专为实时对话式AI应用优化的高速、高保真文本转语音模型。它采用两阶段流水线架构,结合大语言模型和高效音频编解码器,实现了卓越的速度和音频质量,支持多种语言并适用于边缘/服务器部署。
KaniTTS是一款高速、高保真的文本转语音模型,专为实时对话式人工智能应用而优化。该模型采用两阶段处理流程,结合大语言模型和高效音频编解码器,在Nvidia RTX 5080上生成15秒音频的延迟仅需约1秒,MOS自然度评分达4.3/5,支持英语、中文、日语等多种语言。
LiquidAI
LFM2-Audio-1.5B是Liquid AI推出的首个端到端音频基础模型,专为低延迟和实时对话设计。该模型仅15亿参数,能够实现无缝的对话交互,其能力可与参数规模大得多的模型相媲美。
Marvis-AI
Marvis 是一款先进的对话式语音模型,专为实现实时流式文本转语音合成而设计。它以高效和易用性为核心,支持在苹果芯片、iPhone、iPad、Mac 等消费设备上运行的高质量实时语音合成。
DeepMostInnovations
基于强化学习的模型,通过Azure OpenAI嵌入技术实时预测客户对话中的销售转化概率。
drwlf
Medra是一款专为临床推理、教育和对话建模设计的轻量级医学语言模型,基于Gemma 3构建,适合本地部署和实时运行。
一个实现Claude Code实例间实时通信的MCP服务器,通过TCP中心枢纽协调不同实例间的问答对话。
Speech MCP是为Goose设计的语音交互扩展,提供实时语音识别、高质量文本转语音、多语言支持和现代化音频可视化界面,支持多角色对话生成和音频转录功能。
该项目包含两个基于模型上下文协议(MCP)的服务器:物联网设备控制服务器和内存管理服务器。物联网服务器提供设备控制、状态查询和实时更新功能,适用于智能家居和工业物联网等场景;内存管理服务器提供长期记忆存储和语义搜索功能,适用于对话历史和知识管理等领域。
一个支持与Claude等LLM进行语音交互的MCP服务器,只需OpenAI API密钥和麦克风/扬声器即可实现实时语音对话。
MCP是一个基于客户端-服务器架构的AI聊天系统,支持通过多种专用服务器(文件系统、Slack、Brave搜索)扩展Claude AI的功能,使其能智能访问本地文件、Slack对话和实时网络信息。
一个轻量级的桥梁服务,使Claude AI能够实时搜索网络。该项目基于Flask服务器,集成了Claude的高级能力和DuckDuckGo搜索,允许AI在对话中获取实时信息。
基于Asterisk的语音对话电话自动呼叫MCP服务器,支持实时语音转语音功能,提供完整的电话自动化解决方案。
TestingBot官方MCP服务器,使AI助手能够通过对话界面管理TestingBot的测试基础设施,包括实时测试、浏览器设备管理、测试管理、存储管理、截图测试、构建管理、用户团队管理、CDP会话和隧道管理等功能。
一个现代化的MCP服务器实现,支持多AI提供商、实时响应、对话管理和监控功能,采用微服务架构。
MCP是一个智能对话平台服务器,提供基于角色的AI顾问服务,支持多LLM供应商、语义记忆管理和实时流式响应,适用于商业咨询和技术支持等场景。
该项目是一个连接大型语言模型与Frontapp客户沟通平台的MCP服务器,提供对话管理、联系人管理、标签管理等功能,支持实时更新和自动化工作流。
MCP Telemetry是一个基于Model Context Protocol的服务器,用于在聊天系统中通过Weights & Biases Weave实现对话追踪和数据分析。它提供会话跟踪、LLM交互记录、工具调用监控等功能,并支持实时可视化和分析。
一个基于iRacing遥测数据的MCP服务器,提供实时赛车建议、车辆识别、遥测分析和赛车数据对话交互功能