字节跳动Seed发布原生音视频全双工大模型SeedRealtime,采用统一架构融合音频、视频与文本,实现“边看边听边说”的实时交互,推进全模态自然交互。同时,国产大模型如DeepSeek等集中迭代升级,市场分析认为国产算力逻辑持续加强。
字节Seed团队推出SeedRealtime大模型,以统一架构原生融合音频、视频和文本,实现“边看边听边说”的全双工实时交互。该能力已在豆包App全量上线,率先规模化落地。相比传统级联方案“听-转写-想-说”的逐段拼接,其端到端设计消除了感知与表达的割裂。