字節跳動Seed發佈原生音視頻全雙工大模型SeedRealtime,採用統一架構融合音頻、視頻與文本,實現“邊看邊聽邊說”的實時交互,推進全模態自然交互。同時,國產大模型如DeepSeek等集中迭代升級,市場分析認爲國產算力邏輯持續加強。
字節Seed團隊推出SeedRealtime大模型,以統一架構原生融合音頻、視頻和文本,實現“邊看邊聽邊說”的全雙工實時交互。該能力已在豆包App全量上線,率先規模化落地。相比傳統級聯方案“聽-轉寫-想-說”的逐段拼接,其端到端設計消除了感知與表達的割裂。