字节跳动Seedがネイティブ音声・映像全二重モデルSeedRealtimeを発表。統一アーキテクチャで音声・映像・テキストを融合し、「見ながら聞きながら話す」リアルタイムインタラクションを実現、全モダリティ自然対話を推進。同時にDeepSeekなどの国産大規模モデルが集中的にアップグレードされ、市場分析では国産計算力の論理が強化されつつあると指摘。....
バイトダンスSeedチームが、音声・動画・テキストを単一モデルで統合したSeedRealtimeを発表。見ながら聞き話す全二重リアルタイム対話を実現し、豆包アプリに全面導入。従来のカスケード方式と異なり、エンドツーエンド設計で認識と表現の分断を解消。....