xAI發佈新一代語音模型Grok Voice Think Fast 2.0,全面向開發者開放,在智能水平、轉錄精度、對話交互和工具調用效率上顯著提升。定價每分鐘0.08美元,在Artificial Analysis基準測試中綜合得分爲82.9%,超越前代及GPT-Realtime-2.1、Gemini 3.1 Flash。
OpenAI推出基於GPT-Live架構的全新ChatGPT語音體驗,告別傳統語音系統,專爲智能語音代理打造實時音頻模型。此前已公開的GPT-Realtime-2將GPT-5級推理引入實時交互,能更穩定地處理複雜請求,實現語音技術架構躍遷。
OpenAI推出三款實時語音模型:GPT-Realtime-2、GPT-Realtime-Translate和GPT-Realtime-Whisper,集成至Realtime API。GPT-Realtime-2是首個最智能的AI語音模型,旨在解決語音交互中的延遲高、無法自然打斷和多語言支持難等痛點。
OpenAI推出兩項API更新,提升AI智能體在語音交互與複雜任務中的性能。全新實時模型gpt-realtime-1.5及配套音頻模型,顯著提高語音命令可靠性。內部測試顯示,新模型在數字字母轉錄準確率上提升約10%,邏輯音頻任務準確率提高5%,指令執行準確率提升7%。