科大訊飛發佈語音基座大模型Spark-Audio-1.0-Preview,基於全國產算力訓練,降低供應鏈風險。模型支持文本和語音輸入、文本輸出,具備語音轉寫、多語言翻譯、多方言識別、環境音識別、說話人識別、情感分析及音頻問答等能力。
科大訊飛上線語音基座大模型Spark-Audio-1.0-Preview,基於全國產化算力訓練。傳統音頻處理多采用級聯方案,先轉文字再理解,存在信息丟失(忽略語氣、情緒、背景環境音)和鏈路割裂(語音轉寫、聲紋識別等環節分離)兩大短板,影響場景判斷完整性。