アシックス・スパーク音声ベース大モデルがリリース:0.65Bエンコーダーと30B MoEの完全国内産業向け計算能力で訓練
科大訊飛は音声ベース大モデルのSpark-Audio-1.0-Previewをリリースしました。これは全国産業向けの計算能力によってトレーニングされています。従来の音声処理では、通常、音声をテキストに変換してから理解するという段階的なアプローチが用いられ、情報の損失(感情や背景音など)や処理フローの分断(音声認識や声紋識別などの手順が分離している)という2つの欠点がありました。これらはシナリオ判断の完全性に影響を与えています。