OpenAIがGPT-5.6や高度音声機能を統合し、ChatGPTデスクトップアプリを“スーパーアプリ”に刷新。だがチャット履歴が探しにくく、タブが煩雑とユーザーから不満。グレッグ・ブロックマン社長は体験が「やや混乱」と認め、継続改善中でマルチタブは過渡的対策と説明。長期的視点で開発中。....
SunoがWebとモバイルを大幅更新。高度なステム分離でボーカル/ドラム/ベース等を分離でき、編集が容易に。プロ向け音声処理と車載対応も追加し、AI音楽制作の利便性が向上。....
xAIは、ノーコードプラットフォームと自社開発のGrok Voiceモデルを活用して、企業向け音声AIエージェントの構築を2分で可能にするVoice Agent Builderのベータ版をリリースしました。その核心は高度に統合されたエンドツーエンドアーキテクチャであり、従来の音声認識などの複数のステップが分断される問題を解決し、開発および運用のハードルを大幅に下げました。
グーグルが新世代のGoogle Homeスマートスピーカーを発表。自社開発のGemini大規模言語モデルを初めて深く統合し、高度な意味理解と対話でスマートホーム体験を革新。AI技術を本格的に音声デバイスへ展開する節目に。....
Claude Codeの高度な音声听写機能。入力速度は通常の4倍で、高速に文字起こしができます。14日間の無料トライアルを提供します。
画像から最もリアルなAIアバターを作成し、高度な音声クローニングと唇同期技術を備えています。
Sora 2は高度なAIビデオ生成プラットフォームで、テキストまたは画像に基づいて音声付きの高品質なビデオを生成することができます。
GeminiGen AIは、AIによる画像、ビデオ、音声を提供する、高度なAIコンテンツ生成プラットフォームです。
Google
$0.49
入力トークン/百万
$2.1
出力トークン/百万
1k
コンテキスト長
$17.5
Alibaba
$8
$240
52
-
$3.9
$15.2
64
$15.8
$12.7
Bytedance
$0.8
$2
128
Baidu
$2.4
$12
8
Tencent
32
$3
$9
$1.6
$10
labhamlet
WavJEPAは波形ベースの結合埋め込み予測アーキテクチャに基づく音声基礎モデルで、高度な意味表現学習を利用して音声単位またはタグレベルの表現学習の不足を解決します。多くの下流のベンチマークタスクで、最先端の時間領域音声基礎モデルを大幅に上回り、同時に必要な計算リソースを大幅に削減します。
BUT-FIT
SE-DiCoWは、BUT Speech@FITがJHU CLSP/HLTCOEおよびCMU LTIと共同開発した、ターゲット話者の多話者自動音声認識モデルです。このモデルはWhisper large-v3-turboをベースに、自己登録メカニズムと改良されたデータ拡張技術により、高度に重畳した多話者シナリオでの認識精度を大幅に向上させています。
stepfun-ai
Step-Audio 2は、業界レベルの音声理解と音声対話のニーズを満たすために設計されたエンドツーエンドのマルチモーダル大規模言語モデルです。高度な音声と音声理解能力、スマート音声対話機能、ツール呼び出しおよびマルチモーダル検索強化生成能力を備え、複数の音声理解と対話のベンチマークテストでトップクラスの性能を発揮しています。
Marvis-AI
Marvisは、リアルタイムストリーミングテキストを音声合成するために設計された高度な対話式音声モデルです。効率性と使いやすさを重視し、Appleチップ、iPhone、iPad、Macなどの消費者向けデバイスでの高品質なリアルタイム音声合成をサポートします。
MohamedRashad
Voxtral MiniはMinistral 3Bをベースにした拡張版で、高度な音声入力機能を備え、音声文字起こし、翻訳、音声理解などの分野で優れた性能を発揮します。
unsloth
Orpheus TTSは、Llamaをベースとした高度な音声大規模言語モデル(Speech - LLM)で、高品質で感情豊かな音声生成を目的として設計されています。
re-skill
Orpheus TTSは、Llamaをベースとした高度な音声大規模言語モデルで、高品質で感情豊かなテキスト読み上げ機能を実現するために設計されています。
MediaTek-Research
Breeze ASR 25は、Whisper-large-v2を微調整した高度な自動音声認識モデルで、台湾普通話と普通話 - 英語のコード切り替えシナリオの認識能力を特別に最適化しています。
RobAgrees
Diaは16億パラメータのオープンソーステキスト音声変換モデルで、高度にリアルな対話や非言語表現の生成をサポート
thepushkarp
DiaはNari Labsが開発した16億パラメータのテキスト音声合成モデルで、テキストから高度にリアルな対話を直接生成でき、感情やイントネーションの調整および非言語表現の生成をサポートします。
nari-labs
DiaはNari Labsが開発した16億パラメータのテキスト音声合成モデルで、テキストから高度にリアルな対話を直接生成でき、感情やイントネーションの制御をサポートし、非言語コミュニケーション内容も生成可能です。
KandirResearch
CiSiMiはリソース制約環境向けに設計された初期のテキスト音声変換モデルプロトタイプで、CPU上で効率的に動作し、高度な音声合成を実現します。
nyrahealth
CrisperWhisperはOpenAI Whisperの高度なバリアントで、迅速かつ正確な逐語的な音声認識のために設計されており、正確(明確)な単語レベルのタイムスタンプを提供します。
wasmdashai
VITSアーキテクチャに基づく高度なアラビア語テキスト音声変換システムで、自然でリアルな音声を生成し、口語的なテキストを理解できます
m-a-p
MERT-v1-330MはMLMパラダイムに基づいて訓練された高度な音楽理解モデルで、330Mのパラメータ規模を持ち、24K Hzの音声サンプリングレートをサポートし、様々な音楽情報検索タスクに適しています。
rishabhjain16
OpenAIが開発したWhisper Large v2は、高度な自動音声認識モデルです。大規模な多言語および多タスクデータを基に訓練され、音声を正確にテキストに変換することができます。このモデルは、複数の評価データセットで優れた性能を発揮し、複数の言語の音声認識タスクをサポートしています。
MiniMax - MCPは、音声合成、ビデオ生成、画像生成などのAPIサービスを提供する多機能サーバープロジェクトで、開発者が高度なマルチメディア機能を統合できるようにサポートします。
MCPサーバーWhisperはOpenAI WhisperとGPT - 4oモデルに基づく音声処理サーバーで、高度な音声文字起こし、形式変換、バッチ処理、テキスト読み上げなどの機能を提供し、Model Context Protocol標準を通じてAIアシスタントとのシームレスなインタラクションを実現します。
完全なGroq MCPサーバープロジェクトで、アプリとGroq APIを接続するインテリジェントな橋渡し役として機能し、さまざまなAIモデル(テキスト、音声、ビジュアル、バッチ処理)をサポートし、インテリジェントなルーティング、レート制限、キャッシュ最適化などの高度な機能を備えています。