東京のスタートアップ企業InfiniMindは580万ドルのシード資金調達を成功させた。元グーグル社員が設立した同社は、膨大な未利用のビデオや音声などの「暗データ」を検索可能な構造化ビジネスインテリジェンスに変換するAIインフラを開発し、企業のデータ処理の課題に対応している。
フランスのMistral AIがVoxtral Transcribe2音声認識モデルシリーズを発表。リアルタイム転写モデルは40億パラメータで、低遅延・低コストを実現。....
新たなオープンソース医療大規模モデル「MedGemma 1.5」と臨床音声認識モデル「MedASR」を発表。MedGemma 1.5はGemmaシリーズを基盤に、医療画像理解を強化し、テキスト診療記録・検査報告・医学文献・X線・CTなどの画像データを処理し、初期スクリーニングと診断を支援します。....
米国ユタ州の警察でAI通話記録システムをテスト中、アルゴリズムの誤認識により「警察官がカエルに変身」という荒唐無稽な報告書が生成された。音声文字変換による事務負担軽減を目指したシステムだが、法執行現場でのAI技術の限界が露呈した事例となった。....
AI唇同期動画生成ツールで、長い音声をリアルな口パク同期動画に変換できます。
Mac用のプライベートな音声をテキストに変換するアプリで、80msの低遅延、3つのエンジンから選択可能、ローカルで処理
Seedance 2.0はテキストや画像などを迅速に2Kの同期音声付きビデオに変換できます。
バイトドゥンのSeedance 2.0は、テキスト、画像、音声を映画レベルのAIビデオに変換します。
Google
$0.49
入力トークン/百万
$2.1
出力トークン/百万
1k
コンテキスト長
$17.5
Alibaba
$8
$240
52
-
$3.9
$15.2
64
$15.8
$12.7
Bytedance
$0.8
$2
128
Baidu
Tencent
$2.4
$12
8
32
$3
$9
kyr0
これはAppleシリコンチップデバイス用に最適化された自動音声認識モデルで、MLXフレームワークに変換し、FP8形式に量子化することで、Appleデバイス上での高速なエッジ上の音声文字起こしを実現します。このモデルは逐語的な精度に合わせて微調整されており、高精度の文字起こしが必要なシーンに特に適しています。
onnx-community
Supertonic-TTS-ONNXは、ONNX形式に基づくテキストから音声への変換モデルで、英語のテキストを自然で流れる音声に変換することができます。このモデルはSupertone/supertonic基礎モデルに基づいて開発され、Transformers.jsライブラリ用に最適化されており、ブラウザ環境で効率的に動作します。
pnnbao-ump
VieNeu-TTS-1000hは、約1000時間の高品質ベトナム語音声データを基にトレーニングされた、先進的なベトナム語エッジ側テキスト音声変換モデルです。即時音声クローニング機能を備え、ベトナム語と英語のシームレスな切り替えをサポートし、CPUまたはGPU上で24kHz波形をリアルタイムで合成できます。
nari-labs
Dia2はNari Labsによって開発されたストリーミング対話テキストを音声に変換する(TTS)モデルで、リアルタイム音声生成をサポートし、完全なテキストがなくても音声生成を開始でき、対話のコンテキストに応じて調整し、自然でスムーズな対話体験を実現します。
Dia2はNari Labsによって開発されたストリーミング対話テキスト音声変換(TTS)モデルで、リアルタイム音声生成をサポートし、完全なテキストがなくても音声生成を開始でき、自然な対話シーンに特化して設計されています。
abr-ai
これはApplied Brain Research(ABR)によって開発された、状態空間モデル(SSM)に基づく英語の自動音声認識モデルです。約1900万のパラメータを持ち、英語の音声を効率的かつ正確にテキストに変換することができます。このモデルは複数のベンチマークデータセットで優れた性能を発揮し、平均単語誤り率はわずか10.61%です。リアルタイム音声認識をサポートし、低コストのハードウェアで動作することができます。
IbrahimSalah
これは300時間の純粋なアラビア語音声データを基に微調整されたテキスト音声変換モデルで、完全な母音記号付きの現代標準アラビア語に特化した高品質な音声合成を提供し、音声クローンと長文処理機能をサポートしています。
Marvis-AI
これはMLXフレームワークに基づいて最適化されたテキスト音声変換モデルで、元のモデルMarvis-AI/marvis-tts-100m-v0.2から変換され、6ビット量子化技術を採用し、Apple Siliconハードウェア用に特別に最適化され、効率的な音声合成能力を提供します。
dinhthuan
NeuTTS - Airベトナム語テキストを音声に変換するモデルは、260万以上のベトナム語オーディオサンプルに基づき、NeuTTS - Air基礎モデルから微調整された高品質のベトナム語音声合成モデルです。このモデルは、自然で流暢なベトナム語音声合成を実現でき、音声クローニング機能をサポートし、生産環境に合わせて最適化されています。
OpenMOSS-Team
MOSS-TTSDはオープンソースのバイリンガル口語対話合成モデルで、中国語と英語をサポートし、二人の対話脚本を自然で表现力豊かな対話音声に変換できます。音声クローニングをサポートし、単一ラウンドの音声生成時間は最大1700秒に達することができます。
VieNeu-TTSは、個人デバイス上で動作可能な最初のベトナム語のテキスト音声変換モデルで、即時音声クローニング機能を備えています。NeuTTS Airをベースに微調整され、自然でリアルなベトナム語音声を生成でき、CPU上でリアルタイム性能を備えています。
mradermacher
SoulX-Podcast-1.7B は、Soul-AILab/SoulX-Podcast-1.7B に基づく静的量子化バージョンで、テキストを音声に変換するタスクに特化しています。このモデルは英語と中国語をサポートし、さまざまなハードウェアとパフォーマンス要件に対応するための複数の量子化バージョンを提供します。
TheStageAI
TheWhisper-Large-V3-Turboは、OpenAI Whisper Large V3モデルの高性能ファインチューニング版で、TheStage AIによって多プラットフォームのリアルタイム、低遅延、低消費電力の音声テキスト変換推論に最適化されています。ストリーミング文字起こし、単語のタイムスタンプ、拡張可能なパフォーマンスをサポートし、リアルタイム字幕、会議、デバイス端末の音声インターフェイスなどのシーンに適しています。
TheWhisper-Large-V3はOpenAI Whisper Large V3モデルの高性能ファインチューニング版で、TheStage AIによって多プラットフォーム(NVIDIA GPUとApple Silicon)のリアルタイム、低遅延、低消費電力の音声テキスト変換推論用に最適化されています。
nineninesix
KaniTTSは、リアルタイム対話型AIアプリケーション向けに最適化された高速、高音質のテキスト音声変換モデルです。2段階パイプラインを用いて、大規模言語モデルと高効率オーディオコーデックを組み合わせ、卓越した速度とオーディオ品質を実現します。このモデルはスペイン語をサポートし、4億のパラメータを持ち、サンプリングレートは22kHzです。
KaniTTSは、リアルタイム対話型人工知能アプリケーション向けに最適化された高速かつ高忠実度のアラビア語テキスト音声変換モデルです。2段階パイプラインアーキテクチャを採用し、大規模言語モデルと効率的なオーディオコーデックを組み合わせることで、卓越した速度とオーディオ品質を実現し、対話型AI、障害者支援、研究など多くの分野の音声合成ニーズを満たすことができます。
KaniTTSは、リアルタイム対話型AIアプリケーション向けに最適化された高速かつ高忠実度のテキスト音声変換モデルです。独自の2段階アーキテクチャにより、大規模言語モデルと効率的な音声コーデックを組み合わせ、低遅延で高品質な音声合成を実現します。リアルタイムファクターは最低0.2で、リアルタイム速度の5倍の高速合成が可能です。
CypressYang
SongBloomは、テキストを音声に変換することに特化した生成モデルで、テキストを生き生きとした音声コンテンツに変換し、ユーザーに新しい音声合成体験を提供します。
KaniTTS Pretrain v0.3は高速で高忠実度のテキストを音声に変換するモデルで、リアルタイム対話型人工知能アプリケーション向けに最適化されています。2段階パイプラインアーキテクチャを採用し、大規模言語モデルと高効率オーディオコーデックを組み合わせて、超低遅延と高品質の音声合成を実現します。
これはMLXフレームワークで最適化されたテキストを音声に変換するモデルで、nineninesixによって開発され、複数の言語の高品質な音声合成をサポートします。
ElevenLabs公式のMCPサーバーで、テキストを音声に変換し、音声処理APIとのやり取りが可能です。
Markdownifyは、PDF、画像、音声などのさまざまな形式やウェブページのコンテンツをMarkdown形式に変換することができる多機能ファイル変換サービスです。
MCPプロトコルに基づく抖音動画処理サーバーで、ノーウォーターマーク動画のダウンロード、音声の抽出、テキストの変換機能をサポートします。
MCPビデオダイジェストは、複数のプラットフォームから音声を抽出してテキストに変換するビデオコンテンツ処理サービスで、複数の文字起こしサービスを提供し、柔軟な設定と高い処理能力を備えています。
Zonos TTSとClaudeのMCP統合プロジェクトで、テキストを音声に変換する機能を実現します。
Rime APIに基づくテキストを音声に変換するMCPサーバーで、システムオーディオ再生機能を提供します。
Minimax MCPツールは、Minimax AI機能を統合したMCPサーバーの実装で、画像生成とテキスト音声変換機能を提供します。
AllVoiceLab公式MCPサーバーです。テキスト読み上げ、ビデオ翻訳などの強力なAPI対話をサポートし、複数のクライアントに音声生成、ビデオ翻訳、スマートな音声変換サービスを提供します。
mcp - audioはAIO - 2030標準に準拠したMCPプラグインで、音声を文字に変換する機能を提供し、複数の音声フォーマットとAPI呼び出し方法をサポートします。
Windowsのネイティブ音声サービスに基づくテキスト読み上げと音声認識のMCPサーバーで、外部APIに依存する必要はありません。
VOICEPEAKのテキストを音声に変換するMCPサーバーで、音声合成、再生、発音辞書管理などの機能をサポートします。
macOSに組み込まれたsayコマンドを基にしたテキストを音声に変換するMCPサーバー
Chatterbox TTSモデルに基づく簡易MCPサーバーで、テキストを音声に変換して自動再生する機能を提供し、リアルタイムの進捗通知と自動モデルロードをサポートしています。
これはNode.jsベースのMCPサーバープロジェクトで、Model Context Protocolを通じてAIアシスタントと棒読みちゃん音声合成ソフトウェアを統合し、テキストを音声に変換する機能を提供します。
MCPプロトコルに基づくビデオオーディオテキスト抽出サーバーで、複数のプラットフォームからビデオをダウンロードし、Whisperモデルを利用して音声をテキストに変換する処理をサポートします。
MCPサーバーとOpenAI TTS SDKに基づくテキストを音声に変換するツールで、ローカル環境での再生をサポートしています。
Markdownify MCP UTF - 8拡張版は、多言語コンテンツの変換をサポートするMarkdown処理サービスで、UTF - 8エンコーディングのサポートを最適化し、PDF/画像/音声・動画/Office文書などのさまざまな形式のMarkdown変換機能を提供し、Windowsシステムに特化した最適化が行われています。
MCP Video Digestは、複数のプラットフォームから音声を抽出してテキストに変換するビデオコンテンツ処理サービスで、複数の文字起こしサービスを提供します。
Windowsネイティブの音声APIを利用した音声変換MCPサービス
Claude DesktopやCursor IDEなどにテキストを音声に変換するサービスを提供するMCPサーバー