快手の可灵AIが初の「音画同出」モデル可灵2.6を発表。映像・音声・効果音・環境雰囲気を同時生成可能で、文章や画像から短時間で動画制作ができる。....
瞳行科技が国内初のAI視覚支援メガネを発表。アリババの大規模AIモデルを搭載し、視覚障害者にリアルタイムの移動支援を提供。300ミリ秒の低遅延で周囲状況を音声案内し、バス停表示や標識の認識も可能。開発コストを70%削減し、機能のローカル処理も実現。....
フランスのAI音声スタートアップGradiumが7000万ドルのシードラウンドを調達。欧州音声AI分野で最高額。Kyutai研究所発の同社は、ミリ秒応答の音声言語モデル「音区」を開発。....
アリ千問APPは万相2.5モデルを統合し、動画クリエイションの能力が向上しました。動作精度と体の動きの調整性が向上し、初めてモバイル端末で音声と映像の同期出力をサポートするAIアシスタントとなりました。このモデルは音声と映像の同期能力を備え、マルチモーダル入出力が可能で、LMArena評価において画像から動画を作成する能力は世界第3位です。
S02AIはSora2モデルに基づいており、テキストまたは画像から音声付きの高品質なAIビデオを生成することができます。
音声AIのASR、TTS、LLMモデルを提供し、リアルタイムアプリケーション向けにテスト?デプロイ可能です。
複数のAIモデルを統合し、対話を通じて画像、ビデオ、音声を生成し、クリエイティブプロセスを最適化します。
Google Veo 3 AIビデオ技術を使用したビデオジェネレーターで、テキストや画像から映画のようなビデオを生成し、音声とビデオの同期、最新のGoogleビデオモデルを使った経験を行えます。
Google
$0.49
入力トークン/百万
$2.1
出力トークン/百万
1k
コンテキスト長
Openai
-
$0.7
$2.8
Anthropic
$7
$35
200
$17.5
$21
$105
Alibaba
$1
$10
256
Baidu
128
$6
$24
$8
$240
52
$3.9
$15.2
64
$15.8
$12.7
Bytedance
$0.8
$2
dinhthuan
NeuTTS - Airベトナム語テキストを音声に変換するモデルは、260万以上のベトナム語オーディオサンプルに基づき、NeuTTS - Air基礎モデルから微調整された高品質のベトナム語音声合成モデルです。このモデルは、自然で流暢なベトナム語音声合成を実現でき、音声クローニング機能をサポートし、生産環境に合わせて最適化されています。
pnnbao-ump
VieNeu-TTSは、個人デバイス上で動作可能な最初のベトナム語のテキスト音声変換モデルで、即時音声クローニング機能を備えています。NeuTTS Airをベースに微調整され、自然でリアルなベトナム語音声を生成でき、CPU上でリアルタイム性能を備えています。
TheStageAI
TheWhisper-Large-V3-Turboは、OpenAI Whisper Large V3モデルの高性能ファインチューニング版で、TheStage AIによって多プラットフォームのリアルタイム、低遅延、低消費電力の音声テキスト変換推論に最適化されています。ストリーミング文字起こし、単語のタイムスタンプ、拡張可能なパフォーマンスをサポートし、リアルタイム字幕、会議、デバイス端末の音声インターフェイスなどのシーンに適しています。
TheWhisper-Large-V3はOpenAI Whisper Large V3モデルの高性能ファインチューニング版で、TheStage AIによって多プラットフォーム(NVIDIA GPUとApple Silicon)のリアルタイム、低遅延、低消費電力の音声テキスト変換推論用に最適化されています。
nineninesix
KaniTTSは、リアルタイム対話型AIアプリケーション向けに最適化された高速、高音質のテキスト音声変換モデルです。2段階パイプラインを用いて、大規模言語モデルと高効率オーディオコーデックを組み合わせ、卓越した速度とオーディオ品質を実現します。このモデルはスペイン語をサポートし、4億のパラメータを持ち、サンプリングレートは22kHzです。
KaniTTSは、リアルタイム対話型人工知能アプリケーション向けに最適化された高速かつ高忠実度のアラビア語テキスト音声変換モデルです。2段階パイプラインアーキテクチャを採用し、大規模言語モデルと効率的なオーディオコーデックを組み合わせることで、卓越した速度とオーディオ品質を実現し、対話型AI、障害者支援、研究など多くの分野の音声合成ニーズを満たすことができます。
KaniTTSは、リアルタイム対話型AIアプリケーション向けに最適化された高速かつ高忠実度のテキスト音声変換モデルです。独自の2段階アーキテクチャにより、大規模言語モデルと効率的な音声コーデックを組み合わせ、低遅延で高品質な音声合成を実現します。リアルタイムファクターは最低0.2で、リアルタイム速度の5倍の高速合成が可能です。
KaniTTSは、リアルタイム対話型AIアプリケーション向けに最適化された高速かつ高忠実度のテキスト音声変換モデルです。2段階のパイプラインアーキテクチャを採用し、大規模言語モデルと効率的なオーディオコーデックを組み合わせることで、卓越した速度と音質を実現し、複数の言語をサポートし、エッジ/サーバーデプロイメントに適しています。
neuphonic
NeuTTS Airは世界初の即時音声クローン機能を備えた超リアルな端側テキスト読み上げ(TTS)言語モデルです。0.5Bパラメータの大規模言語モデルの骨格をベースに構築され、ローカルデバイスに自然な音声、リアルタイム性能、組み込みセキュリティ、話者クローン機能をもたらします。
NeuTTS Airは、即時音声クローニング機能を備えた世界初の超リアルなデバイス端テキスト音声変換モデルです。0.5Bパラメータの大規模言語モデルの骨格をベースに構築され、ローカルデバイス上で自然な音声生成、リアルタイム性能、話者クローニング機能を実現します。
NeuTTS Airは世界初の即時音声クローニング機能を備えた超リアルなデバイス端テキスト音声変換(TTS)言語モデルです。0.5Bの大規模言語モデルのバックボーンネットワークをベースに構築され、ローカルデバイスに自然な音声、リアルタイム性能、組み込みセキュリティ機能、話者クローニング機能をもたらします。
UsefulSensors
Moonshine Tinyは、Moonshine AI(旧有用センサー会社)によって開発された軽量のベトナム語自動音声認識モデルで、たった27Mのパラメータしか持たず、リソース制限のあるプラットフォーム向けに設計されており、FleursとCommon Voice 17のデータセットで優れた性能を発揮します。
LiquidAI
LFM2-Audio-1.5BはLiquid AIが提供する最初のエンドツーエンドの音声基礎モデルで、低遅延とリアルタイム対話に特化して設計されています。このモデルはわずか15億パラメータで、シームレスな対話インタラクションを実現し、パラメータ規模がはるかに大きいモデルと匹敵する能力を持っています。
webbigdata
VoiceCoreは商用可能な日本語音声AIエージェントモデルで、AIが音声で人間と自然にコミュニケーションすることに特化しており、感情表現と非言語音声の能力を備え、多种類の音声スタイルを選択できます。
ai4bharat
Wav2Vec2アーキテクチャに基づくヒンディー語自動音声認識モデル、AI4Bharatによって開発
AquaLabs
EchoLLaMAはマルチモーダルAIシステムで、3D視覚データを自然な音声記述に変換でき、音声入力による対話型インタラクションもサポートします。
FreedomIntelligence
Soundwaveは音声とテキストの境界を突破した音声からテキストへの変換モデルで、わずか1万時間のデータで訓練するだけで、音声翻訳とAIR - Bench音声タスクで卓越した性能を発揮します。
jiviai
AudioXはJivi AIが開発した多言語自動音声認識モデルで、ヒンディー語、グジャラート語、マラーティー語などインドの言語に最適化されています。
speechbrain
これは25000時間の英語音声データセットを基に訓練された大規模自動音声認識モデルで、Conformerアーキテクチャを採用し、三星AIケンブリッジセンターによって提供されています。モデルのパラメータ数は4.8億に達し、複数のテストセットで優れた性能を発揮し、検証セットのWERは6.8%、テストセットのWERは7.5%です。
AudioXはJivi AIが開発した多言語自動音声認識モデルで、特にインド南部の言語に最適化されており、タミル語、テルグ語、カンナダ語、マラヤーラム語をサポートしています。
mcp-hfspaceは、Hugging Face Spacesに接続するMCPサーバーで、画像生成、音声処理、ビジュアルモデルなど、さまざまなAI機能をサポートし、Claude Desktopとの統合を簡素化します。
TeamSpeak MCPは、Model Context Protocolに基づくサーバー制御ツールで、ClaudeなどのAIモデルがTeamSpeak音声サーバーを管理できるように設計されています。ユーザー管理、チャンネル制御、権限設定などの包括的な操作をカバーする39種類の機能ツールを提供し、複数のデプロイ方法(PyPI/Docker/ローカル)をサポートして、TeamSpeakの自動管理を実現します。
Whisperモデルベースの音声録音と文字起こしMCPサーバーで、Goose AI拡張としても独立して動作することもでき、様々な録音シーンとモデル設定をサポートします。
Voicevox MCP ServerはVOICEVOX互換の音声合成サーバーで、MCPプロトコルを通じてAivisSpeech/VOICEVOX/COEIROINKとのインタラクションを実現し、CursorなどのエディタでのClaude 3.7代理モードの音声合成をサポートします。
Message MCPはAIタスク通知システムで、デスクトップ通知、カスタム音声、モバイルプッシュ、メール通知、APIプッシュ機能を提供し、ユーザーが画面を見続けることなくタスクの完了状態をタイムリーに知ることができます。
Whisperモデルに基づく音声録音と文字起こしのMCPサーバーで、Goose AIの拡張機能として、または独立したサービスとして動作させることができます。
これは、Model Context Protocol(MCP)エコシステムに関する選りすぐりのリソースリストで、公式リソース、開発ツール、MCPサーバー、Web統合、データベース、ブロックチェーン、AI統合、音声、モバイルアプリ、開発環境、セキュリティテスト、生産性ツール、システムツールなどの複数のカテゴリを網羅しています。
TeamSpeak MCPは、Model Context Protocolに基づくサービスで、AIモデル(Claudeなど)を通じてTeamSpeakサーバーを制御し、包括的なチャンネル管理、ユーザー権限制御、音声調整などの機能を提供します。
MCPollinationsは、Model Context Protocol(MCP)に基づくマルチモーダルAIサービスで、Pollinations APIを通じて画像、テキスト、音声を生成することができます。認証不要の軽量サービスを提供し、複数のAIモデルと互換性があり、画像の保存とBase64エンコードの返却をサポートしています。
ExotelMCPはモデルコンテキストプロトコル(MCP)サーバーで、Claude AIとExotelの通信APIをシームレスに統合し、SMSサービス、音声通話、高速オーディオツールサービスをサポートします。
MCP-hfspaceは、Hugging Face Spacesへの接続を簡素化するサーバーツールです。画像生成、音声処理、ビジュアルモデルなどのさまざまなAI機能をサポートし、Claude Desktopとシームレスに統合されます。
大規模モデルに基づくインテリジェントチャットボットプロジェクトで、多プラットフォーム接続と複数のAIモデルをサポートし、テキスト、音声、画像処理およびプラグイン拡張機能を備え、企業用AIアプリケーションをカスタマイズできます。
完全なGroq MCPサーバープロジェクトで、アプリとGroq APIを接続するインテリジェントな橋渡し役として機能し、さまざまなAIモデル(テキスト、音声、ビジュアル、バッチ処理)をサポートし、インテリジェントなルーティング、レート制限、キャッシュ最適化などの高度な機能を備えています。
MCPサーバーWhisperはOpenAI WhisperとGPT - 4oモデルに基づく音声処理サーバーで、高度な音声文字起こし、形式変換、バッチ処理、テキスト読み上げなどの機能を提供し、Model Context Protocol標準を通じてAIアシスタントとのシームレスなインタラクションを実現します。