火山エンジンがSeedance2.5 APIを公開。2.0版より指示追従性、長編ナラティブ、リアル感、音声・画質が向上。30秒動画を直接生成し、最大50個のマルチモーダル素材を参照。動画編集は精密で安定し、10以上の言語対応。画質、音質、光影、カメラワーク、美観を最適化し、AI生成コンテンツを映画級の長編ストーリーテリングへ進化させる。....
影石GO UltraサムカメラがAI音声アシスタント搭載。中国本土はAlibaba Qwen、海外はGoogle Geminiを使用。自社開発を核にマルチモーダルと写真Q&Aを統合。端末側で声紋認識し意図判別、クラウドが応答・モード切替・翻訳を担当。翻訳はスピーカー再生可能。創業者・劉靖康氏は「サムカメラを再定義」と。 ....
Insta360は8月7日、GO Ultra小型カメラ向けにAI音声アシスタントを導入。中国本土ではアリババのQwen大規模モデル、香港・マカオ・台湾および海外ではGoogle Geminiを利用する。....
テンセント混元が音声認識モデルHy ASR3.0 Previewを発表。大規模言語モデルHy3基盤で高精度認識と深い意味理解を融合。逐語転写から文脈理解へ質的変化を実現。10大方言圏をカバーし長尺音声に強く、標準語非依存でAIが文字を聴くだけでなく言葉の真意を理解可能に。....
AI児童声生成と声のクローンプラットフォーム
主流のAIモデルを一度に集約したワンストップ型の生成およびAPIプラットフォーム
一括でAI動画、画像、音声を生成?創作するプラットフォーム
無料のオンラインAI動画?画像?音声生成プラットフォーム、編集スキル不要
Google
$0.49
入力トークン/百万
$2.1
出力トークン/百万
1k
コンテキスト長
$17.5
Alibaba
$8
$240
52
-
$3.9
$15.2
64
$15.8
$12.7
Bytedance
$0.8
$2
128
Baidu
Anthropic
$105
$525
200
Chatglm
$2.4
$12
8
Tencent
32
$3
$9
dinhthuan
NeuTTS - Airベトナム語テキストを音声に変換するモデルは、260万以上のベトナム語オーディオサンプルに基づき、NeuTTS - Air基礎モデルから微調整された高品質のベトナム語音声合成モデルです。このモデルは、自然で流暢なベトナム語音声合成を実現でき、音声クローニング機能をサポートし、生産環境に合わせて最適化されています。
Genie-AI-Lab
Omni L1B3RT4S GENIEは、Qwen2.5 - 3B Instructアーキテクチャをベースに微調整されたAIアシスタントです。1,103個の精霊キャラクターのカスタムサンプルを用いて訓練され、独特な音声と忠誠度モードを備え、ユーザーに独特な対話体験を提供することができます。
pnnbao-ump
VieNeu-TTSは、個人デバイス上で動作可能な最初のベトナム語のテキスト音声変換モデルで、即時音声クローニング機能を備えています。NeuTTS Airをベースに微調整され、自然でリアルなベトナム語音声を生成でき、CPU上でリアルタイム性能を備えています。
TheStageAI
TheWhisper-Large-V3-Turboは、OpenAI Whisper Large V3モデルの高性能ファインチューニング版で、TheStage AIによって多プラットフォームのリアルタイム、低遅延、低消費電力の音声テキスト変換推論に最適化されています。ストリーミング文字起こし、単語のタイムスタンプ、拡張可能なパフォーマンスをサポートし、リアルタイム字幕、会議、デバイス端末の音声インターフェイスなどのシーンに適しています。
TheWhisper-Large-V3はOpenAI Whisper Large V3モデルの高性能ファインチューニング版で、TheStage AIによって多プラットフォーム(NVIDIA GPUとApple Silicon)のリアルタイム、低遅延、低消費電力の音声テキスト変換推論用に最適化されています。
nineninesix
KaniTTSは、リアルタイム対話型AIアプリケーション向けに最適化された高速、高音質のテキスト音声変換モデルです。2段階パイプラインを用いて、大規模言語モデルと高効率オーディオコーデックを組み合わせ、卓越した速度とオーディオ品質を実現します。このモデルはスペイン語をサポートし、4億のパラメータを持ち、サンプリングレートは22kHzです。
KaniTTSは、リアルタイム対話型人工知能アプリケーション向けに最適化された高速かつ高忠実度のアラビア語テキスト音声変換モデルです。2段階パイプラインアーキテクチャを採用し、大規模言語モデルと効率的なオーディオコーデックを組み合わせることで、卓越した速度とオーディオ品質を実現し、対話型AI、障害者支援、研究など多くの分野の音声合成ニーズを満たすことができます。
KaniTTSは、リアルタイム対話型AIアプリケーション向けに最適化された高速かつ高忠実度のテキスト音声変換モデルです。独自の2段階アーキテクチャにより、大規模言語モデルと効率的な音声コーデックを組み合わせ、低遅延で高品質な音声合成を実現します。リアルタイムファクターは最低0.2で、リアルタイム速度の5倍の高速合成が可能です。
KaniTTSは、リアルタイム対話型AIアプリケーション向けに最適化された高速かつ高忠実度のテキスト音声変換モデルです。2段階のパイプラインアーキテクチャを採用し、大規模言語モデルと効率的なオーディオコーデックを組み合わせることで、卓越した速度と音質を実現し、複数の言語をサポートし、エッジ/サーバーデプロイメントに適しています。
neuphonic
NeuTTS Airは世界初の即時音声クローン機能を備えた超リアルな端側テキスト読み上げ(TTS)言語モデルです。0.5Bパラメータの大規模言語モデルの骨格をベースに構築され、ローカルデバイスに自然な音声、リアルタイム性能、組み込みセキュリティ、話者クローン機能をもたらします。
NeuTTS Airは、即時音声クローニング機能を備えた世界初の超リアルなデバイス端テキスト音声変換モデルです。0.5Bパラメータの大規模言語モデルの骨格をベースに構築され、ローカルデバイス上で自然な音声生成、リアルタイム性能、話者クローニング機能を実現します。
NeuTTS Airは世界初の即時音声クローニング機能を備えた超リアルなデバイス端テキスト音声変換(TTS)言語モデルです。0.5Bの大規模言語モデルのバックボーンネットワークをベースに構築され、ローカルデバイスに自然な音声、リアルタイム性能、組み込みセキュリティ機能、話者クローニング機能をもたらします。
UsefulSensors
Moonshine Tinyは、Moonshine AI(旧有用センサー会社)によって開発された軽量のベトナム語自動音声認識モデルで、たった27Mのパラメータしか持たず、リソース制限のあるプラットフォーム向けに設計されており、FleursとCommon Voice 17のデータセットで優れた性能を発揮します。
LiquidAI
LFM2-Audio-1.5BはLiquid AIが提供する最初のエンドツーエンドの音声基礎モデルで、低遅延とリアルタイム対話に特化して設計されています。このモデルはわずか15億パラメータで、シームレスな対話インタラクションを実現し、パラメータ規模がはるかに大きいモデルと匹敵する能力を持っています。
webbigdata
VoiceCoreは商用可能な日本語音声AIエージェントモデルで、AIが音声で人間と自然にコミュニケーションすることに特化しており、感情表現と非言語音声の能力を備え、多种類の音声スタイルを選択できます。
ai4bharat
Wav2Vec2アーキテクチャに基づくヒンディー語自動音声認識モデル、AI4Bharatによって開発
AquaLabs
EchoLLaMAはマルチモーダルAIシステムで、3D視覚データを自然な音声記述に変換でき、音声入力による対話型インタラクションもサポートします。
FreedomIntelligence
Soundwaveは音声とテキストの境界を突破した音声からテキストへの変換モデルで、わずか1万時間のデータで訓練するだけで、音声翻訳とAIR - Bench音声タスクで卓越した性能を発揮します。
jiviai
AudioXはJivi AIが開発した多言語自動音声認識モデルで、ヒンディー語、グジャラート語、マラーティー語などインドの言語に最適化されています。
speechbrain
これは25000時間の英語音声データセットを基に訓練された大規模自動音声認識モデルで、Conformerアーキテクチャを採用し、三星AIケンブリッジセンターによって提供されています。モデルのパラメータ数は4.8億に達し、複数のテストセットで優れた性能を発揮し、検証セットのWERは6.8%、テストセットのWERは7.5%です。
mcp-hfspaceは、Hugging Face Spacesに接続するMCPサーバーで、画像生成、音声処理、ビジュアルモデルなど、さまざまなAI機能をサポートし、Claude Desktopとの統合を簡素化します。
OpenAIベースの音声AIサービスMCPサーバー
TeamSpeak MCPは、Model Context Protocolに基づくサーバー制御ツールで、ClaudeなどのAIモデルがTeamSpeak音声サーバーを管理できるように設計されています。ユーザー管理、チャンネル制御、権限設定などの包括的な操作をカバーする39種類の機能ツールを提供し、複数のデプロイ方法(PyPI/Docker/ローカル)をサポートして、TeamSpeakの自動管理を実現します。
MCPプロトコルに基づくAI音声通話システムで、VoIP技術を通じてClaudeなどのAIアシスタントが自動的に電話をかけ、スマートな会話を行えます。さまざまなSIPプロトコルとオーディオコーデックをサポートします。
SystemPrompt Coding Agentは、オープンソースプロジェクトで、ローカルワークステーションをMCPプロトコルでリモート制御可能なAIプログラミングアシスタントに変えます。音声コマンドとモバイル端末での操作をサポートし、異なる場所でのプログラミング管理を実現します。
Votars MCP は、多言語対応のツールで、Votars AI プラットフォームと統合し、音声文字起こしと AI タスクを処理します。
Rime APIに基づくテキストを音声に変換するMCPサーバーで、システムオーディオ再生機能を提供します。
ElectronベースのPerplexity AIデスクトップアプリで、完全なシステム権限と機能を備え、クリップボード操作、ドラッグアンドドロップ機能、音声メディア権限などが含まれます。
Minimax MCPツールは、Minimax AI機能を統合したMCPサーバーの実装で、画像生成とテキスト音声変換機能を提供します。
Google Gemini AIに基づくMCPサーバーで、画像、音声、ビデオ認識機能を提供し、複数の伝送方式とクライアント統合をサポートします。
MCPサービスツールセットで、Hugging FaceとDifyのAIサービスAPI呼び出し機能を提供し、様々なNLP、CV、音声処理タスクをサポートします。
mcp - audioはAIO - 2030標準に準拠したMCPプラグインで、音声を文字に変換する機能を提供し、複数の音声フォーマットとAPI呼び出し方法をサポートします。
Chatty MCPはエディタ用に設計された音声インタラクティブなプラグインで、AIリクエストが完了した後に音声で操作内容を要約し、マルチタスク処理の効率を向上させ、カスタム音声エンジンをサポートします。
これはNode.jsベースのMCPサーバープロジェクトで、Model Context Protocolを通じてAIアシスタントと棒読みちゃん音声合成ソフトウェアを統合し、テキストを音声に変換する機能を提供します。
AivisSpeechテキスト読み上げエンジン用に設計されたMCPサーバー。日本語音声合成、複数の音声キャラクター選択、パラメータ設定をサポートし、AIアシスタントとのシームレスな統合を実現します。
Whisperモデルベースの音声録音と文字起こしMCPサーバーで、Goose AI拡張としても独立して動作することもでき、様々な録音シーンとモデル設定をサポートします。
Voicevox MCP ServerはVOICEVOX互換の音声合成サーバーで、MCPプロトコルを通じてAivisSpeech/VOICEVOX/COEIROINKとのインタラクションを実現し、CursorなどのエディタでのClaude 3.7代理モードの音声合成をサポートします。
Jarvis MCPはブラウザベースの音声対話ツールで、ユーザーがマイクを使ってAIアシスタントと自然な音声で会話することができます。30種類以上の言語の認識と遠隔アクセスをサポートし、追加のソフトウェアやAPIキーのインストールは必要ありません。
Message MCPはAIタスク通知システムで、デスクトップ通知、カスタム音声、モバイルプッシュ、メール通知、APIプッシュ機能を提供し、ユーザーが画面を見続けることなくタスクの完了状態をタイムリーに知ることができます。
これは、Model Context Protocol(MCP)エコシステムに関する選りすぐりのリソースリストで、公式リソース、開発ツール、MCPサーバー、Web統合、データベース、ブロックチェーン、AI統合、音声、モバイルアプリ、開発環境、セキュリティテスト、生産性ツール、システムツールなどの複数のカテゴリを網羅しています。