モトローラはIFA 2026で新製品を発表。初のMotorola Qira搭載・LTE対応スマートウォッチ「moto watch ultra」は手首を上げるか音声で起動。edge 70 plus / neoはカメラとバッテリー重視。razrスワロフスキークリスタル版やmoto snapワイヤレス充電器も登場し、MotorolaとLenovoデバイス間の連携を強化。....
GoogleがWorkspace向けにGemini搭載のAI音声機能を発表。Gmail、Google Docs、Keepと連携し、自然な音声でメール検索や文書作成、メモ整理が可能。手入力を減らしマルチタスク効率を向上。Docsに革新的な音声アップグレード。....
マイクロソフトは9月3日、最新音声認識モデル「MAI-Transcribe-2」を発表。FLEURSベンチマーク(60言語)で平均単語誤り率5.2%、Artificial Analysisで2位。長音声処理は競合の最大10倍速く、約10秒で1時間を文字起こし。Microsoft Foundry、MAI Playground、Open Routerで提供。....
マイクロソフトが音声文字起こしAI「MAI-Transcribe-2」を発表。最速・最高精度・最安を謳い、2026年末まで毎時0.10ドル。GPT-Transcribeより10倍高速で、FLEURSテストでは言語指定・自動推論の平均単語誤り率がともに5.2%でGemini 3.1 Proを上回る。....
無料のオンライン音声読み上げツールで、AI音声でテキストを読み上げます。登録不要で、MP3をダウンロードできます。
SKIはクロスプラットフォームの音声アシスタントで、AIコーディングエージェントと音声で対話でき、完全にローカルで永久無料です。
Mac用の音声生産性ツールキットで、ワンクリックで音声を听写し、整形されたテキストを生成し、さまざまな機能を備えています。
無料のAI音声クローニング。秒単位で生成。短い音声をアップロードするだけで、登録不要で制限なく利用できます。
Google
$0.49
入力トークン/百万
$2.1
出力トークン/百万
1k
コンテキスト長
$17.5
Alibaba
$8
$240
52
-
$3.9
$15.2
64
$15.8
$12.7
Bytedance
$0.8
$2
128
Baidu
$2.4
$12
8
Tencent
32
$3
$9
$1.6
$10
Clemylia
ピカチュウ言語モデルはClemyliaが起こした独自の実験的な言語プロジェクトで、完全にゼロから訓練され、「ピカチュウ」の音声コーパスのみに基づいており、小型言語モデルがネイティブ言語のアイデンティティを創造する能力を示しています。
kyr0
これはAppleシリコンチップデバイス用に最適化された自動音声認識モデルで、MLXフレームワークに変換し、FP8形式に量子化することで、Appleデバイス上での高速なエッジ上の音声文字起こしを実現します。このモデルは逐語的な精度に合わせて微調整されており、高精度の文字起こしが必要なシーンに特に適しています。
ai-sage
GigaAM-v3はConformerアーキテクチャに基づくロシア語自動音声認識の基礎モデルで、2.2 - 2.4億のパラメータを持っています。これはGigaAMシリーズの第3世代モデルで、70万時間のロシア語音声データを使用してHuBERT - CTC目標で事前学習され、幅広いロシア語ASR分野で最先端の性能を提供します。
onnx-community
Supertonic-TTS-ONNXは、ONNX形式に基づくテキストから音声への変換モデルで、英語のテキストを自然で流れる音声に変換することができます。このモデルはSupertone/supertonic基礎モデルに基づいて開発され、Transformers.jsライブラリ用に最適化されており、ブラウザ環境で効率的に動作します。
pnnbao-ump
VieNeu-TTS-1000hは、約1000時間の高品質ベトナム語音声データを基にトレーニングされた、先進的なベトナム語エッジ側テキスト音声変換モデルです。即時音声クローニング機能を備え、ベトナム語と英語のシームレスな切り替えをサポートし、CPUまたはGPU上で24kHz波形をリアルタイムで合成できます。
nari-labs
Dia2はNari Labsによって開発されたストリーミング対話テキストを音声に変換する(TTS)モデルで、リアルタイム音声生成をサポートし、完全なテキストがなくても音声生成を開始でき、対話のコンテキストに応じて調整し、自然でスムーズな対話体験を実現します。
Dia2はNari Labsによって開発されたストリーミング対話テキスト音声変換(TTS)モデルで、リアルタイム音声生成をサポートし、完全なテキストがなくても音声生成を開始でき、自然な対話シーンに特化して設計されています。
abr-ai
これはApplied Brain Research(ABR)によって開発された、状態空間モデル(SSM)に基づく英語の自動音声認識モデルです。約1900万のパラメータを持ち、英語の音声を効率的かつ正確にテキストに変換することができます。このモデルは複数のベンチマークデータセットで優れた性能を発揮し、平均単語誤り率はわずか10.61%です。リアルタイム音声認識をサポートし、低コストのハードウェアで動作することができます。
IbrahimSalah
これは300時間の純粋なアラビア語音声データを基に微調整されたテキスト音声変換モデルで、完全な母音記号付きの現代標準アラビア語に特化した高品質な音声合成を提供し、音声クローンと長文処理機能をサポートしています。
Marvis-AI
これはMLXフレームワークに基づいて最適化されたテキスト音声変換モデルで、元のモデルMarvis-AI/marvis-tts-100m-v0.2から変換され、6ビット量子化技術を採用し、Apple Siliconハードウェア用に特別に最適化され、効率的な音声合成能力を提供します。
labhamlet
WavJEPAは波形ベースの結合埋め込み予測アーキテクチャに基づく音声基礎モデルで、高度な意味表現学習を利用して音声単位またはタグレベルの表現学習の不足を解決します。多くの下流のベンチマークタスクで、最先端の時間領域音声基礎モデルを大幅に上回り、同時に必要な計算リソースを大幅に削減します。
dinhthuan
NeuTTS - Airベトナム語テキストを音声に変換するモデルは、260万以上のベトナム語オーディオサンプルに基づき、NeuTTS - Air基礎モデルから微調整された高品質のベトナム語音声合成モデルです。このモデルは、自然で流暢なベトナム語音声合成を実現でき、音声クローニング機能をサポートし、生産環境に合わせて最適化されています。
ycngin2024
これは微調整されたWhisper音声認識モデルで、unsloth/whisper-large-v3-turboアーキテクチャに基づいており、UnslothとHuggingface TRLライブラリを使用して訓練速度を2倍に加速し、訓練効率を大幅に向上させています。
OpenMOSS-Team
MOSS-TTSDはオープンソースのバイリンガル口語対話合成モデルで、中国語と英語をサポートし、二人の対話脚本を自然で表现力豊かな対話音声に変換できます。音声クローニングをサポートし、単一ラウンドの音声生成時間は最大1700秒に達することができます。
Genie-AI-Lab
Omni L1B3RT4S GENIEは、Qwen2.5 - 3B Instructアーキテクチャをベースに微調整されたAIアシスタントです。1,103個の精霊キャラクターのカスタムサンプルを用いて訓練され、独特な音声と忠誠度モードを備え、ユーザーに独特な対話体験を提供することができます。
adoamesh
このモデルは、OpenAIのWhisper-smallモデルをベースに、スワヒリ語に対して微調整された自動音声認識モデルです。FLEURS - SLUデータセットのスワヒリ語部分で訓練され、スワヒリ語の文字起こしの精度が大幅に向上し、単語誤り率がベースモデルに比べて68%低下しました。
VieNeu-TTSは、個人デバイス上で動作可能な最初のベトナム語のテキスト音声変換モデルで、即時音声クローニング機能を備えています。NeuTTS Airをベースに微調整され、自然でリアルなベトナム語音声を生成でき、CPU上でリアルタイム性能を備えています。
mradermacher
SoulX-Podcast-1.7B は、Soul-AILab/SoulX-Podcast-1.7B に基づく静的量子化バージョンで、テキストを音声に変換するタスクに特化しています。このモデルは英語と中国語をサポートし、さまざまなハードウェアとパフォーマンス要件に対応するための複数の量子化バージョンを提供します。
TheStageAI
TheWhisper-Large-V3-Turboは、OpenAI Whisper Large V3モデルの高性能ファインチューニング版で、TheStage AIによって多プラットフォームのリアルタイム、低遅延、低消費電力の音声テキスト変換推論に最適化されています。ストリーミング文字起こし、単語のタイムスタンプ、拡張可能なパフォーマンスをサポートし、リアルタイム字幕、会議、デバイス端末の音声インターフェイスなどのシーンに適しています。
TheWhisper-Large-V3はOpenAI Whisper Large V3モデルの高性能ファインチューニング版で、TheStage AIによって多プラットフォーム(NVIDIA GPUとApple Silicon)のリアルタイム、低遅延、低消費電力の音声テキスト変換推論用に最適化されています。
ElevenLabs公式のMCPサーバーで、テキストを音声に変換し、音声処理APIとのやり取りが可能です。
FastMCPは、TypeScriptに基づくフレームワークで、クライアントセッションをサポートするMCPサーバーを構築するために使用されます。ツール、リソース、プロンプトの簡単な定義を提供し、認証、セッション管理、画像と音声コンテンツの返却、ログ記録、エラー処理、SSE通信などの機能をサポートし、テストとデバッグ用のCLIツールも含まれています。
Markdownifyは、PDF、画像、音声などのさまざまな形式やウェブページのコンテンツをMarkdown形式に変換することができる多機能ファイル変換サービスです。
mcp-hfspaceは、Hugging Face Spacesに接続するMCPサーバーで、画像生成、音声処理、ビジュアルモデルなど、さまざまなAI機能をサポートし、Claude Desktopとの統合を簡素化します。
MCPプロトコルに基づく抖音動画処理サーバーで、ノーウォーターマーク動画のダウンロード、音声の抽出、テキストの変換機能をサポートします。
小爱スピーカー音声通知ツールは、CLI/TUI/MCP/Webhookを介して小爱スピーカーに音声通知を送信することをサポートし、複数のスピーカールーティング、Dockerデプロイ、PM2常駐サービスを提供します。
MCPビデオダイジェストは、複数のプラットフォームから音声を抽出してテキストに変換するビデオコンテンツ処理サービスで、複数の文字起こしサービスを提供し、柔軟な設定と高い処理能力を備えています。
MLX Whisperをベースとした音声文字起こしMCPサーバーで、ローカルファイル、Base64オーディオ、YouTube動画の文字起こしに対応。AppleのMシリーズチップ用に最適化されています。
Zonos MCP統合プロジェクトはClaudeにテキスト読み上げ機能を提供し、Model Context Protocolを通じて直接音声を生成し、多言語と感情の口調設定に対応しています。
Edge-TTSに基づくMCP音声合成サーバー
OpenAIベースの音声AIサービスMCPサーバー
MCPプロトコルに基づくテキスト読み上げサーバープロジェクトで、Groq APIを使用して音声合成機能を実現し、様々なオーディオ形式の出力をサポートします。
SystemPrompt Coding Agentは、オープンソースプロジェクトで、ローカルワークステーションをMCPプロトコルでリモート制御可能なAIプログラミングアシスタントに変えます。音声コマンドとモバイル端末での操作をサポートし、異なる場所でのプログラミング管理を実現します。
MCPプロトコルに基づくAI音声通話システムで、VoIP技術を通じてClaudeなどのAIアシスタントが自動的に電話をかけ、スマートな会話を行えます。さまざまなSIPプロトコルとオーディオコーデックをサポートします。
macOS上のClaude Desktopに聴覚と視覚的な通知機能を提供する軽量級のMCPサーバーで、タスクの開始と終了時の音声とデスクトップ通知を含みます。
TeamSpeak MCPは、Model Context Protocolに基づくサーバー制御ツールで、ClaudeなどのAIモデルがTeamSpeak音声サーバーを管理できるように設計されています。ユーザー管理、チャンネル制御、権限設定などの包括的な操作をカバーする39種類の機能ツールを提供し、複数のデプロイ方法(PyPI/Docker/ローカル)をサポートして、TeamSpeakの自動管理を実現します。
このプロジェクトはTypecast APIのMCPサーバーを実装し、MCPクライアントに標準化された音声合成サービスのやり取り方法を提供します。
NijiVoice-MCPは開発中のプロジェクトで、にじボイス(Niji Voice)APIとのModel Context Protocol (MCP)統合を実現し、LLMがMCPインターフェースを通じてにじボイスの音声合成機能(音声生成、声優リスト取得、残高照会など)を簡単に呼び出せるようにします。
Votars MCP は、多言語対応のツールで、Votars AI プラットフォームと統合し、音声文字起こしと AI タスクを処理します。
Rime APIに基づくテキストを音声に変換するMCPサーバーで、システムオーディオ再生機能を提供します。