グーグルのAMIE医療AIシステムは、リアルタイム臨床動画問診において突破を達成し、患者の言葉、くしゃみ、歩き方など多様な情報を同時に収集可能なことで、専門家レベルの診断能力を示しました。このシステムはGeminiとProject Astraのアーキテクチャに基づいており、マルチエージェント協力モードを採用しています。これは医療AIがマルチモーダルな臨床実践に向かって重要な一歩となるものです。
Metaは300億パラメータのオープンソースマルチモーダルモデル「Muse Glimmer」を発表。Apache 2.0ライセンスで、ローカルエージェントワークフローに最適化され、多段階推論とツール呼び出し能力を強化。テキストと画像処理に対応。Llama 4以来初のモデル重み公開で、オープンソースAIエコシステムを推進。....
MiniMaxがオープンソースのマルチモーダルモデルH3を発表。複数の権威あるベンチマークで世界首位を獲得し、Hugging Faceトレンドランキングでも1位に。中国発オープンソースAIの多モーダル分野での強さを示した。公開24時間以内に100社以上のパートナーが適応接続を完了し、驚異的なエコシステムの爆発力を発揮。....
Mistral AIはオープンソースのコンテンツ監査モデルShieldstralを発表しました。パラメータ数は3Bで、Apache2.0ライセンスを使用し、12言語をサポートしています。単一の16GB GPUで動作可能です。7倍大きいモデルと同等の性能を持つとされ、マルチモーダル監査においてSOTAを達成したとされていますが、多くの保護モデルが被害カテゴリーシステムを固定化していると指摘しています。
騰訊雲コードアシスタントが提供するAIエージェントのオフィスツールで、多モーダルなタスク結果を自主的に計画して提供できます。
Gemini Omni Flashで駆動されるマルチモーダルAIビデオ生成器で、多様な形式の創作と編集をサポートします。
Omni AI Modelに基づくマルチモーダルAIビデオ生成器で、多様な形式の作成と編集に対応しています。
Wan 2.7は汎用マルチモーダルAIビデオ生成プラットフォームで、多信号制御とビデオの継続をサポートしています。
Openai
$2.8
入力トークン/百万
$11.2
出力トークン/百万
1k
コンテキスト長
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$1
$10
256
Baidu
128
$6
$24
$2
$20
$4
$16
Dogacel
これは、元のDeepSeek-OCRモデルをベースにした最適化バージョンで、Appleのメタルパフォーマンスシェーダー(MPS)とCPUでの推論をサポートするOCRモデルです。画像からテキストを抽出し、構造化された形式に変換することができ、多言語のドキュメント認識をサポートします。
sbintuitions
Sarashina2.2-Vision-3BはSB Intuitionsによって訓練された日本の大型ビジュアル言語モデルで、Sarashina2.2-3B-InstructとSigLIP画像エンコーダーに基づいて構築され、強力な画像からテキストへの変換能力を備え、日本語と英語の多モーダル処理をサポートします。
tencent
混元OCRは、混元の独自のマルチモーダルアーキテクチャによって駆動されるエンドツーエンドOCRの専門的なVLMモデルです。わずか10億パラメータの軽量設計で、複数の業界ベンチマークテストで最先端の成績を収めています。このモデルは、複雑な多言語ドキュメント解析に長けており、テキストの位置特定、オープンドメインの情報抽出、ビデオ字幕の抽出、画像の翻訳などの実際のアプリケーションシーンで優れた性能を発揮します。
mudasir13cs
これはGoogle Gemma - 3 - 4B - ITモデルを微調整したテキスト生成モデルで、デモンストレーションテンプレートのメタデータに基づいて多様で関連性のある検索クエリを生成するために特別に設計されています。このモデルはLoRAアダプタを使用して効率的に微調整されており、構造化文書のフィールド適応型密集検索フレームワークの重要な構成要素です。
yanolja
YanoljaNEXT-Rosetta-27B-2511はGemma3アーキテクチャをベースに微調整された270億パラメータのデコーダ言語モデルで、構造化データ翻訳に特化しており、データ構造を保持しながら多言語間で効率的かつ正確な翻訳を実現できます。
unsloth
Granite-4.0-H-350M-BaseはIBMが開発した軽量なデコーダ専用の言語モデルで、リソースが制限されたデバイス向けに設計されており、多言語のテキスト生成とコード補完機能をサポートしています。
Lamapi
Next 12Bは、Gemma 3に基づく120億パラメータのマルチモーダル視覚言語モデルで、トルコで最も先進的なオープンソースの視覚言語モデルです。このモデルは、テキストと画像の理解において優れた性能を発揮し、高度な推論とコンテキスト感知型のマルチモーダル出力能力を備えており、特に専門レベルのトルコ語サポートを提供し、同時に幅広い多言語能力も備えています。
thenexthub
これは多言語処理をサポートするマルチモーダルモデルで、自然言語処理、コード処理、音声処理などの複数の分野をカバーし、自動音声認識、音声要約、音声翻訳、ビジュアル質問応答などの様々なタスクを実行できます。
nvidia
NVIDIA-Nemotron-Nano-VL-12B-V2-FP8はNVIDIAが開発した量子化視覚言語モデルで、最適化されたTransformerアーキテクチャを採用し、商用画像で三段階のトレーニングを行っています。このモデルは単一画像の推論をサポートし、多言語およびマルチモーダル処理能力を備えており、画像要約、テキスト画像分析などの様々なシーンに適用できます。
NVIDIA Nemotron Nano v2 12B VLは強力なマルチモーダルビジュアル言語モデルで、多画像推論と動画理解をサポートし、文書インテリジェンス、ビジュアル質問応答、要約機能を備え、商用に使用できます。
MERaLiON
MERaLiON-SER-v1はパラメータ効率的な多言語音声感情認識モデルで、7種類の離散的感情カテゴリと連続的な感情次元値を同時に予測できます。このモデルはWhisper-Mediumエンコーダをベースに構築され、LoRA適応技術を採用し、多言語音声感情認識タスクで優れた性能を発揮します。
ibm-granite
Granite-4.0-350M-BaseはIBMが開発した軽量級のデコーダ専用言語モデルで、リソース制限のあるデバイス向けに設計されており、多言語のテキスト生成とコード補完機能をサポートしています。
Granite-4.0-1B-BaseはIBMが開発した軽量のデコーダ専用言語モデルで、リソースが制限されたデバイス向けに設計されており、多言語のテキスト生成とコード補完機能をサポートしています。
Granite-4.0-H-350M-BaseはIBMが開発した軽量なデコーダーのみの言語モデルで、リソースが制限されたデバイス向けに特別に設計されており、多言語のテキスト生成とコード補完機能をサポートし、スマートフォンやIoTデバイスで効率的に動作します。
Granite-4.0-H-1B-BaseはIBMが開発した軽量なデコーダー専用の言語モデルで、リソースが制限されたデバイス向けに設計されており、多言語のテキスト生成とコード補完機能をサポートしています。
inclusionAI
Ming-UniVisionは多モーダル大規模言語モデルで、初めて連続ビジュアル表現を次のトークン予測フレームワークに統合し、単一の自己回帰パラダイムの下でビジュアルと言語を統一し、離散量子化や特定モーダルのヘッドを必要としません。このモデルは連合画像理解と生成をサポートし、ビジュアル言語トレーニングでの収束速度がより速く、多輪コンテキストビジュアルタスクもサポートします。
numind
NuExtract 2.0は、NuMindによって開発された、構造化情報抽出に特化したマルチモーダルモデルです。テキストと画像の入力をサポートし、多言語処理能力を備えており、JSONテンプレートに基づいて入力内容から構造化情報を抽出することができます。
NuExtract 2.0は、NuMind社が構造化情報抽出タスク用に特別にトレーニングした一連のマルチモーダルモデルです。この4BバージョンはQwen2.5-VL-3B-Instructをベースに構築されており、テキストと画像の入力をサポートし、多言語処理能力を備え、非構造化データから構造化情報を抽出することができます。
Sunbird
Sunflower-32BはSunbird AIによって開発された多言語大規模言語モデルで、ウガンダ地域の言語に特化して最適化されています。Qwen 3 - 32Bアーキテクチャに基づいて構築され、31種類のウガンダ言語と英語の翻訳およびテキスト生成タスクをサポートし、ウガンダ言語の翻訳精度で優れた結果を示しています。
Sunflower-14Bは、Sunbird AIによって開発された多言語大規模言語モデルで、ウガンダの言語に特化して設計されています。このモデルはQwen 3-14Bアーキテクチャに基づいて構築され、31種類のウガンダ語と英語の翻訳およびテキスト生成タスクをサポートし、複数の評価で優れた成績を収めています。
AWS GCRが提供するMCPサーバーのサンプル集合で、リモートデスクトップ、ワークフローサービス、AI計画、時間サービス、HTMLレンダリングなどの多種の機能をカバーしています
MCPゴムダックは、モデルコンテキストプロトコル(MCP)に基づくサーバーで、複数のOpenAI互換のLLMを照会するためのブリッジとして機能します。ゴムダックデバッグ法のように、ユーザーが異なるAI「ダック」に問題を説明し、多様な視点からの回答を得ることができます。さまざまなAIプロバイダーをサポートし、会話管理、多モデル比較、コンセンサス投票、議論、反復最適化などの高度なツールを提供し、MCPブリッジ機能を通じて他のMCPサーバーに接続して機能を拡張することができます。
MindBridgeはAIモデルルーターサーバーで、複数のLLMプロバイダーをサポートし、スマートなモデルスケジューリングと協調を実現し、複雑な推論タスクや多モデルワークフローに適しています。
このプロジェクトはPythonベースの多MCPサーバー管理フレームワークで、SSEプロトコルを通じてGoogle Gemini APIとのやり取りを実現し、カレンダー管理とブラウザー自動化の2つの主要な機能モジュールを備えており、設定ファイルを通じて複数のサービスを動的にロードすることをサポートしています。
ThinkingCapはモデルコンテキストプロトコルに基づく多エージェント研究サーバーで、複数のLLMプロバイダーを並列で実行し、それらの応答を総合することで、包括的な多角的分析を実現します。
Ultra MCPは多モデルAIプロトコルサーバーで、統一的なMCPインターフェースを通じてOpenAIやGeminiなどのAIモデルを統合し、Claude CodeやCursorをサポートします。ゼロコンフィグインストール、組み込み使用分析ダッシュボード、最新のWebインターフェースなどの特徴があります。
Deep - CoはCompose Multiplatformをベースに開発されたクロスプラットフォームチャットクライアントで、OpenRouter、Anthropic、Grok、OpenAIなどの複数のLLM APIプロバイダをサポートし、OpenAI APIとローカルモデルと互換性があります。チャット履歴管理、プロンプト管理、ロール適合、TTSなどの機能を備え、多言語とテーマカスタマイズをサポートしています。
Pixeltableの多モーダルモデルコンテキストプロトコルサーバーセットで、音声、ビデオ、画像、ドキュメントのインデックスとクエリ機能を提供します。
MCP Server Notifierは、モデルコンテキストプロトコル(MCP)と統合された軽量な通知サービスで、AIエージェントがタスクを完了したときにWebhook通知を送信します。多くのWebhookプロバイダー(Discord、Slack、Teamsなど)をサポートし、画像サポート、多プロジェクト管理、カスタムメッセージなどの機能を提供し、AIツール(Cursorなど)と簡単に統合できます。
異なるLLMプロバイダーのプロンプトの効果をテストするためのMCPサーバーツールで、OpenAIとAnthropicのモデルの多輪対話と比較テストをサポートします。
モデルコンテキストプロトコル(MCP)に基づく多エージェントAIインフラストラクチャで、標準化された通信層を提供し、ベクトルデータベース、ツール統合、および多エージェント協調をサポートします。インスペクターダッシュボード、Qdrantベクトルデータベース、およびDockerネットワークなどのコアコンポーネントが含まれています。
Microsoft Graph APIを通じてClaudeにOutlookアクセス権を提供するMCPサーバーで、多アカウント管理、リモートデプロイ、および包括的なメール、カレンダー、フォルダー管理機能をサポートします。
Unichat MCPサーバーは、TypeScriptで実装された多モデルチャットプロトコルサーバーで、MCPプロトコルを通じてOpenAI、MistralAIなどのAIプロバイダーにリクエストを送信でき、コードレビューやドキュメント生成などの事前定義されたプロンプト機能を提供します。
FireCrawl MCPサーバーは、FireCrawlの高度なウェブページ収集機能を統合したモデルコンテキストプロトコルサービスで、JavaScriptレンダリング、多ビュー設定、スマートレート制限処理、および多様なコンテンツ形式の出力に対応しています。