MiniMaxがオープンソースのマルチモーダルモデルH3を発表。複数の権威あるベンチマークで世界首位を獲得し、Hugging Faceトレンドランキングでも1位に。中国発オープンソースAIの多モーダル分野での強さを示した。公開24時間以内に100社以上のパートナーが適応接続を完了し、驚異的なエコシステムの爆発力を発揮。....
Mistral AIはオープンソースのコンテンツ監査モデルShieldstralを発表しました。パラメータ数は3Bで、Apache2.0ライセンスを使用し、12言語をサポートしています。単一の16GB GPUで動作可能です。7倍大きいモデルと同等の性能を持つとされ、マルチモーダル監査においてSOTAを達成したとされていますが、多くの保護モデルが被害カテゴリーシステムを固定化していると指摘しています。
バイトダンスのSeedチームが動画生成モデルSeedance 2.5を発表。音声と映像の同時生成「ワンショット動画」が特徴。生成時間は30秒に延長、複数回のシームレスな延長が可能に。長編ナラティブも強化。マルチモーダル参照と後編集を統合。映画、広告、教育など多分野でのAI動画制作を推進する。....
AIエージェントの長期的タスク実行時に必要な深層検索に対応するため、火山引擎は豆包検索サービスをリリース。企業・開発者向けに、多言語・マルチモーダル・多分野のWeb情報基盤を提供し、情報取得と信頼性管理を強化。構造化データやMarkdown原文を直接出力し、高精度なターゲット検索を実現します。....
騰訊雲コードアシスタントが提供するAIエージェントのオフィスツールで、多モーダルなタスク結果を自主的に計画して提供できます。
Gemini Omni Flashで駆動されるマルチモーダルAIビデオ生成器で、多様な形式の創作と編集をサポートします。
Omni AI Modelに基づくマルチモーダルAIビデオ生成器で、多様な形式の作成と編集に対応しています。
Wan 2.7は汎用マルチモーダルAIビデオ生成プラットフォームで、多信号制御とビデオの継続をサポートしています。
Google
$0.49
入力トークン/百万
$2.1
出力トークン/百万
1k
コンテキスト長
Openai
$2.8
$11.2
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$1
$10
256
$6
$24
Baidu
128
$2
$20
$4
$16
$8
$240
52
Sunbird
Sunflower-32BはSunbird AIによって開発された多言語大規模言語モデルで、ウガンダ地域の言語に特化して最適化されています。Qwen 3 - 32Bアーキテクチャに基づいて構築され、31種類のウガンダ言語と英語の翻訳およびテキスト生成タスクをサポートし、ウガンダ言語の翻訳精度で優れた結果を示しています。
Sunflower-14Bは、Sunbird AIによって開発された多言語大規模言語モデルで、ウガンダの言語に特化して設計されています。このモデルはQwen 3-14Bアーキテクチャに基づいて構築され、31種類のウガンダ語と英語の翻訳およびテキスト生成タスクをサポートし、複数の評価で優れた成績を収めています。
lmstudio-community
ダニシュタ2.0はHelpingAIによって開発された画期的な推論AIモデルで、多言語テキスト生成をサポートし、中間思考能力と多段階思考プロセスを備えています。
RedHatAI
Llama-4-ScoutはMetaが発表したLlama 4シリーズのモデルの1つで、混合エキスパート(MoE)アーキテクチャを採用し、ネイティブなマルチモーダルAIモデルで、テキストと画像の入力をサポートし、多言語テキスト理解とビジュアルタスクにおいて優れた性能を発揮します。このモデルは170億のパラメータと16のエキスパートを持ち、商用と研究用途に設計されています。
hirundo-io
Llama 4 ScoutはMetaが開発したネイティブマルチモーダルAIモデルで、多言語テキストと画像の理解をサポートし、ハイブリッドエキスパートアーキテクチャを採用しており、テキストと画像の理解において業界をリードする性能を持っています。
chutesai
Llama 4 MaverickはMetaが開発したネイティブマルチモーダルAIモデルで、ハイブリッドエキスパートアーキテクチャを採用し、テキストと画像の入力をサポートし、多言語のテキストとコードを出力します。
Undi95
Llama 4 MaverickはMetaが発表したマルチモーダルAIモデルで、テキストと画像の理解をサポートし、混合専門家アーキテクチャ(MoE)を採用しており、多言語テキストやコード生成タスクで優れた性能を発揮します。
meta-llama
Llama 4 MaverickはMetaが開発した170億パラメータのマルチモーダルAIモデルで、混合専門家アーキテクチャ(MoE)を採用し、多言語テキストと画像理解をサポート、128の専門家モジュールを備えています。
jiviai
AudioXはJivi AIが開発した多言語自動音声認識モデルで、特にインド南部の言語に最適化されており、タミル語、テルグ語、カンナダ語、マラヤーラム語をサポートしています。
apple
AIMv2はマルチモーダル自己回帰目標で事前学習された視覚モデルシリーズで、多くのマルチモーダル理解ベンチマークで優れた性能を発揮します。
AIMv2はマルチモーダル自己回帰目標事前学習に基づく視覚モデルシリーズで、多くの視覚タスクで優れた性能を発揮します。
AIMv2はマルチモーダル自己回帰目標で事前学習された視覚モデルシリーズで、多くのベンチマークテストで優れた性能を発揮
AIMv2はマルチモーダル自己回帰目標で事前学習された視覚モデルシリーズで、多くの視覚タスクで優れた性能を発揮します。
AIMv2はマルチモーダル自己回帰目標で事前学習された視覚モデルシリーズで、多くのベンチマークテストで優れた性能を発揮します。
unum-cloud
UFormは軽量なマルチモーダルAIモデルで、画像とテキストの多言語理解と生成をサポートします。このモデルは21種類の言語を共有ベクトル空間にマッピングし、最大256次元の埋め込みベクトルを生成し、効率的なパラメータ共有アーキテクチャとクロスプラットフォーム互換性を備えています。
speechbrain
Meta AIが開発した大規模多言語音声認識モデルで、60言語をサポートし、10億パラメータのTransformerエンコーダーアーキテクチャに基づいています。
AWS GCRが提供するMCPサーバーのサンプル集合で、リモートデスクトップ、ワークフローサービス、AI計画、時間サービス、HTMLレンダリングなどの多種の機能をカバーしています
MCPゴムダックは、モデルコンテキストプロトコル(MCP)に基づくサーバーで、複数のOpenAI互換のLLMを照会するためのブリッジとして機能します。ゴムダックデバッグ法のように、ユーザーが異なるAI「ダック」に問題を説明し、多様な視点からの回答を得ることができます。さまざまなAIプロバイダーをサポートし、会話管理、多モデル比較、コンセンサス投票、議論、反復最適化などの高度なツールを提供し、MCPブリッジ機能を通じて他のMCPサーバーに接続して機能を拡張することができます。
MindBridgeはAIモデルルーターサーバーで、複数のLLMプロバイダーをサポートし、スマートなモデルスケジューリングと協調を実現し、複雑な推論タスクや多モデルワークフローに適しています。
Ultra MCPは多モデルAIプロトコルサーバーで、統一的なMCPインターフェースを通じてOpenAIやGeminiなどのAIモデルを統合し、Claude CodeやCursorをサポートします。ゼロコンフィグインストール、組み込み使用分析ダッシュボード、最新のWebインターフェースなどの特徴があります。
MCP Server Notifierは、モデルコンテキストプロトコル(MCP)と統合された軽量な通知サービスで、AIエージェントがタスクを完了したときにWebhook通知を送信します。多くのWebhookプロバイダー(Discord、Slack、Teamsなど)をサポートし、画像サポート、多プロジェクト管理、カスタムメッセージなどの機能を提供し、AIツール(Cursorなど)と簡単に統合できます。
モデルコンテキストプロトコル(MCP)に基づく多エージェントAIインフラストラクチャで、標準化された通信層を提供し、ベクトルデータベース、ツール統合、および多エージェント協調をサポートします。インスペクターダッシュボード、Qdrantベクトルデータベース、およびDockerネットワークなどのコアコンポーネントが含まれています。
Unichat MCPサーバーは、TypeScriptで実装された多モデルチャットプロトコルサーバーで、MCPプロトコルを通じてOpenAI、MistralAIなどのAIプロバイダーにリクエストを送信でき、コードレビューやドキュメント生成などの事前定義されたプロンプト機能を提供します。