マイクロソフト、自社開発の高精度画像AI「MAI-Image-2.5-Pro」を発表。GPUコスト最大84%削減。並列音声処理特化の「MAI-Voice-2-Flash」も公開。データはクリーンでトレーサブル、第三者モデルの蒸留に依存せず、製品ユーザー向けに設計。....
Googleマップのテストコードから、Geminiベースの「パーソナルインテリジェンス」フレームワークを統合し、Google Workspaceや個人データにアクセス可能に。アプリ間のデータ分断を解消し、会話型発見ツールで移動計画と個人情報のシームレスな連携を実現。Googleエコシステムのクロスアプリ一体体験を推進する。....
7月21日、Google DeepMindが中軽量AIモデル3種を発表。主力のGemini 3.6 Flashはコード・知識・マルチモーダル性能を強化し、トークン使用量17%削減で低コスト化。3.5 Flash-Liteは極限のコスパ、3.5 Flash Cyberはサイバーセキュリティ特化。全体で効率と実用化を推進。....
元OpenAI CTO率いるThinking Machines Labが初のゼロから訓練したマルチモーダルモデル「Inkling」を公開。MoEアーキテクチャ(総パラメータ975B、アクティブ41B)、100万トークンのコンテキスト、45兆トークンの事前学習を実施。画像・音声・動画対応で重みをオープンソース化。チームは豪華だが、推論・プログラミング性能は中国のオープンソース勢に及ばず。....
Codexデスクトップアプリケーションに可逆的なテーマを提供し、公式パッケージを変更せず、macOSとWindowsをサポートします。
テキストレンダリング、EC出図、UI探索に特化した高パフォーマンスなAI画像?動画生成ワークスペース。
TikpalはマルチエージェントのクリエイティブAIパートナーで、ノイズのないデザインで、複数のアプリケーションを統合し、クリエイティブな仕事を支援します。
AtriaはAI広告ワークフロープラットフォームで、マーケティング担当者が高いパフォーマンスを発揮する広告を作成するのを支援します。
Google
$0.49
入力トークン/百万
$2.1
出力トークン/百万
1k
コンテキスト長
Openai
$2.8
$11.2
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$1
$10
256
Baidu
128
$6
$24
$4
$16
$2
$20
Bytedance
$1.2
$3.6
4
PrimeIntellect
INTELLECT-3は1060億のパラメータを持つ混合専門家(MoE)モデルで、大規模な強化学習によって訓練されています。数学、コーディング、推論のベンチマークテストで卓越した性能を発揮し、モデル、訓練フレームワーク、環境はすべて緩やかなライセンス契約でオープンソース化されています。
MuXodious
Gemma 3n E4B ITは、Googleが開発した軽量マルチモーダルオープンモデルで、Geminiモデルと同じ研究に基づいて構築されています。このモデルは、テキスト、オーディオ、ビジュアル入力をサポートし、様々なタスクに適用できます。MatFormerアーキテクチャを採用して、効率的なパラメータ利用を実現しています。
pramjana
Qwen3-VL-4B-Instructはアリババが開発した40億パラメータの視覚言語モデルで、Qwen3アーキテクチャに基づいて開発され、マルチモーダル理解と対話タスクをサポートします。このモデルは強力な画像理解とテキスト生成能力を備え、複雑な視覚言語対話シーンを処理することができます。
ExaltedSlayer
Gemma 3はGoogleが開発した軽量オープンソースのマルチモーダルモデルです。このバージョンは12Bパラメータの命令調整量子化感知トレーニングモデルで、MLXフレームワークのMXFP4形式に変換されています。テキストと画像の入力をサポートし、テキスト出力を生成します。128Kのコンテキストウィンドウと140種類以上の言語をサポートしています。
black-forest-labs
FLUX.2 [dev] は320億のパラメータを持つ補正フロートランスフォーマーモデルで、画像生成、編集、および合成タスクに特化しています。このモデルは、テキストから画像への生成、単一参照編集、および多参照編集においてリーディングレベルであり、微調整なしでキャラクター、オブジェクト、およびスタイルの参照を実現し、個人、科学、および商業用途をサポートします。
mradermacher
これはwexyyyyyy/Ru-Gemma3-1Bモデルの静的量子化バージョンで、ロシア語と英語をサポートし、対話とテキスト生成タスク用に特別に設計されています。このモデルは、さまざまなハードウェア構成とパフォーマンス要件に適した複数の量子化バージョンを提供します。
Nanbeige
楠米色4-3B-思考-2511は楠米色シリーズの最新の強化バージョンで、高度な蒸留技術と強化学習による最適化を通じて、コンパクトな3Bパラメータ規模で強力な推論能力を実現しています。このモデルはArena-Hard-V2やBFCL-V4などのベンチマークテストで、パラメータが32B未満のモデルの中で最先端(SOTA)の成果を達成しています。
ai-sage
GigaChat3-10B-A1.8BはGigaChatシリーズの対話モデルで、混合専門家(MoE)アーキテクチャに基づいており、合計100億のパラメータがあり、そのうち18億がアクティブなパラメータです。このモデルは、マルチヘッド潜在注意力と多トークン予測技術を採用しており、25.6万トークンの長文脈をサポートし、多言語対話と推論タスクで優れた性能を発揮します。
GigaChat3-10B-A1.8B-baseはGigaChatシリーズの基礎事前学習モデルで、混合エキスパート(MoE)アーキテクチャを採用し、総パラメータは100億、アクティブなパラメータは18億です。モデルはマルチヘッド潜在的注意機構(MLA)と多トークン予測(MTP)技術を統合し、推論時に高いスループットの利点を持ちます。
tencent
混元OCRは、混元の独自のマルチモーダルアーキテクチャによって駆動されるエンドツーエンドOCRの専門的なVLMモデルです。わずか10億パラメータの軽量設計で、複数の業界ベンチマークテストで最先端の成績を収めています。このモデルは、複雑な多言語ドキュメント解析に長けており、テキストの位置特定、オープンドメインの情報抽出、ビデオ字幕の抽出、画像の翻訳などの実際のアプリケーションシーンで優れた性能を発揮します。
これはManoghn/voicecraft-mistral-7bモデルの静的量子化GGUFバージョンで、Mistral-7Bアーキテクチャに基づいており、コンテンツ生成とテキスト生成タスクに特化しています。このバージョンでは、2.8GBから14.6GBまでのさまざまな量子化レベルが提供されており、ユーザーはハードウェア条件とパフォーマンス要件に応じて適切なバージョンを選択できます。
abr-ai
これはApplied Brain Research(ABR)によって開発された、状態空間モデル(SSM)に基づく英語の自動音声認識モデルです。約1900万のパラメータを持ち、英語の音声を効率的かつ正確にテキストに変換することができます。このモデルは複数のベンチマークデータセットで優れた性能を発揮し、平均単語誤り率はわずか10.61%です。リアルタイム音声認識をサポートし、低コストのハードウェアで動作することができます。
NyxKrage
Moondream 3 Preview HFは、HuggingFace Transformersアーキテクチャの仕様に基づいてMoondream 3 (Preview)モデルを再実装したもので、Hugging Faceのエコシステムと完全に互換性があります。これはマルチモーダルビジュアル言語モデルで、エキスパート混合(MoE)テキストバックボーンを採用し、約90億のパラメータと20億のアクティブパラメータを持ちます。
HIT-TMG
Uni-MoE 2.0-Omniは、ライチ科技(Lychee)が発表した完全オープンソースの全モーダリティモデルで、全モーダリティ3D RoPEと動的容量エキスパート混合アーキテクチャを採用し、言語を中心としたマルチモーダリティ理解、推論、生成能力を大幅に向上させました。このバージョンには、全モーダリティ理解とオーディオおよび画像生成能力が統合されています。
DavidAU
これは、Qwen3-VL-8B-Thinkingモデルをベースにした強化版のマルチモーダルビジュアル言語モデルです。Brainstorm 20x技術を用いて12Bパラメータに拡張され、NEO Imatrixで強化されたGGUF量子化が適用されています。このモデルは、画像理解、テキスト生成、マルチモーダル推論の能力が強く、ビジュアル感知、テキスト品質、クリエイティブなシーンでの性能が著しく向上しています。
ggml-org
これはQwen3-VL-30B-A3B-Instructモデルを変換したGGUF形式のバージョンで、llama.cpp用に最適化されています。このモデルは300億パラメータのマルチモーダル視覚言語モデルで、画像理解とテキスト生成タスクをサポートします。
noctrex
これはMistralアーキテクチャに基づく画像テキストをテキストに変換する量子化モデルで、パラメータ規模は24Bで、指令追従タスクに特化して最適化訓練され、マルチモーダル入力処理をサポートしています。
このプロジェクトは、Qwen3-Coder-30B-A3B-InstructモデルをMXFP4_MOE量子化した成果物で、コンテキストサイズを256kから1Mに拡張し、コード生成やプログラミングタスクに最適化されたモデルバージョンを提供し、パフォーマンスの向上とリソースの節約に価値があります。
lmstudio-community
Qwen3-VL-2B-ThinkingはQwenによって開発された視覚言語モデルで、2Bのパラメータ規模を持ち、MLXを使用して8ビット量子化が行われ、Apple Siliconチップに特化した最適化が施されています。このモデルは画像とテキストのマルチモーダル理解と生成タスクをサポートしています。
unsloth
JanusCoder-14Bは、Qwen3-14Bをベースに構築された14Bパラメータのオープンソース基礎モデルで、コードインテリジェンスに統一されたビジュアルプログラミングインターフェイスを構築することを目的としています。このモデルはJANUSCODE-800Kマルチモーダルコードコーパスで学習され、さまざまなビジュアルプログラミングタスクを統一的に処理することができます。
uniprofは、CPUパフォーマンス分析を簡素化するツールで、複数のプログラミング言語とランタイムをサポートし、コードの変更や依存関係の追加なしに、Dockerコンテナまたはホストモードでワンクリックでパフォーマンスプロファイリングとホットスポット分析を行うことができます。
OpenZeppelin Contracts Wizardはインタラクティブなスマートコントラクト構築ツールで、ユーザーがコントラクトタイプ、パラメータ、機能を選択することで、OpenZeppelinコンポーネントに基づくコントラクトコードを生成できます。複数のプログラミング言語をサポートし、APIと埋め込み機能を提供します。
MCP - PostgreSQL - Opsは、専門的なPostgreSQLデータベース操作と監視用のMCPサーバーです。PostgreSQL 12 - 17バージョンをサポートし、包括的なデータベース分析、パフォーマンス監視、スマートなメンテナンス提案を提供し、自然言語クエリによるデータベース管理を実現します。
React Nativeの専門開発支援ツールで、インテリジェントなコード分析、エキスパートレベルの自動修正、セキュリティ監査、パフォーマンス最適化を提供し、本番環境レベルのコード修正とリファクタリングをサポートします。
Bazel MCPサーバーは、MCPプロトコルをサポートするAIエージェントがBazelビルドシステムの機能にアクセスできるようにするローカルサービスです。MCP環境でコマンドラインツールが不足しているか、環境設定が誤っているためにBazelが使用できない問題を解決し、ビルド、クエリ、テストなどの核心機能を提供し、ワークスペースパスの動的な設定をサポートします。
パズルボックスは、MCPプロトコルに基づくサーバーで、マルチエージェントシステム内の有限状態機械(「パズル」と呼ばれます)を管理および調整するために使用され、動的リソースのサブスクライブと状態の更新をサポートします。
グリゴリは、MCPプロトコルを通じて開発者がプログラミング規約、アーキテクチャパターン、および開発の好みを管理および組織するのを支援するデスクトップアプリケーションです。これにより、AIプログラミングアシスタントがカスタマイズされたコーディングコンテキストにアクセスできるようになります。
RustベースのMCPサーバーで、深いコードインテリジェント分析を提供し、16種類のプログラミング言語のシンボル抽出、セマンティック検索、セキュリティ分析、サプライチェーンセキュリティなどの機能をサポートし、プライバシーとパフォーマンスに重点を置いています。
ライトハウスMCPサーバーは、Google Lighthouseに基づくモデルコンテキストプロトコルサーバーで、包括的なウェブサイトのパフォーマンス監査と分析機能を提供します。パフォーマンススコア、アクセシビリティチェック、SEO分析、セキュリティ評価などを含みます。
Tailpipe MCPサーバーはAI駆動のログ分析ツールで、モデルコンテキストプロトコルを通じてAIアシスタントとクラウド/SaaSログデータを接続し、自然言語によるクエリと分析をサポートし、セキュリティイベント調査、コストとパフォーマンスの洞察などの機能を提供します。
コミュニティによって維持されているMongoDB MCPサーバーで、MongoDBデータベースへの読み取り専用アクセスを提供し、コレクションスキーマのチェックと集計パイプラインの実行をサポートします。
Agent Farm v3.4は、AIエージェントの進化と並列タスク実行に基づくシステムで、ツール強化エージェントを通じてタスクを処理します。新しいバージョンではチャンク書き込みモードが導入され、大規模なドキュメントとコードファイルの並列生成をサポートし、パフォーマンスが8.6倍向上します。また、ローカルモデルを使用して結果を合成するため、クラウドトークンに依存する必要がありません。
パンドラのシェルはMCPサーバープロジェクトで、AIアシスタントがユーザーのシステム上でターミナルコマンドを実行できます。制御された環境で慎重に使用する必要があります。
クロード・エージェンツパワーは、ユーザーのプロジェクトを分析し、100種類以上の専門ロールから最適なチーム構成を提案するインテリジェントなMCPサーバープロジェクトです。多言語に対応しており、技術、データ、プロダクト、マーケティング、オペレーション、財務、人事、管理職などの様々な専門ロールのエージェントを提供し、自動的にダウンロードしてクロードに統合して使用できます。
LinuxCTSは総合テストスクリプトで、Linuxシステムのパフォーマンス、設定、機能の完全性を迅速に検出するために使用され、システム情報、パフォーマンステスト、ネットワーク検出、サービスチェックなどの機能が含まれています。
阿里云オブザーバビリティMCPサービスは、阿里云ログサービスSLS、アプリケーションリアルタイムモニタリングサービスARMSなどの製品にアクセスするための一連のツールを提供し、自然言語をクエリに変換、ログ分析、パフォーマンスモニタリングなどの機能をサポートします。
このプロジェクトはMCPプロトコルを通じてSparkコードのAIインテリジェント最適化を実現し、コード最適化提案とパフォーマンス分析サービスを提供します。
NPM MCPは、npmパッケージマネージャー用のモデルコンテキストプロトコルサーバーで、パッケージの検索、セキュリティチェック、バージョン比較、および互換性検証などの機能を提供し、Cursor AIまたはClaude Desktopでの使用をサポートしています。
ThemeParks.wiki APIのMCPサーバーで、テーマパークのデータ照会機能を提供します。
Umami Analytics MCPサーバーは、Claudeの機能を強化するモデルコンテキストプロトコルサーバーで、Umamiのウェブサイト分析データへのアクセスを提供し、ユーザー行動分析とウェブサイトのパフォーマンス追跡をサポートします。