【AI日報】へようこそ!ここは毎日に人工知能の世界を探るガイドです。毎日、AI分野の注目情報をご提供し、開発者に焦点を当てて技術トレンドを理解し、革新的なAI製品の応用を学んでいただきます。新着AI製品についてはこちらからご確認ください:https://app.aibase.com/zh1、ボルカノエンジンが正式にドウバオ検索オープンサービスをリリースしました。スマートエージェントの長期的なタスクに必要な深い情報支援を提供し、同様に
腾讯の企業向けWeChat AIアシスタント「大圆」が内部テスト開始。スマホのサイドハンドルスライドで起動、PCではサイドバーからアクセス可能で、アプリ切り替え不要。「爬楼」機能では、グループチャットの要点自動抽出、音声メッセージの要約、会話に基づくコンテンツ生成が可能。日々のオフィス業務をワンストップで処理。....
スマートオフィスプラットフォーム「Qwen Office」はすでにベータテストを開始しました。プロフェッショナル向けのAI協働中枢として位置づけられています。タスクから納品までを初めて6つの核心機能を提供し、企業向けIM協働、Officeの一貫した生成編集、マルチモーダル理解生成、フルスタックウェブ配信、専門的なデータソース集約およびスキルマーケットが含まれます。これらはHR、弁護士、財務などの職種に特化した作業キットをカバーしています。
7月24日、アリババは0.8Bパラメータの文書解析モデルOvisOCR2をオープンソース化。OmniDocBenchで96.58点を獲得しトップに立ち、従来のパイプラインを初めて全面的に上回り、文書インテリジェンスのパラダイムシフトを推進。....
オンラインAIテキストを音声に変換し、14000種類以上のリアルな声があり、キャラクターのボイスオーバーや音声クローンなどに対応しています。
オープンソースの家庭用サーバーオペレーティングシステムで、ワンクリックで200以上のアプリケーションをインストールでき、AIアシスタントのLivがあり、任意のブラウザからアクセスできます。
reOSは顧客研究用のオペレーティングシステムで、研究を計画し、インタビューを実施し、フィードバックを分析し、洞察を追跡することができます。
Edはユーザーに株式とデジタル資産に関するアドバイスを提供し、ユーザーのポートフォリオを把握し、無料の診断を提供します。
Openai
$2.8
入力トークン/百万
$11.2
出力トークン/百万
1k
コンテキスト長
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
Google
$0.7
$7
$35
$2.1
$17.5
$21
Alibaba
$1
$10
256
$6
$24
$2
$20
$4
$16
$8
$240
52
Bytedance
$1.2
$3.6
4
ExaltedSlayer
Gemma 3はGoogleが開発した軽量オープンソースのマルチモーダルモデルです。このバージョンは12Bパラメータの命令調整量子化感知トレーニングモデルで、MLXフレームワークのMXFP4形式に変換されています。テキストと画像の入力をサポートし、テキスト出力を生成します。128Kのコンテキストウィンドウと140種類以上の言語をサポートしています。
bartowski
これはTheDrummerのSnowpiercer-15B-v4モデルの量子化バージョンで、llama.cppとimatrix技術を使用して量子化処理されています。このバージョンはBF16からIQ2_Sまでの多くの量子化レベルを提供し、さまざまなハードウェア条件とパフォーマンス要件を持つユーザーのニーズを満たします。モデルは特定のデータセットを使用してキャリブレーションと最適化が行われ、ARMとAVXハードウェアでのパフォーマンスを向上させるためのオンライン再パッケージング機能をサポートしています。
jayn7
騰訊の混元ビデオ1.5モデルの量子化GGUFバージョンで、テキストから動画生成タスクに特化しており、720P高画質動画生成をサポートし、使用効率を最適化するための複数の量子化精度バージョンを提供します。
このプロジェクトは、テンセントの混元ビデオ1.5のテキストから動画へのモデルの量子化GGUFバージョンを提供し、480P動画生成タスクをサポートします。蒸留モデルと完全モデルの2つのバージョンが含まれており、ComfyUI - GGUFなどのツールと連携して使用できます。
騰訊の混元ビデオ1.5モデルの量子化GGUFバージョンで、画像を動画に変換するタスクや動画生成タスクに特化しています。480P解像度の蒸留モデルと標準モデルを提供し、Q4_K_S、Q8_0、FP16などの複数の量子化精度をサポートします。
allenai
Olmo 3はAllen Institute for AIによって開発されたオープンソースの言語モデルシリーズで、7Bと32Bの2種類の規格があり、指令(Instruct)と思考(Think)の2種類のバリエーションに分かれています。このモデルは卓越した長鎖思考能力を持ち、数学やコーディングなどの推論タスクのパフォーマンスを大幅に向上させることができます。
これはp-e-w/gpt-oss-20b-hereticモデルの量子化バージョンで、llama.cppのimatrix技術を使用して量子化処理が行われています。このモデルは200億パラメータの大規模言語モデルで、高品質から低品質まで様々な量子化オプションを提供し、ファイルサイズは41.86GBから11.52GBまでで、さまざまなハードウェア条件に適しています。
DevQuasar
MiroThinker-v1.0-72Bは72Bパラメータの大規模言語モデルの量子化バージョンで、知識を誰もが利用できるようにすることを目指しています。このプロジェクトはオリジナルモデルを最適化し、より効率的な推論性能を提供します。
これはPrecog-123B-v1モデルのllama.cpp量化バージョンで、さまざまなハードウェア構成と使用シナリオのニーズに応えるために、複数の量化タイプを提供しています。このモデルは1230億のパラメータを持つ大型言語モデルで、最適化されているため、さまざまなハードウェアで効率的に動作します。
mradermacher
UME-R1-7Bの静的量子化バージョンで、文の類似度、埋め込み、ゼロショット画像分類、ビデオテキストからテキストへの変換などの複数のタスクをサポートします。軽量なQ2_Kから高品質なQ8_0まで、さまざまな量子化タイプを提供し、さまざまなニーズに対応します。
Olmo 3は、Allen Institute for AI (Ai2)によって開発された全く新しい32Bパラメータの言語モデルファミリーで、Base、Instruct、Thinkなどのバリエーションが含まれています。このモデルはDolma 3データセットを基に訓練され、65,536の長文脈処理をサポートし、言語モデル科学の発展を推進することを目的としています。モデルは完全にオープンソースで、Apache 2.0ライセンスに従っています。
unsloth
Qwen3-VLは通義シリーズで最も強力なビジュアル言語モデルで、テキスト理解と生成、ビジュアル認知と推論、コンテキスト長、空間およびビデオの動的理解、エージェントインタラクション能力などの面で全面的にアップグレードされています。このモデルは密集アーキテクチャとハイブリッドエキスパートアーキテクチャを提供し、エッジデバイスからクラウドまでの柔軟なデプロイをサポートします。
Qwen3-VLはQwenシリーズの中で最も強力なビジュアル言語モデルで、卓越したテキスト理解と生成能力、深いビジュアル認知と推論能力、長いコンテキストサポート、強力な空間とビデオ動的理解能力、そして優れたエージェントインタラクション能力を備えています。このバージョンは2Bパラメータの思考強化版で、推論能力が特別に最適化されています。
SadraCoding
SDXL-Deepfake-Detectorは、AI生成顔を正確に検出するツールで、デジタル世界の真実性を維持することに特化し、視覚的な虚偽情報に対抗するためのプライバシー保護とオープンソースのソリューションを提供します。このモデルは、事前学習モデルを微調整することで、軽量かつ高精度な検出を実現します。
Qwen
Qwen3-VLは通義シリーズで最も強力な視覚言語モデルで、優れたテキスト理解と生成能力、深い視覚感知と推論能力、長文脈サポート、強力な空間およびビデオ動的理解能力、ならびにエージェントインタラクション能力を備えています。このリポジトリはGGUF形式の重みを提供し、CPU、GPUなどのデバイスでの効率的な推論をサポートします。
Qwen3-VLはアリババが開発した最新世代のビジュアル言語モデルで、テキスト理解、ビジュアル認知、空間理解、ビデオ分析、エージェントインタラクションなどの分野で著しい向上が見られます。このモデルはマルチモーダル入力をサポートし、強力な推論能力と長文脈処理能力を備えています。
本プロジェクトはQwen3-VL-32B-Instructモデルに基づくllama.cpp GGUF量子化バージョンで、様々な量子化タイプを提供して異なるハードウェアと性能要件を満たします。特定のデータセットとimatrixオプションを組み合わせて量子化を行い、量子化の品質を保証し、ARMとAVXマシンの性能を向上させるためにオンラインで重みを再パッケージ化することをサポートします。
Gemma 3 27B IT QATのMLX MXFP4量子化バージョンで、Googleによって開発された軽量オープンソースのマルチモーダルモデルです。このモデルは、テキストと画像の入力を同時に処理し、テキスト出力を生成することができ、128Kの大規模コンテキストウィンドウを持ち、140種類以上の言語をサポートし、さまざまなテキスト生成と画像理解タスクに適しています。
Granite-4.0-H-350MはIBMが開発した軽量指令モデルで、350Mのパラメータを持ち、多言語処理と指令遵守において優れた性能を発揮し、デバイス端末デプロイと研究シナリオ向けに設計されています。
noctrex
LightOnOCR-1B-1025の量子化バージョンで、画像からテキストへの変換タスクに特化しており、文書理解やビジュアル言語処理などの分野で広く利用されています。このモデルは複数の欧州言語をサポートし、OCR、PDF処理、表認識などのシナリオに適しています。
assistant-uiは、生産レベルのAIチャットインターフェイスを迅速に構築するためのオープンソースのTypeScript/Reactライブラリで、組み合わせ可能なUIコンポーネント、ストリーミング応答、アクセシビリティなどの機能を提供し、複数のAIバックエンドとモデルをサポートしています。
Refact AgentはオープンソースのAIプログラミングアシスタントで、多言語のコード生成、デバッグ、最適化をサポートし、主流の開発ツールと統合し、ローカルにデプロイでき、スマートなコード補完とコード解釈機能を提供します。
データベース用MCPツールボックスは、オープンソースのデータベースMCPサーバーで、企業向けおよび本番環境の品質に特化しており、ツール開発を簡素化し、コネクションプールや認証などの複雑な機能を提供します。
OpenDiaはオープンソースのブラウザ拡張ツールで、AIモデルが直接ユーザーのブラウザを制御でき、既存のログイン状態、ブックマークなどのデータを利用して自動化操作を行います。複数のブラウザとAIモデルをサポートし、プライバシー保護に配慮しています。
MCPアトラシアンは、アトラシアンの製品(ConfluenceとJira)用に設計されたモデルコンテキストプロトコルサーバーで、クラウドとオンプレミスの両方のデプロイをサポートし、AIアシスタントの統合機能を提供します。
MCP Unityは、Model Context Protocolを実装したUnityエディター拡張で、Node.jsサーバーを通じてAIアシスタントとUnityプロジェクトのインタラクションを橋渡しし、メニュー実行、オブジェクト選択、コンポーネント更新などの機能を提供します。
自然言語でDockerを管理するMCPサーバーで、コンテナのオーケストレーション、デバッグ、データ管理をサポートします。
これはWeb3モデルコンテキストプロトコル(MCP)サーバーの精選リストで、チェーンのやり取り、取引、DeFi、市場データ、ツール、ソーシャルなどの複数のカテゴリをカバーしています。MCPは、アプリケーションがLLMにコンテキストを提供する方法を標準化するオープンプロトコルで、AIアプリケーションのUSB - Cポートのようなものです。DeMCPは最初の分散型MCPネットワークで、エージェントに独自開発およびオープンソースのMCPサービスを提供し、暗号通貨による支払いをサポートし、TEEとブロックチェーンレジストリを組み合わせてMCPのセキュリティと信頼性を再定義しています。
MaverickMCPはFastMCP 2.0に基づく個人株式分析サーバーであり、Claude DesktopなどのMCPクライアントに専門レベルの金融データ分析、技術指標計算、ポートフォリオ最適化ツールを提供する。これは520株のスタンダード500株データを事前に設定し、複雑な認証なしでローカルに実行できるように、さまざまな技術分析戦略と並列処理をサポートしています。
これは、MCPコード実行モードを実現するサーバーで、単一ツールブリッジとゼロコンテキスト発見メカニズムを通じて、MCPツールの呼び出しオーバーヘッドを数万トークンから約200トークンに削減し、ルートコンテナ内で安全にPythonコードを実行し、データサイエンスとセキュリティ隔離をサポートします。
Awesome MCP Serversは、包括的なモデルコンテキストプロトコル(MCP)サーバーの集合で、7158個のMCPサーバーがAI統合、アートメディア、ブラウザ自動化、クラウドサービス、データベース、開発者ツール、ファイルシステム、金融、ゲーム、ハードウェア、医療、インフラストラクチャ、知識管理、位置マップ、マーケティング、監視、マルチメディア処理、オペレーティングシステム、プロジェクト管理、科学研究、セキュリティ、ソーシャルメディア、旅行交通、ユーティリティツール、バージョン管理など33のカテゴリに分けられています。
オーバーシーアはMCPを通じてAIエージェントにタスク編成を提供するシステムで、SQLiteを使用したデータ保存とネイティブのVCSサポート(jj - lib + gix)を備え、タスク階層管理、学習記録の伝達、可視化インターフェースをサポートします。
クライオMCPは、クライオブロックチェーンデータ抽出ツールに基づくモデル完了プロトコルサーバーで、APIを通じてブロックチェーンデータにアクセスする機能を提供し、SQLクエリと複数のデータ形式出力をサポートします。
Markdown内容をインタラクティブなマインドマップに変換するMCPサーバーで、複数のインストール方法をサポートし、柔軟な返却形式オプションを提供します。
XiYan MCPサーバーは、XiYan-SQLに基づくモデルコンテキストプロトコルサーバーで、自然言語でデータベースをクエリすることをサポートし、複数のLLMモデルの統合とローカルデプロイオプションを提供します。
adb - mcpは、MCPプロトコルを通じてLLMにインターフェースを提供し、Adobeツール(PhotoshopやPremiereなど)を制御するAIエージェントを作成する概念実証プロジェクトです。このプロジェクトには、MCPサーバー、Nodeコマンドプロキシサーバー、およびAdobeアプリケーションプラグインが含まれており、自然言語の命令でAdobeソフトウェアを操作でき、画像およびビデオ編集の自動化に適しています。
ReActMCP Web Searchは、Exa APIを統合したMCPサーバーで、AIアシスタントにリアルタイムのウェブ検索機能を提供し、基本検索と高度なフィルタオプションをサポートし、Markdown形式の結果を返します。
HiMarketは即座に利用可能な企業向けAIオープンプラットフォームソリューションで、管理バックエンド、開発者ポータル、AIゲートウェイの3つの核心コンポーネントを提供し、モデルサービス、MCP ServerなどのAI機能を標準化されたAPI製品にパッケージ化して公開することをサポートします。
Quarkus Model Context Protocol (MCP) Serverは、宣言的およびプログラム的APIを通じてLLMアプリケーションと外部データソースおよびツールを簡単に統合できるオープンソースプロトコルサーバーです。
Aider MCPサーバーは、AIコーディングタスクをAiderにオフロードし、開発効率と柔軟性を向上させるための実験的なモデルコンテキストプロトコルサーバーです。