バイチューティアSeedチームと香港科技大学が共同でMMProLongモデルを発表しました。Qwen2.5-VLに基づき、長文処理の効率においてマルチモーダル大規模言語モデルの新たな突破を達成しました。研究では、データの構造が長文の理解力に与える影響が鍵であることが明らかにされ、従来のトレーニング手法を打ち破り、現在のLMMトレーニングにおける課題に直接対応することになりました。
アリのQwen3-VLとQwen2.5-VLが空間推論ベンチマークSpatialBenchで1位(13.5点)と2位(12.9点)を獲得。Gemini3.0Pro(9.6点)とGPT-5.1(7.5点)を大きく上回り、人間の基準80点に接近。3D検出能力を強化し、遮蔽シーンで18%向上。....
LLaVA-OneVision-1.5が発表され、画像・動画処理可能なマルチモーダルモデルに進化。オープンなトレーニングフレームワークを提供し、3段階の訓練プロセスで高品質なモデル構築を可能に。....
アリババのQwenチームは、GUI自動化の課題解決に向け、Mobile-Agent-v3とGUI-Owlを発表。Qwen2.5-VLベースのGUI-Owlは、マルチモーダルモデルと大量のGUIデータで訓練され、従来の制約を突破しました。....
Qwen2.5-VLは、画像や動画の内容を理解し、それに対応するテキストを生成できる強力なビジョン言語モデルです。
Alibaba
$0.8
入力トークン/百万
$2
出力トークン/百万
128
コンテキスト長
$8
-
32
AhmedZaky1
DIMIアラビア語OCR v2は、アラビア語のテキスト認識に特化して最適化された光学式文字認識モデルです。Qwen2.5-VL-7B-Instructをベースに微調整して開発され、v1バージョンに比べて変音符が密集したテキストの処理能力が大幅に向上しています。
allenai
olmOCR-2-7B-1025のFP8量子化バージョンで、Qwen2.5-VL-7B-Instructをベースに微調整され、数式や表などの複雑なOCRシーンを処理するためのビジョン言語モデルです。
numind
NuExtract 2.0は、NuMind社が構造化情報抽出タスク用に特別にトレーニングした一連のマルチモーダルモデルです。この4BバージョンはQwen2.5-VL-3B-Instructをベースに構築されており、テキストと画像の入力をサポートし、多言語処理能力を備え、非構造化データから構造化情報を抽出することができます。
OpenGVLab
VideoChat-R1_5-7BはQwen2.5-VL-7B-Instructをベースに構築されたビデオテキストインタラクションモデルで、マルチモーダルタスクをサポートし、特にビデオ質問応答機能に長けています。このモデルは強化微調整により時空間知覚能力を強化し、反復知覚メカニズムを採用してマルチモーダル推論を強化しています。
TIGER-Lab
本プロジェクトはQwen2.5-VL-7B-Instructモデルに基づいており、視覚質問応答タスクに特化しており、画像に関連する質問に正確に回答でき、高い正確性と関連性を備えています。これはマルチモーダル視覚言語モデルであり、画像理解と画像に基づく質問応答インタラクションをサポートします。
Barth371
これは unsloth/qwen2.5-vl-72b-instruct-bnb-4bit モデルをベースに微調整された視覚言語モデルで、Unsloth と Huggingface TRL ライブラリを使用して最適化訓練され、訓練速度は従来方式に比べて2倍に向上しています。
TencentARC
ARC-Qwen-Video-7Bは、騰訊ARCラボが開発した現実世界の短動画を理解するためのマルチモーダルモデルで、Qwen2.5-VL-7B-Instructをベースに構築され、音声と動画の同期分析と理解をサポートしています。
Qwen2.5-VL-7B-Instructはアリババの通義千問チームによって開発されたマルチモーダル視覚言語モデルで、70億のパラメータ規模に基づき、視覚的質問応答タスクに特化して最適化トレーニングが行われています。このモデルは画像内容を理解し分析し、正確な自然言語の回答を生成することができます。
lmms-lab
LLaVA-OneVision-1.5は、完全にオープンソースの一連の大型マルチモーダルモデルで、ネイティブ解像度の画像でトレーニングすることで、低コストで高度な性能を実現しています。このモデルは、複数のマルチモーダルベンチマークテストで卓越した性能を発揮し、Qwen2.5-VLなどの競合モデルを上回っています。
nvidia
NVIDIA Qwen2.5-VL-7B-Instruct-FP4は、アリババのQwen2.5-VL-7B-Instructモデルの量子化バージョンで、最適化されたTransformerアーキテクチャを採用し、マルチモーダル入力(テキストと画像)をサポートし、さまざまなAIアプリケーションシナリオに適しています。このモデルはTensorRT Model Optimizerを使用してFP4量子化され、NVIDIA GPU上で効率的な推論性能を提供します。
これはQwen2.5-VL-7B-Instructをベースに微調整されたFP8量子化バージョンのOCRモデルで、ドキュメント画像のテキスト認識に特化しており、効率的な大規模ドキュメント処理をサポートします。
chatpig
Qwen2.5-VL-7B-IT-GGUFは強力なマルチモーダルモデルで、テキストと画像からテキストを生成するタスクをサポートし、テキストエンコーディング能力を備え、さまざまなツールと互換性があります。
UCSC-VLAA
MedVLThinker-7B-RL_m23kはQwen2.5-VLに基づく医学ビジュアル言語モデルで、70億のパラメータを持ち、強化学習を利用してMed23kデータセットで訓練され、医学画像とテキストの相互作用タスクを専門に処理するために設計されています。
mradermacher
Qwen2.5-VL-7B-Abliterated-Caption-itの量子化バージョンで、多言語画像記述タスクをサポートします。
これはQwen2.5-VL-7Bモデルに基づく静的量子化バージョンで、画像記述生成タスクに特化し、複数の言語をサポートしています。
olmOCR-7B-0725-FP8は、Qwen2.5-VL-7B-Instructモデルをベースに、olmOCR-mix-0225データセットで微調整した後、FP8バージョンに量子化した文書OCRモデルです。
Qwen2.5-VL-7B-Meteorologyの量化バージョンで、気象、気候などの分野の画像テキスト処理タスクに適しており、さまざまなハードウェア条件下で効率的に動作します。
Qwen2.5-VL-7B-Meteorologyの量化バージョンで、気象関連の画像テキスト処理タスクに適しています。
NexaAI
Qwen2.5-VLは画像テキストからテキストへのマルチモーダルモデルで、視覚理解、ビデオ処理、構造化出力などの分野で著しい向上が見られます。
sunbv56
Qwen2.5アーキテクチャに基づくビジュアルQAモデルで、ベトナム語シナリオに特化し、画像関連の質問に対する解答をサポートします。