DeepSeek工具鏈升級至0.1.1-rc.1版,在V4Flash與V4Pro基礎上新增視覺模型體驗版V4Flash Vision-Exp。此前v0.1.0-rc.8已打通多模態能力,支持原生圖片請求,/goal、/plan等指令實現圖文混合輸入。
阿里巴巴確認,自研大模型通義千問已接入Apple智能,將全面集成至中國區iPhone、iPad、Mac和Vision Pro等設備。屆時用戶可在iOS、iPadOS、macOS、visionOS系統層直接調用,實現圖文深度理解與高質量生成等智能操作,徹底告別以往需要頻繁切換的繁瑣體驗。
阿里發佈多模態大模型Qwen3.7-Plus,在文本能力基礎上增強視覺-語言功能,統一爲智能體基座。該模型融合GUI與CLI交互,實現從原型到軟件工程的端到端自動化,並在Vision Arena榜單中表現強勁。
IBM發佈Granite 4.0 3B Vision視覺語言模型,擁有30億參數,專爲企業級複雜文檔數據提取優化。該模型針對金融、法律、醫療等行業非結構化數據處理難題,在複雜表格、掃描件及多模態佈局文檔中表現突出,通過結合視覺理解與語言生成,精準識別並提取關鍵信息。
Aya Vision 32B 是一個支持多語言的視覺語言模型,適用於OCR、圖像描述、視覺推理等多種用途。
Aya Vision 是 Cohere 推出的多語言多模態視覺模型,旨在提升多語言場景下的視覺和文本理解能力。
VisionAgent是一個用於生成代碼以解決視覺任務的庫,支持多種LLM提供商。
Vision Arena是一個面向計算機視覺領域的開源模型測試平臺
Google
$0.49
輸入tokens/百萬
$2.1
輸出tokens/百萬
1k
上下文長度
Openai
$2.8
$11.2
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$1
$10
256
$6
$24
$2
$20
$4
$16
Baidu
128
Bytedance
$1.2
$3.6
4
mitegvg
該模型是基於VideoMAE架構的暴力檢測模型,在Kinetics數據集預訓練的基礎上,針對暴力檢測任務進行了92輪微調。模型採用Vision Transformer架構,專門用於視頻內容分析,能夠識別視頻中的暴力行為。
birder-project
這是一個基於RoPE(旋轉位置編碼)的Vision Transformer模型,參數規模為150M,採用14x14的patch大小。該模型在約2100萬張圖像的多樣化數據集上進行了預訓練,可作為通用視覺特徵提取器使用。
timm
這是一個基於DINOv3架構的Vision Transformer圖像特徵編碼器,通過從7B參數的DINOv3 ViT模型在LVD-1689M數據集上進行知識蒸餾得到。該模型專門用於圖像特徵提取任務,具有強大的視覺表示能力。
dinhquangson
MonkeyOCR-pro-1.2B Vision GGUF 是一款高性能的視覺語言模型,專注於光學字符識別(OCR)和文檔分析。該模型採用GGUF格式,支持多語言處理,具備出色的OCR精度和推理速度,適用於各種文檔處理場景。
John6666
Realistic Vision V5.1 是一個基於 Stable Diffusion XL 的文本到圖像生成模型,專注於生成高質量、逼真的人物肖像和場景圖像。該模型支持多種風格,包括寫實、動漫、遊戲等,能夠生成具有高度真實感的人物、女演員肖像以及動漫風格圖像。
facebook
DINOv3是Meta AI開發的一系列通用視覺基礎模型,無需微調就能在多種視覺任務中超越專門的先進模型。該模型採用Vision Transformer架構,在16.89億張網絡圖像上預訓練,能生成高質量的密集特徵,在圖像分類、分割、檢索等任務中表現出色。
CohereLabs
Cohere Labs Command A Vision是一個擁有1120億參數的企業級視覺語言模型,專為圖像理解任務優化,在保持高性能的同時具有較低的計算需求。該模型支持多語言輸入和輸出,能夠處理圖像和文本的多模態輸入。
Acly
BiRefNet是一個用於二分類圖像分割的深度學習模型,專門用於背景去除任務。該模型經過GGUF格式轉換,可在消費級硬件上通過vision.cpp進行輕量級推理,實現高效的圖像分割處理。
Ricky06662
VisionReasoner-7B是一個圖像文本到文本的模型,採用解耦架構,由推理模型和分割模型組成,能解讀用戶意圖並生成像素級掩碼。
p1atdev
基於Vision Transformer架構的視覺模型,採用SigLIP(Sigmoid Loss for Language-Image Pretraining)訓練方法,適用於圖像理解任務。
ISxOdin
基於Google Vision Transformer (ViT)微調的寵物品種分類模型,在Oxford-IIIT寵物數據集上達到94.45%準確率
UCSC-VLAA
VLAA-Thinker是一個創新的視覺語言模型,能夠同時處理圖像和文本輸入,並生成高質量的文本輸出。該模型基於論文《SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models》的研究成果開發,專注於類似R1的推理能力。
tue-mps
該論文提出了一種將Vision Transformer (ViT) 重新解釋為圖像分割模型的方法,展示了ViT在圖像分割任務中的潛力。
該論文提出了一種將Vision Transformer (ViT) 重新解釋為圖像分割模型的方法,揭示了ViT在圖像分割任務中的潛力。
該論文提出了一種基於Vision Transformer (ViT) 的圖像分割模型,揭示了ViT在圖像分割任務中的潛力。
該模型揭示了Vision Transformer (ViT) 在圖像分割任務中的潛力,通過特定架構調整使其適用於分割任務。
該論文提出的模型揭示了Vision Transformer (ViT)在圖像分割任務中的潛在能力。
該論文提出了一種新的視角,將Vision Transformer (ViT) 視為圖像分割模型,並探討了其在圖像分割任務中的潛力。
該模型揭示了Vision Transformer (ViT) 在圖像分割任務中的潛力,通過特定方法將ViT轉化為高效的圖像分割模型。