openJiuwen社区发布Skill-Omni,首个工程化多模态Skill范式,突破传统纯文本指令局限,使智能体经验从“读得懂”升级为“看得见”,精准赋能修图、GUI操作等视觉任务,开辟复杂视觉交互新路径。
网易有道发布“子曰”大模型4.0版本,全面升级至全模态时代,支持文本、图片、音频融合交互。核心的多模态模型和语音合成(TTS)模型正式开源,翻译模型经技术重构,翻译质量与效率显著提升。多模态模型在视觉和数理领域达到SOTA水平,纯文本数理难题性能行业领先。
谷歌I/O大会上,谷歌与沃尔沃宣布合作:AI助手Gemini将接入沃尔沃纯电SUV EX60的外部摄像头,加速获取视觉与移动感知能力。此举标志着AI大模型与智能汽车硬件的深度融合取得实质性突破,得益于沃尔沃原生搭载谷歌嵌入式车载系统。
谷歌公司计划对其核心应用图标进行全面视觉升级,从2025年末试水后正式推行。新设计摒弃了死板的纯圆和四色拼接,采用柔和圆角与渐变色过渡,色彩从浅粉彩自然过渡到饱和的谷歌原色,整体风格更灵动现代,覆盖几乎所有核心应用。
基于纯视觉的图形用户界面代理解析器
基于预训练的纯视觉变换器提升图像抠图
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
Anthropic
$105
$525
200
$0.7
$7
$35
$17.5
$21
Alibaba
$1
$10
256
$2
$20
-
$8
$240
52
Bytedance
$1.2
$3.6
4
$3.9
$15.2
64
$0.8
facebook
20亿参数视觉Transformer模型,通过纯视觉自监督学习在20亿网络图像上训练而成,在多模态任务中表现优异
ZeroAgency
Zero-Mistral-24B是基于Mistral-Small-3.1-24B-Instruct-2503改进的纯文本模型,主要适配俄语和英语,移除了原版的视觉功能,专注于文本生成任务。
lunahr
这是google/gemma-3-4b-it的纯文本精简版本,移除了视觉编码器,专注于文本生成任务。
gghfez
由google/gemma-3-12b-it转换而来的纯文本版本,移除了视觉组件,专注于文本生成任务
Gemma-3-4b纯文本模型是基于google/gemma-3-4b-it转换而来的纯文本版本,移除了视觉组件,专注于文本生成任务。
kehanlu
这是一个从多模态视觉语言模型 `meta-llama/Llama-3.2-11B-Vision-Instruct` 中提取出的纯文本大语言模型(LLM)。原模型具备视觉理解能力,而本仓库通过移除交叉注意力层,将其转换为专注于文本处理的纯语言模型,其核心架构与 Llama 3.1 8B Instruct 相似。
Bllossom
基于llama3.2-3B的韩英双语模型,具备视觉-语言和纯语言模型的双向功能
DBD-research-group
ConvNeXT是一个纯卷积模型,受视觉变换器设计启发,在BirdSet的XCL数据集上训练,专门用于鸟类声音分类。该模型在Xeno-Canto的9736种鸟类数据集上进行训练,能够识别5秒鸟类发声片段的物种。
HuggingFaceM4
Idefics2 是一个开放的多模态模型,能够接受任意序列的图像和文本输入并生成文本输出。该模型可以回答关于图像的问题、描述视觉内容、基于多张图像创作故事,或仅作为纯语言模型使用。
alibaba-damo
MGP-STR是一个纯视觉场景文本识别模型,通过多粒度预测实现高效OCR。
ConvNeXT是一个纯卷积模型,受视觉Transformer设计启发,在ImageNet-22k上预训练并在ImageNet-1k上微调,性能优于Transformer。
ConvNeXT是一个纯卷积模型,设计灵感来自视觉Transformer,在ImageNet-1k数据集上以224x224分辨率训练而成。
ConvNeXT是一个纯卷积模型(ConvNet),受视觉Transformer设计的启发,声称性能优于Transformer。该模型在ImageNet-1k数据集上以384x384分辨率训练而成。
ConvNeXT是一个纯卷积模型,受视觉Transformer设计启发,在ImageNet-22k数据集上训练而成,性能超越Transformer。
ConvNeXT是一个纯卷积模型,其设计灵感来自视觉Transformer,宣称性能优于视觉Transformer。该模型基于ImageNet-22k数据集在224x224分辨率下训练而成。
ConvNeXT是一个纯卷积模型,受视觉Transformer设计启发,在ImageNet-22k上预训练并在ImageNet-1k上微调,性能优于传统Transformer。
ConvNeXT是一个纯卷积模型,设计灵感来自视觉变换器,在ImageNet-1k数据集上训练,性能优于传统视觉变换器。
ConvNeXT是一个纯卷积模型,其设计灵感来自视觉Transformer,宣称性能优于视觉Transformer。该模型在224x224分辨率下基于ImageNet-22k数据集训练而成。
ConvNeXT是一个纯卷积模型,受视觉Transformer设计启发,在ImageNet-22k上预训练并在ImageNet-1k上微调,性能优于传统视觉Transformer。