MiniMax推出全模态生成模型H3,承诺近期全面开源。该模型支持文本、图像、视频、声音任意组合输入,可生成带原生双声道音频的高清视频,用户只需提供参考素材即可驱动创作。
德国初创黑森林实验室发布多模态基础模型Flux3,基于Self-Flow架构,集成图像、视频、音频与动作编解码器,统一理解并生成物理与数字环境。作为首款原生支持音频生成的模型,Flux3可一次性输出20秒音视频同步片段,并支持文本、图像、视频转视频及关键帧驱动等多样化生成任务,显著推动生成式视频技术发展。
Anthropic为Claude语音模式推出重大更新,支持Opus、Sonnet、Haiku三档模型自由切换,默认匹配用户文本聊天最后使用模型的最快版本,由此前的能力有限的Haiku驱动升级为全能语音助手。
苹果计划在今年秋季发布的iOS 27、iPadOS 27和macOS 27中推出“Extensions”功能,允许用户自主选择第三方AI模型,驱动文本生成、润色或图像创作等智能功能。此举打破其AI生态封闭边界,赋予用户更多个性化选择,不再局限于系统默认选项。
AI驱动,从文本和图像生成合规专利图,支持多办公室专利申报。
AI驱动,将图像和视频转化为描述、OCR、Alt文本等多种形式
AI驱动,免费在线将MP3音频转文本,支持90+语言,多格式导出
VeoOmni由谷歌AI驱动,可从文本或图像生成1080p电影级视频并同步音频。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$0.49
$2.1
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$4
$16
$6
$24
256
Baidu
128
Bytedance
$1.2
$3.6
4
$2
$3.9
$15.2
64
tencent
混元OCR是由混元原生多模态架构驱动的端到端OCR专家VLM模型,仅用10亿参数的轻量级设计,在多个行业基准测试中取得最先进成绩。该模型擅长处理复杂的多语言文档解析,在文本定位、开放域信息提取、视频字幕提取和图片翻译等实际应用场景中表现出色。
Alissonerdx
HuMo是一个统一的、以人为中心的视频生成框架,能够根据文本、图像和音频等多模态输入,生成高质量、细粒度且可控的人类视频。它支持强大的文本提示跟随、一致的主体保留以及同步的音频驱动运动。
VeryAladeen
HuMo是一个以人为中心的视频生成框架,能够利用文本、图像和音频等多模态输入生成高质量、细粒度且可控的人类视频,支持文本提示跟随、主体保留和音频驱动运动同步。
Wan-AI
Wan2.2-S2V-14B是一个专为音频驱动的电影级视频生成而设计的混合专家(MoE)模型。它能够根据输入的音频、参考图像和文本提示生成高质量的视频内容,支持480P和720P分辨率,并具备复杂运动生成和电影级美学效果。
TIGER-Lab
PixelReasoner是一个基于Qwen2.5-VL-7B-Instruct的视觉语言模型,采用好奇心驱动强化学习训练,专注于图像文本到文本的任务。
InstantX
CSGO是一个用于文本生成图像的PyTorch实现,支持图像驱动的风格迁移、文本驱动的风格化合成和文本编辑驱动的风格化合成。
一个基于Model Control Protocol(MCP)的服务器,用于管理和提供动态提示模板。它利用强大的Go文本模板引擎,支持变量、条件、循环和可复用组件,允许创建逻辑驱动的提示模板,并能与Claude、Gemini等兼容MCP的客户端无缝集成。
一个独立的MCP服务器,通过IbInputSimulator提供驱动程序级别的键盘鼠标输入控制工具,支持文本输入、快捷键、窗口管理等操作,无需UIA或视觉模块。