Google发布全新开源大模型Gemma412B,采用“Unified”无编码器架构,突破端侧全模态AI。该模型无需传统视觉、音频外部编码器,直接输入文字、图像、音频、视频四种模态数据至同一Transformer主干网络处理,消除了外挂“翻译”模块带来的显存占用和高延迟问题。
通义实验室发布多模态大模型Qwen3.5-Omni,实现理解力、交互感和任务执行力的跨越式进化,推动AI从“屏幕助手”迈向“理解物理世界的智能体”。该模型采用原生“全模态”架构,能无缝处理文本、图像、音频和视频输入,在音视频分析、推理、对话及翻译测试中表现卓越。
【AI日报】HeyGen发布新一代AI视频翻译引擎,实现跨语言视频高质量本地化。核心技术突破使外国人能轻松说中文,唇形同步精准到毫秒,为开发者提供创新AI产品应用参考。
HeyGen发布新一代视频翻译引擎,通过上下文感知翻译、语音情感迁移和口型同步三大技术,实现跨语言视频本地化。外国演讲者不仅能说地道中文,连语气、表情和唇动都自然逼真,达到“以假乱真”效果,推动“一人拍摄,全球共鸣”。
将视频和音频转为可搜索、学习、总结、翻译的定时文本
AI Call可实时翻译电话和视频通话,支持100种语言。
AI驱动,可将视频翻译、添加字幕和配音到100多种语言,免费试用。
CinLink让创作者通过自然语言完成视频字幕、翻译、剪辑等媒体任务
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Google
$2.1
$17.5
$0.7
Alibaba
$2
$20
-
$8
$240
52
Bytedance
$1.2
$3.6
4
$3.9
$15.2
64
$15.8
$12.7
$0.8
256
Baidu
Tencent
24
$1.95
16
$1.8
$5.4
32
tencent
混元OCR是由混元原生多模态架构驱动的端到端OCR专家VLM模型,仅用10亿参数的轻量级设计,在多个行业基准测试中取得最先进成绩。该模型擅长处理复杂的多语言文档解析,在文本定位、开放域信息提取、视频字幕提取和图片翻译等实际应用场景中表现出色。
AllVoiceLab官方MCP服务器,支持文本转语音、视频翻译等强大API交互,为多款客户端提供语音生成、视频翻译及智能变声服务。
VideoLingo是一款集视频翻译、本地化和配音于一体的工具,旨在生成Netflix品质的字幕。它消除了生硬的机器翻译和多行字幕,同时提供高质量的配音,实现跨语言的知识共享。
YouTube视频翻译与摘要生成工具