谷歌DeepMind推出多语言手语转文本模型SL2T,并首次搭载于Pixel11手机,让手语AI进入消费电子产品。该模型接入Gboard和Live Transcribe,用户通过前置摄像头打手语,即可编辑消息、网页检索及与Gemini对话,替代键盘输入。SL2T基于50多种手语、10万小时素材训练,约四分之一来自美国手语数据集,跨语种联合训练提升识别效果。
谷歌面向部分用户测试 macOS 客户端重大语音升级,推出三大核心功能:系统级语音听写,支持全局快捷键在任何应用中实现语音转文字输入;“魔法指针”,让 Gemini 实时追踪光标悬停内容,确保视觉与逻辑同步;以及多设备连接菜单,暗示未来跨桌面协同。此次还重新设计了 Gemini Live 界面。
谷歌发布Gemini 3.5 Live Translate音频模型,通过实时语音到语音技术实现跨语言沟通突破,已集成至Google AI Studio、翻译和Meet等产品。其核心创新在于追求翻译“自然度”,摒弃传统轮流式翻译模式,旨在打破语言沟通的地理与文化障碍。
谷歌翻译的“实时翻译”功能现已支持iOS系统,用户只需搭配任意耳机即可在移动设备上实现低延迟跨语言对话,大幅降低了使用门槛。
一个集成了Gemini多模态直播和WebRTC技术的单文件应用
AI驱动的移动对话体验
Openai
$2.8
输入tokens/百万
$11.2
输出tokens/百万
1k
上下文长度
Google
$0.49
$2.1
$7.7
$30.8
200
$0.7
$17.5
Alibaba
$8
$240
52
$0.4
-
128
$1.75
$14
400
Iflytek
$2
8
$8.75
$70
Tencent
$1
$3
4
Bytedance
$1.5
$4.5
$0.3
$0.6
32
$56
$1.4
131