日本内阁府8月18日公布生成式AI开发者指导方针草案,要求披露训练数据及收集方式,旨在平衡知识产权规范、技术创新与创作者权益。草案无法律约束力,但敦促开发者保持透明,公开数据采集方式,避免使用盗版网站,并鼓励披露训练集中是否含漫画、音乐等内容。
Human Archive 是一家硅谷初创公司,通过让印度零工从业者佩戴摄像设备,采集第一人称视角视频数据,为AI实验室训练机器人提供稀缺的现实世界行为数据。该公司近日完成融资,获得顶尖AI资本支持,押注这一争议但潜力巨大的领域。
DoorDash推出Tasks应用,让800万外卖员在送餐之余完成简单数字任务赚取外快。其核心目的是利用骑手采集真实物理世界数据,解决AI模型训练中的长尾场景难题,为AI发展提供关键支持。
GitHub将于2026年4月24日起利用用户交互数据训练AI模型,涵盖Copilot各版本用户。采集内容包括代码片段、聊天记录等,旨在提升模型建议的准确性与安全性。官方称内部测试已显著提高建议接受率。
Openai
-
Input tokens/M
Output tokens/M
Context Length
Anthropic
$21
$105
200
Google
$0.7
$2.8
1k
Alibaba
$6
$24
256
$8
$240
52
Moonshot
$4
$16
Baidu
32
$8.75
$70
400
$1.75
$14
$0.35
$525
Huawei
128
Tencent
28
$7.7
$30.8
4
$3.5
$10.5
16
$2
Minimax
Keltezaa
基于Flux模型训练的德鲁·巴里摩尔LoRA模型,数据集采集自1995-2000年间影像素材
Cnam-LMSSC
EBEN 是一款针对法语语音的带宽扩展模型,专门用于处理体传导语音传感器(如喉部麦克风)采集的音频。它能够对低频、含噪的体传导语音进行降噪,并从低频内容中再生中高频成分,从而显著提升音频的清晰度和质量。该模型基于特定的非传统传感器数据训练,适用于特定领域内的语音增强任务。