Meta被曝禁止工程师使用Anthropic的Claude Code和OpenAI的Codex,此举揭开AI企业间“模型蒸馏”博弈序幕。蒸馏指利用强模型输出训练新模型,Meta的核心忧虑是防范对手通过员工使用竞品工具,间接获取数据或知识以复制优化自身模型。
苹果与谷歌在AI领域展开深度合作,计划在iOS 27中坚持隐私优先,专注本地端侧AI处理。通过“知识蒸馏”技术,苹果利用谷歌Gemini大模型训练轻量级端侧模型,将大模型知识迁移至小模型,提升设备端AI体验而不牺牲用户隐私。
苹果利用知识蒸馏技术,将谷歌Gemini云端大模型转化为适用于iPhone的轻量化端侧组件。根据2026年3月消息,苹果与谷歌达成协议,允许其工程师深度访问并研究Gemini全量模型。此举增强了苹果在AI领域的自主性,使其能直接借鉴Gemini的高质量输出与推理过程。
微博推出开源大模型Vibe Thinker,仅15亿参数却在数学竞赛基准测试中击败6710亿参数的DeepSeek R1,准确率更高且训练成本仅7800美元。采用轻量化MoE架构与知识蒸馏技术,仅需5GB数学语料即可微调,支持Hugging Face下载和商用。该模型在AIME等国际数学竞赛中表现优异。
多模态语音大型语言模型
高效准确的AI语言模型
Anthropic
$21
Input tokens/M
$105
Output tokens/M
200
Context Length
Bytedance
$0.8
$2
128
Huawei
-
32
Tencent
24
Alibaba
$0.5
Iflytek
8
Baidu
131
$1.5
$6
Openai
$525
$1050
Stepfun
250
Deepseek
$1
TeichAI
本模型是基于Qwen3-4B架构的知识蒸馏模型,通过约5440万个由Gemini 2.5 Flash生成的标记进行训练,旨在整合Gemini-2.5 Flash的行为、推理过程和知识到单一数据集中。
Jackrong
本项目通过创新的两阶段训练流程,将GPT的推理能力蒸馏到Llama-3.1-8B模型中。首先通过监督微调进行知识蒸馏和格式对齐,然后利用强化学习激励模型自主探索和优化推理策略,专注于数学推理领域的能力突破。
timm
这是一个基于DINOv3框架的视觉Transformer模型,通过知识蒸馏技术从DINOv3 ViT-7B模型在LVD-1689M数据集上训练得到。该模型专门用于图像特征编码,能够高效提取图像特征表示,适用于各种计算机视觉任务。
这是一个基于DINOv3架构的视觉Transformer模型,采用小型(Small)配置,在LVD-1689M数据集上通过知识蒸馏训练而成。该模型专门用于高效提取图像特征,支持图像分类、特征图提取和图像嵌入等多种计算机视觉任务。
这是一个基于DINOv3架构的Vision Transformer图像特征编码器,通过从7B参数的DINOv3 ViT模型在LVD-1689M数据集上进行知识蒸馏得到。该模型专门用于图像特征提取任务,具有强大的视觉表示能力。
facebook
MobileLLM-Pro是Meta推出的10亿参数高效设备端语言模型,专为移动设备优化,支持128k上下文长度,提供高质量推理能力。该模型通过知识蒸馏技术训练,在多项基准测试中超越同规模模型,并支持近乎无损的4位量化。
MongoDB
mdbr-leaf-ir 是 MongoDB Research 开发的专为信息检索任务设计的高性能紧凑型文本嵌入模型,特别适用于 RAG 管道的检索阶段。该模型采用知识蒸馏技术,支持非对称架构、MRL 截断和向量量化,在 BEIR 基准测试中表现出色。
VAGOsolutions
SauerkrautLM-Reason-EuroColBERT是一款基于Late Interaction架构的强大检索器,通过知识蒸馏技术从合成数据中学习复杂推理模式。拥有2.1亿参数,在多语言推理检索方面表现出色,无需进行压缩权衡,能够在标准基础设施上部署。
rasyosef
这是一个基于BERT-Mini(1100万参数)的SPLADE稀疏检索模型,通过在MSMARCO数据集上对交叉编码器进行知识蒸馏训练得到。该模型比官方splade-v3-distilbert小6倍,但能达到其85%的性能,可在CPU上处理数千个文档。
forwarder1121
轻量级语音压力识别模型,通过知识蒸馏技术训练,适用于边缘设备实时压力检测
Freepik
由Freepik和Fal联合开发的70亿参数扩散模型,通过知识蒸馏构建,具有快速生成和高效内存使用的特点
DeepGlint-AI
UniME是一个基于多模态大模型的通用嵌入学习框架,通过文本判别知识蒸馏和硬负样本增强的指令调优策略,显著提升了多模态嵌入能力。
saurabhati
DASS是一种基于状态空间架构的音频分类模型,通过知识蒸馏技术从更大的教师模型中学习,在显著减小模型参数量的同时实现了卓越的音频分类性能。
PumeTu
一个基于SigLIP架构的轻量级视觉语言模型,通过蒸馏技术从更大的SigLIP-400m模型中提取知识,适用于零样本图像分类任务。
N-Bot-Int
MiniMaid-L2是基于MiniMaid-L1进一步优化的角色扮演专用模型,通过知识蒸馏和更大规模数据集训练,在3B规模模型中表现优异。
CrabInHoney
urlbert-tiny-base-v4是一款基于BERT架构的轻量级模型,专门针对URL(统一资源定位符)的分析任务进行了优化。该模型通过师生架构训练、掩码标记预测和知识蒸馏等技术,在保持较小参数规模(372万)的同时,增强了对URL结构和语义的理解能力,适用于需要快速、高效处理URL的分类与分析场景。
distil-whisper
Distil-Whisper是OpenAI Whisper-Large-v3的知识蒸馏版本,提供更优的性能表现和高效性。
LoneStriker
基于Qwen2.5-72B通过强化学习蒸馏的高性能数学推理与通用知识处理模型,在数学推理和通用知识任务中表现优异。
xingyang1
Distill-Any-Depth是一种新的SOTA单目深度估计模型,采用知识蒸馏算法训练而成。
Distill-Any-Depth是一种基于知识蒸馏算法训练的SOTA单目深度估计模型,能够高效准确地进行深度估计。