蚂蚁inclusionAI在HuggingFace开设AI-Transparency仓库,公开Ling、Ring、Ming系列模型的训练内容摘要。该仓库只含文档,不发布权重和训练数据集,主动披露模型训练数据来源,覆盖Ling-2.0至3.0、Ring-2.0至2.6、Ming-Omni及两款16B-A3B多模态模型,旨在提升训练透明度。
8月28日,腾讯WorkBuddy首发接入混元开源旗舰大模型Hy4preview,国内外版同步上线。Hy4preview限时免费两周,Hy3免费期延至9月30日。该模型总参数770B、激活49B,上下文1M,面向代码、办公、科学等生产力场景,已开源至HuggingFace等平台。
腾讯发布混元 Hy4 preview 开源模型,总参数770B、激活参数49B,上下文长度1M。官方称预训练与后训练同步进步,智能水平跃升,居开源第一梯队。模型已在 HuggingFace、GitHub、ModelScope、Gitcode 上线,并接入腾讯云 TokenHub 与 OpenRouter。生产力场景盲测力压 GLM-5.3 与 Kimi K3。
腾讯混元8月28日发布开源旗舰大模型Hy4preview,总参数770B、激活参数49B,上下文1M,定位真实生产力。模型已开源至HuggingFace、GitHub、ModelScope等,并上线腾讯云TokenHub、OpenRouter,可在WorkBuddy/CodeBuddy、元宝、ima体验。其依托软工、游戏、金融、安全等领域专家数据共建,在四大方向取得进展。
HuggingFace的全新AI代理框架,助力开发者轻松创建强大AI代理。
基于深度推理的神经机器翻译模型
一个基于Gradio的翻译代理Web界面
大型推理模型框架,支持PyTorch和HuggingFace。
NyxKrage
Moondream 3 Preview HF是基于HuggingFace Transformers架构规范对Moondream 3 (Preview)模型的重新实现,使其能够与Hugging Face生态系统完全兼容。这是一个多模态视觉语言模型,采用专家混合(MoE)文本主干,约90亿参数,20亿活跃参数。
Ali-Yaser
本模型是基于meta-llama/Llama-3.3-70B-Instruct进行微调得到的版本,使用mlabonne/FineTome-100k数据集进行训练,包含100k token数据。模型采用Unsloth和Huggingface TRL库进行微调,支持英文语言处理。
ycngin2024
这是一个经过微调的Whisper语音识别模型,基于unsloth/whisper-large-v3-turbo架构,使用Unsloth和Huggingface TRL库实现了2倍训练加速,显著提升了训练效率。
hirundo-io
这是一个基于🤗 Transformers的模型,已发布至HuggingFace模型中心。由于模型卡片信息不完整,具体功能和应用场景需进一步确认。
metascroy
这是一个基于Qwen3-4B模型进行微调的量化版本,使用Unsloth框架和Huggingface TRL库进行高效训练,训练速度提升2倍。模型采用int8-int4混合量化方案,支持在移动设备上运行。
mintujohnson
这是一个基于Llama-3.2-3B架构的微调语言模型,专门针对法语和英语的文本生成任务进行了优化训练。该模型使用了Unsloth和Huggingface的TRL库进行训练,训练速度提升了2倍,支持高效的文本生成推理。
qforge
这是一个基于Qwen3架构的微调模型,使用Unsloth和Huggingface TRL库进行高效训练,训练速度提升了2倍,专门针对文本生成任务进行了优化。
Barth371
这是基于 unsloth/qwen2.5-vl-72b-instruct-bnb-4bit 模型进行微调的视觉语言模型,使用 Unsloth 和 Huggingface TRL 库进行优化训练,训练速度相比传统方式提升了2倍。
ArunKr
SmolLM-135M-Instruct-manim是基于HuggingFaceTB/SmolLM-135M-Instruct模型使用manim代码生成数据集进行LoRA微调的轻量级语言模型。该模型专门针对代码生成任务进行了优化,提供了三种不同的变体以满足不同部署需求。
bacchist
基于Qwen3架构的1.7B参数微调模型,采用Unsloth和Huggingface TRL库进行高效训练,训练速度提升2倍,专注于英文文本生成任务。
pytorch
SmolLM3-3B-INT8-INT4是基于HuggingFaceTB/SmolLM3-3B模型进行量化的版本,使用torchao实现了8位嵌入、8位动态激活和4位权重线性量化。该模型转换为ExecuTorch格式,通过优化在CPU后端实现高性能,特别适合移动设备部署。
HuggingFaceTB
SmolLM3是一款参数为30亿的语言模型,旨在突破小模型的性能边界。它支持6种语言,具备高级推理能力和长上下文处理能力,是一个完全开源的模型。
SmolLM3是一款拥有30亿参数的开源语言模型,支持6种语言,具备强大的推理能力和长上下文处理能力。
anonymguy
本模型是基于Qwen3-0.6B微调的对话轮次检测模型,采用Unsloth和Huggingface TRL库加速训练,在对话轮次检测任务中准确率达96.22%。
huggingfacecoin
基于distilbert-base-uncased微调的文本分类模型,在AG News数据集上训练,准确率达89.06%
hailong18102002
基于Qwen2.5架构的3B参数指令微调模型,使用Unsloth和Huggingface TRL库优化训练速度
rhysjones
该模型源自karpathy的llm.c项目,为研究bfloat16性能而转换为HuggingFace格式,训练过程消耗了1500亿token。
raak-16
这是一个使用Unsloth和Huggingface TRL库优化的Mistral-7B指令微调模型,训练速度提升2倍
devJy
基于Qwen2.5-VL-3B模型的微调版本,使用Unsloth和Huggingface TRL库进行训练,推理速度提升2倍
summykai
基于mlabonne/gemma-3-27b-it-abliterated微调的大语言模型,采用Unsloth加速框架和Huggingface的TRL库进行训练,效率提升2倍。
一个提供Hugging Face Hub API只读访问的MCP服务器,支持LLM交互模型、数据集等资源。
基于HuggingFace smolagents的智能研究代理工具,提供网页搜索、文档分析等高级研究功能
mcp-server-suite是一个开源的MCP服务器集合,旨在成为自动化领域的'HuggingFace'。它提供模块化的服务器组件,支持从网页搜索到数据库操作等多种功能,并鼓励社区贡献扩展。项目包含核心服务器和规划中的多种专业服务,涵盖AI/ML、软件开发和非技术场景,目标是通过标准化协议简化自动化流程。
该项目实现了一个SSE MCP服务器,集成了HuggingFace和Replicate的API,提供图像生成和模型管理工具,支持标准化AI模型交互接口。
Second Opinion MCP是一个多AI模型咨询平台,允许用户在Claude对话中即时获取来自OpenAI、Gemini、Grok、Claude、HuggingFace、DeepSeek和OpenRouter等不同AI模型的第二意见,支持代码对比、创意写作、问题解决和跨模型分析等功能。