腾讯开源统训框架AngelSpec,通过多方案协同与工作负载异构适配,降低大模型自回归解码成本,提升推理吞吐量。针对不同场景文本特征采取差异化训练策略,如高熵多轮对话采用轻量稳定方案,实现真实场景下的高效推理。
文远知行在2026世界人工智能大会发布WIIT大模型,提出“最小物理事实单元”理念,将连续环境拆解为基础事实,构建物理世界AI理解框架,包含事实提取、推理、验证等模块,推动AI从数据理解迈向真实世界认知。
轻量级端到端OCR模型HyOCR-1.5发布,在保持轻量化同时大幅提升性能与效率。作为首个全栈开源OCR模型,它全面开放权重、训练配方、数据构造方法及推理加速框架,显著降低开发门槛,让开发者可轻松复现、微调,并在消费级显卡或笔记本上部署。
北大与DeepSeek联合开源大模型推理加速框架DSpark,针对自回归生成中每词元均需全算力导致的高并发延迟与算力浪费,提供突破性解决方案。
一个通用框架,用于在测试时调节大型推理模型的思维进度。
一个高效的强化学习框架,用于训练推理和搜索引擎调用的语言模型。
Atom of Thoughts (AoT) 是一种用于提升大语言模型推理性能的框架。
ViDoRAG 是一个结合视觉文档检索增强生成的动态迭代推理代理框架。
Openai
$2.8
Input tokens/M
$11.2
Output tokens/M
1k
Context Length
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$7
$35
Google
$2.1
$17.5
$21
$105
$0.7
Alibaba
$4
$16
$1
$10
256
$6
$24
$2
$20
Baidu
128
Moonshot
Bytedance
$0.8
32
ss-lab
这是一个基于Meta LLaMA 3 8B模型,使用Unsloth框架进行高效微调,并转换为GGUF格式的轻量级文本生成模型。模型针对Alpaca数据集进行了优化,适用于本地部署和推理,特别适合在资源受限的环境中使用。
本项目提供了一个基于微软Phi-3.5-mini-instruct模型进行微调的文本生成模型,已转换为GGUF格式,适用于llama.cpp推理框架。模型在philschmid/guanaco-sharegpt-style数据集上进行了微调,优化了指令遵循和对话能力,适用于资源受限环境下的高效文本生成任务。
PrimeIntellect
INTELLECT-3是一个拥有1060亿参数的混合专家(MoE)模型,通过大规模强化学习训练而成。在数学、编码和推理基准测试中展现出卓越性能,模型、训练框架和环境均以宽松许可协议开源。
mlx-community
VibeThinker-1.5B的4位量化版本,基于MLX框架针对苹果芯片优化,是一个拥有15亿参数的密集语言模型,专门用于数学推理和算法编码问题
McG-221
本模型是Falcon-H1-34B-Instruct指令微调版本的MLX格式转换版,专为Apple Silicon(M系列芯片)优化。它基于原始的Falcon-H1-34B-Instruct模型,通过mlx-lm工具转换为MLX框架兼容的8位量化格式,旨在在macOS设备上实现高效的本地推理。
hasanbasbunar
Lodos-24B-Instruct-2510是基于Mistral-Small-3.2-24B-Instruct-2506微调的土耳其语大语言模型,使用TRL框架进行全监督微调,专门针对土耳其语指令遵循任务优化,支持长文本生成和复杂推理。
QuantTrio
MiniMax-M2-AWQ是基于MiniMaxAI/MiniMax-M2模型的量化版本,通过vLLM框架实现高效的文本生成。该模型采用AWQ量化技术,在保持模型性能的同时显著减少内存占用和提升推理速度,支持32K上下文长度和工具调用功能。
Mungert
PokeeResearch-7B是由Pokee AI开发的70亿参数深度研究代理模型,结合了AI反馈强化学习(RLAIF)和强大的推理框架,能够在工具增强的大语言模型中实现可靠、对齐和可扩展的研究级推理,适用于复杂的多步骤研究工作流程。
这是一个基于Qwen3-VL-32B-Thinking模型转换的4位量化版本,专门针对MLX框架优化。该模型是一个32B参数规模的多模态视觉语言模型,具备思维链推理能力,能够同时处理图像和文本输入,生成高质量的文本响应。
PokeeAI
PokeeResearch-7B是由Pokee AI开发的70亿参数深度研究智能体,结合基于AI反馈的强化学习(RLAIF)与推理框架,能够执行复杂的多步骤研究工作流程,包括自我修正、验证和综合分析。
Thrillcrazyer
Qwen-1.5B_THIP是基于DeepSeek-R1-Distill-Qwen-1.5B在DeepMath-103k数学数据集上使用TRL框架进行GRPO方法微调的数学推理模型。该模型专门针对数学问题解决进行了优化,具备较强的数学推理能力。
这是IBM Granite-4.0-h-Tiny模型的4位量化版本,专为Apple Silicon优化,使用MLX框架进行高效推理。模型经过DWQ(动态权重量化)处理,在保持性能的同时显著减小模型大小。
DeepSeek-V3.2-Exp-AWQ是基于DeepSeek-V3.2-Exp模型的量化版本,通过vLLM框架实现高效文本生成。该模型引入了DeepSeek稀疏注意力机制,在长上下文训练和推理效率上有显著提升,同时保持了模型输出质量。
nightmedia
Huihui-gpt-oss-20b-mxfp4-abliterated-v2-qx86-hi-mlx是一个基于20B参数的大语言模型,采用量化技术优化,专门针对MLX框架进行格式转换。该模型通过高精度量化技术,在保持模型精度的同时显著提升推理效率,适用于多种自然语言处理任务。
EpistemeAI
本模型基于GPT-OSS-20B,借助Unsloth强化学习框架进行微调,旨在优化推理效率,同时减少在从人类反馈中进行强化学习(RLHF)式训练期间出现的漏洞。微调过程着重于对齐的鲁棒性和效率,确保模型在不产生过多计算开销的情况下保持推理深度。
foreverlasting1202
QuestA是一个通过问题增强方法提升大语言模型推理能力的创新框架。它在强化学习训练过程中融入部分解决方案,显著提升了模型在数学推理等复杂任务上的表现,特别是在小参数模型上实现了最优结果。
geoffmunn
这是Qwen/Qwen3-Coder-30B-A3B-Instruct语言模型的GGUF量化版本,专为本地推理优化,支持llama.cpp、LM Studio、OpenWebUI、GPT4All等框架。该模型是一个30B参数规模的代码生成和编程助手模型。
这是Qwen/Qwen3-14B语言模型的GGUF量化版本,拥有140亿参数,具备深度推理能力、研究级准确性和自主工作流程。经过转换后可用于llama.cpp、LM Studio、OpenWebUI、GPT4All等本地推理框架。
这是Qwen/Qwen3-0.6B语言模型的GGUF量化版本,一个拥有6亿参数的紧凑大语言模型,专为在低资源设备上进行超快速推理而设计。支持llama.cpp、LM Studio、OpenWebUI和GPT4All等框架,可在任何地方离线使用私有AI。
Jinx GPT OSS 20B MXFP4 MLX 是一个基于 MLX 框架转换的 200 亿参数大语言模型,采用混合精度量化技术优化,适用于苹果芯片设备的高效推理。
该项目是一个基于Model Context Protocol (MCP)的stdio服务器,用于将提示转发至OpenAI的ChatGPT (GPT-4o),支持高级摘要、分析和推理功能,适用于LangGraph框架的助手集成。
Smart-Thinking是一个先进的MCP服务器,提供多维、自适应且可自验证的AI推理框架,采用基于图形的架构实现复杂思维连接,支持跨平台运行并与多种MCP客户端兼容。
MCP代理工具适配器项目通过MCP协议实现模块化工具调用,支持Google ADK和LangGraph两种代理框架,提供动态推理和工具规划能力。
Smart-Thinking是一个先进的MCP服务器,提供多维、自适应且可自我验证的AI推理框架。
PentestThinkingMCP是一个基于大型语言模型和MCP协议的自动化渗透测试框架,能够通过Beam Search和MCTS算法规划攻击路径,为CTF、HTB及真实渗透测试提供步骤推理、工具推荐和关键路径分析。
MCP双循环推理器是一个为自主AI代理设计的元认知增强工具,通过双循环框架(哨兵监控和裁决器管理)实现异常检测和经验学习,提升代理的自我意识和可靠性。
Atom of Thoughts是一个基于分解-收缩机制的推理框架,通过将复杂问题分解为原子单元进行系统化解决,提供完整版和轻量版两种工具。
Atom of Thoughts是一个基于分解-收缩机制的推理框架,通过将复杂问题分解为原子化思考单元进行系统化验证,提供完整版和轻量版两种工具。
Adaptive Graph of Thoughts是一个基于Neo4j图数据库的智能科学推理框架,通过图结构实现复杂的科学推理任务,支持与Claude Desktop等AI应用集成。
Fluent MCP是一个用于构建具有智能推理能力的模型上下文协议(MCP)服务器的现代框架,支持AI集成、工具分离和复杂推理卸载,采用双层LLM架构实现高效推理。