騰訊開源統訓框架AngelSpec,通過多方案協同與工作負載異構適配,降低大模型自迴歸解碼成本,提升推理吞吐量。針對不同場景文本特徵採取差異化訓練策略,如高熵多輪對話採用輕量穩定方案,實現真實場景下的高效推理。
文遠知行在2026世界人工智能大會發布WIIT大模型,提出“最小物理事實單元”理念,將連續環境拆解爲基礎事實,構建物理世界AI理解框架,包含事實提取、推理、驗證等模塊,推動AI從數據理解邁向真實世界認知。
輕量級端到端OCR模型HyOCR-1.5發佈,在保持輕量化同時大幅提升性能與效率。作爲首個全棧開源OCR模型,它全面開放權重、訓練配方、數據構造方法及推理加速框架,顯著降低開發門檻,讓開發者可輕鬆復現、微調,並在消費級顯卡或筆記本上部署。
北大與DeepSeek聯合開源大模型推理加速框架DSpark,針對自迴歸生成中每詞元均需全算力導致的高併發延遲與算力浪費,提供突破性解決方案。
一個通用框架,用於在測試時調節大型推理模型的思維進度。
一個高效的強化學習框架,用於訓練推理和搜索引擎調用的語言模型。
Atom of Thoughts (AoT) 是一種用於提升大語言模型推理性能的框架。
ViDoRAG 是一個結合視覺文檔檢索增強生成的動態迭代推理代理框架。
Xai
$1.4
輸入tokens/百萬
$3.5
輸出tokens/百萬
2k
上下文長度
Openai
$7.7
$30.8
200
-
Anthropic
$7
$35
Google
$2.1
$17.5
1k
$21
$105
$0.7
$2.8
Alibaba
$1
$10
256
$6
$24
$2
$20
$4
$16
Baidu
128
Moonshot
Bytedance
$0.8
32
Deepseek
$12
PrimeIntellect
INTELLECT-3是一個擁有1060億參數的混合專家(MoE)模型,通過大規模強化學習訓練而成。在數學、編碼和推理基準測試中展現出卓越性能,模型、訓練框架和環境均以寬鬆許可協議開源。
mlx-community
VibeThinker-1.5B的4位量化版本,基於MLX框架針對蘋果芯片優化,是一個擁有15億參數的密集語言模型,專門用於數學推理和算法編碼問題
hasanbasbunar
Lodos-24B-Instruct-2510是基於Mistral-Small-3.2-24B-Instruct-2506微調的土耳其語大語言模型,使用TRL框架進行全監督微調,專門針對土耳其語指令遵循任務優化,支持長文本生成和複雜推理。
QuantTrio
MiniMax-M2-AWQ是基於MiniMaxAI/MiniMax-M2模型的量化版本,通過vLLM框架實現高效的文本生成。該模型採用AWQ量化技術,在保持模型性能的同時顯著減少內存佔用和提升推理速度,支持32K上下文長度和工具調用功能。
Mungert
PokeeResearch-7B是由Pokee AI開發的70億參數深度研究代理模型,結合了AI反饋強化學習(RLAIF)和強大的推理框架,能夠在工具增強的大語言模型中實現可靠、對齊和可擴展的研究級推理,適用於複雜的多步驟研究工作流程。
這是一個基於Qwen3-VL-32B-Thinking模型轉換的4位量化版本,專門針對MLX框架優化。該模型是一個32B參數規模的多模態視覺語言模型,具備思維鏈推理能力,能夠同時處理圖像和文本輸入,生成高質量的文本響應。
PokeeAI
PokeeResearch-7B是由Pokee AI開發的70億參數深度研究智能體,結合基於AI反饋的強化學習(RLAIF)與推理框架,能夠執行復雜的多步驟研究工作流程,包括自我修正、驗證和綜合分析。
Thrillcrazyer
Qwen-1.5B_THIP是基於DeepSeek-R1-Distill-Qwen-1.5B在DeepMath-103k數學數據集上使用TRL框架進行GRPO方法微調的數學推理模型。該模型專門針對數學問題解決進行了優化,具備較強的數學推理能力。
這是IBM Granite-4.0-h-Tiny模型的4位量化版本,專為Apple Silicon優化,使用MLX框架進行高效推理。模型經過DWQ(動態權重量化)處理,在保持性能的同時顯著減小模型大小。
DeepSeek-V3.2-Exp-AWQ是基於DeepSeek-V3.2-Exp模型的量化版本,通過vLLM框架實現高效文本生成。該模型引入了DeepSeek稀疏注意力機制,在長上下文訓練和推理效率上有顯著提升,同時保持了模型輸出質量。
nightmedia
Huihui-gpt-oss-20b-mxfp4-abliterated-v2-qx86-hi-mlx是一個基於20B參數的大語言模型,採用量化技術優化,專門針對MLX框架進行格式轉換。該模型通過高精度量化技術,在保持模型精度的同時顯著提升推理效率,適用於多種自然語言處理任務。
EpistemeAI
本模型基於GPT-OSS-20B,藉助Unsloth強化學習框架進行微調,旨在優化推理效率,同時減少在從人類反饋中進行強化學習(RLHF)式訓練期間出現的漏洞。微調過程著重於對齊的魯棒性和效率,確保模型在不產生過多計算開銷的情況下保持推理深度。
foreverlasting1202
QuestA是一個通過問題增強方法提升大語言模型推理能力的創新框架。它在強化學習訓練過程中融入部分解決方案,顯著提升了模型在數學推理等複雜任務上的表現,特別是在小參數模型上實現了最優結果。
geoffmunn
這是Qwen/Qwen3-Coder-30B-A3B-Instruct語言模型的GGUF量化版本,專為本地推理優化,支持llama.cpp、LM Studio、OpenWebUI、GPT4All等框架。該模型是一個30B參數規模的代碼生成和編程助手模型。
這是Qwen/Qwen3-14B語言模型的GGUF量化版本,擁有140億參數,具備深度推理能力、研究級準確性和自主工作流程。經過轉換後可用於llama.cpp、LM Studio、OpenWebUI、GPT4All等本地推理框架。
這是Qwen/Qwen3-0.6B語言模型的GGUF量化版本,一個擁有6億參數的緊湊大語言模型,專為在低資源設備上進行超快速推理而設計。支持llama.cpp、LM Studio、OpenWebUI和GPT4All等框架,可在任何地方離線使用私有AI。
Jinx GPT OSS 20B MXFP4 MLX 是一個基於 MLX 框架轉換的 200 億參數大語言模型,採用混合精度量化技術優化,適用於蘋果芯片設備的高效推理。
lmstudio-community
Qwen3-Next-80B-A3B-Instruct是阿里雲通義千問團隊開發的大規模語言模型,經過MLX框架4位量化優化,專門針對蘋果芯片設備進行了性能優化,提供高效的推理能力。
TheClusterDev
這是Qwen3-Next-80B-A3B-Instruct模型的FP8量化版本,通過vLLM框架支持,在保持模型質量的同時顯著減小了模型體積,提升了推理效率。
wekW
本模型是百度ERNIE-4.5-21B-A3B-Thinking模型的GGUF量化版本,採用Q8_0量化格式,通過llama.cpp工具轉換而成,支持在兼容GGUF格式的推理框架中使用。
Atom of Thoughts是一個基於分解-收縮機制的推理框架,通過將複雜問題分解為原子化思考單元進行系統化驗證,提供完整版和輕量版兩種工具。
任務門戶系統是一個自我演進的通用問題解決機構,具備邏輯推理、倫理框架、序列思考和元框架等核心組件,能夠安全地自我進化並解決複雜問題。
MCP代理工具適配器項目通過MCP協議實現模塊化工具調用,支持Google ADK和LangGraph兩種代理框架,提供動態推理和工具規劃能力。
MCP雙循環推理器是一個為自主AI代理設計的元認知增強工具,通過雙循環框架(哨兵監控和裁決器管理)實現異常檢測和經驗學習,提升代理的自我意識和可靠性。
該項目是一個基於Model Context Protocol (MCP)的stdio服務器,用於將提示轉發至OpenAI的ChatGPT (GPT-4o),支持高級摘要、分析和推理功能,適用於LangGraph框架的助手集成。
Smart-Thinking是一個先進的MCP服務器,提供多維、自適應且可自驗證的AI推理框架,採用基於圖形的架構實現複雜思維連接,支持跨平臺運行並與多種MCP客戶端兼容。
Smart-Thinking是一個先進的MCP服務器,提供多維、自適應且可自我驗證的AI推理框架。
Atom of Thoughts是一個基於分解-收縮機制的推理框架,通過將複雜問題分解為原子單元進行系統化解決,提供完整版和輕量版兩種工具。
Adaptive Graph of Thoughts是一個基於Neo4j圖數據庫的智能科學推理框架,通過圖結構實現複雜的科學推理任務,支持與Claude Desktop等AI應用集成。
PentestThinkingMCP是一個基於大型語言模型和MCP協議的自動化滲透測試框架,能夠通過Beam Search和MCTS算法規劃攻擊路徑,為CTF、HTB及真實滲透測試提供步驟推理、工具推薦和關鍵路徑分析。
Fluent MCP是一個用於構建具有智能推理能力的模型上下文協議(MCP)服務器的現代框架,支持AI集成、工具分離和複雜推理卸載,採用雙層LLM架構實現高效推理。