月之暗面官宣第一代萬億參數多模態模型Kimi K2.5將於本月底結束服役。該模型今年1月推出並開源,是Kimi迄今最全能模型,採用原生多模態架構,支持視覺與文本輸入、思考/非思考模式、對話與Agent任務,在Agent、代碼、圖像、視頻及通用智能取得開源SOTA。K3將接力,參數規模再上臺階。
Mistral AI發佈開源內容審覈模型Shieldstral,3B參數,Apache2.0許可,支持12種語言,可在單張16GB GPU運行。號稱性能媲美7倍大模型,並在多模態審覈達SOTA,但指出多數防護模型將傷害類別體系固化。
視覺大模型因隱形門檻——頂尖效果需天量數據與算力,長期僅爲頭部團隊專屬。7月21日,小鵬集團發佈TuringViT高效視覺編碼器,系統性重構架構、數據範式與訓練流程,提供可復現、低成本的SOTA級視覺Transformer訓練路徑,推動先進視覺能力走向行業普惠。
巴西里約熱內盧市政府推出的開源大模型Rio 3.5 397B在AI圈引發關注,宣稱在多項基準測試中達到SOTA。但發佈不足24小時,Nex-AGI聯盟通過數學分析指出該模型實爲套殼縫合模型,核心權重被起底,引發行業爭議。
免費在線AI圖片編輯器,基於開源SOTA模型,無需註冊,功能強大
基於OpenAI Sora 2的AI視頻生成器,可從文本或圖像生成帶聲音的高清視頻。
B站開源的SOTA動畫視頻生成模型,支持多種二次元風格視頻一鍵生成。
VSCode擴展,基於最新的代理框架進行代碼編輯
Alibaba
-
輸入tokens/百萬
輸出tokens/百萬
上下文長度
Bytedance
$0.5
Chatglm
Minimax
01-ai
4
Nanbeige
楠米色4-3B-思維-2511是楠米色系列的最新增強版本,通過先進的蒸餾技術和強化學習優化,在緊湊的3B參數規模下實現了強大的推理能力。該模型在Arena-Hard-V2和BFCL-V4等基準測試中,在參數小於32B的模型中取得了最先進(SOTA)成果。
noctrex
Gelato-30B-A3B是針對GUI計算機使用任務進行微調的最先進(SOTA)模型,提供了量化版本以優化部署效率。該模型專門設計用於理解和處理圖形用戶界面相關的任務。
unsloth
Apriel-1.5-15b-Thinker是ServiceNow Apriel SLM系列中的多模態推理模型,具有150億參數,能夠在文本和圖像推理任務上與規模大10倍的模型競爭。該模型通過中期訓練方案實現了卓越的推理能力,無需圖像SFT訓練或強化學習即可達到SOTA性能。
XiaomiMiMo
MiMo Audio是一款基於大規模預訓練的音頻語言模型,在語音智能和音頻理解基準測試中取得了開源模型的SOTA性能。該模型展現出強大的少樣本學習能力,能夠泛化到訓練數據中未包含的任務,支持語音轉換、風格遷移和語音編輯等多種音頻任務。
cpatonn
GLM-4.5V-AWQ-4bit是基於智譜AI下一代旗艦文本基礎模型構建的量化版本多模態模型,通過AWQ-4bit量化技術優化,在保持優異性能的同時顯著降低計算資源需求。該模型在42個公開視覺語言基準測試中達到同規模模型的SOTA性能,具備強大的視覺推理能力。
JetLM
SDAR是一種新型大語言模型,集成了自迴歸和離散擴散建模策略,結合了AR模型高效訓練和擴散模型並行推理的優勢。在通用任務上與SOTA開源AR模型相當,在科學推理任務上表現出色,成為最強大的擴散語言模型。
tcpipuk
dots.ocr是一款強大的多語言文檔解析器,將佈局檢測和內容識別統一在單一視覺語言模型中,基於17億參數實現SOTA性能,支持多語言文檔解析和良好的閱讀順序保持。
lingshu-medical-mllm
靈樞是醫療領域的SOTA多模態大語言模型,在醫療視覺問答和報告生成任務中表現卓越。
RiverZ
ICEdit是一種創新的指令式圖像編輯方法,通過大規模擴散變換器實現高效編輯,僅需0.5%的訓練數據和1%的參數規模即可達到SOTA效果。
ubergarm
Qwen3-30B-A3B的量化版本,採用先進的非線性SotA量化技術,在給定內存佔用下提供同類最佳的質量。
Skywork
SkyReels V2是一個無限長度電影生成模型,採用自迴歸擴散強制架構,支持720P高清視頻生成,在公開模型中達到SOTA性能。
all-hands
基於Qwen2.5-Coder-32B-Instruct微調的評審模型,用於評估代碼解決方案質量,助力SWE-Bench基準測試取得SOTA成績
UCSC-VLAA
VLAA-Thinker-Qwen2.5-3B是一個類似R1的推理大視覺語言模型,專注於多模態推理任務。該模型在OpenCompass多模態推理排行榜上達到了SOTA性能,支持圖像理解和複雜推理能力。
qihoo360
Light-R1-32B-DS是一款近SOTA水平的32B數學模型,基於DeepSeek-R1-Distill-Qwen-32B微調,僅使用3K SFT數據即實現高性能。
Light-R1-14B-DS是一個14B參數的數學SOTA模型,採用強化學習訓練,在AIME24/25和GPQA基準測試中表現優異。
xingyang1
Distill-Any-Depth是一種新的SOTA單目深度估計模型,採用知識蒸餾算法訓練而成。
Distill-Any-Depth是一種基於知識蒸餾算法訓練的SOTA單目深度估計模型,能夠高效準確地進行深度估計。
FireRedTeam
FireRedASR是一系列支持普通話、中國方言和英語的開源工業級自動語音識別(ASR)模型,在公開的普通話ASR基準測試中實現了新的最先進水平(SOTA),同時具備出色的歌詞識別能力。
FireRedASR是一系列支持普通話、漢語方言和英語的開源工業級自動語音識別(ASR)模型,在公開普通話ASR基準測試中達到最新最優(SOTA)水平,同時具備卓越的歌詞識別能力。
ragraph-ai
這是一個專門用於生成CYPHER查詢語句的30億參數模型,在生成CYPHER方面超越了GPT4-o等SOTA模型。該模型基於特定數據集進行微調,能夠將文本轉換為CYPHER查詢語句,用於查詢GraphDB(如Neo4j)。
XiYan MCP Server是一個基於XiYan-SQL的模型上下文協議服務器,支持通過自然語言查詢數據庫,提供多種模型配置選項,包括通用大模型、SOTA文本轉SQL模型及本地模型,適用於不同安全性和性能需求場景。