谷歌被曝基於DeepThink V3打造實驗模型Mathematica,針對複雜計算與符號問題求解優化,或成最強數學推理AI。API顯示其內部標識符爲“models/deepthink-mathematica-tf-raw-thoughts”,支持百萬token上下文,輸出上限65536 token,並標註“不穩定實驗版”。
騰訊發佈混元 Hy4 preview 開源模型,總參數770B、激活參數49B,上下文長度1M。官方稱預訓練與後訓練同步進步,智能水平躍升,居開源第一梯隊。模型已在 HuggingFace、GitHub、ModelScope、Gitcode 上線,並接入騰訊雲 TokenHub 與 OpenRouter。生產力場景盲測力壓 GLM-5.3 與 Kimi K3。
騰訊混元8月28日發佈開源旗艦大模型Hy4preview,總參數770B、激活參數49B,上下文1M,定位真實生產力。模型已開源至HuggingFace、GitHub、ModelScope等,並上線騰訊雲TokenHub、OpenRouter,可在WorkBuddy/CodeBuddy、元寶、ima體驗。其依託軟工、遊戲、金融、安全等領域專家數據共建,在四大方向取得進展。
蘋果公司高管在WWDC 2026後迴應“AI模型爲Gemini套殼版”的猜測,強調Apple Foundation Models(AFM)完全自主研發,非簡單借用谷歌Gemini技術。雖在蒸餾與訓練中藉助Gemini,但最終產品基於蘋果自有代碼、技術和數據體系,獨立完成。
開源AI模型數據庫,涵蓋模型規格、定價和特性信息
匯聚先進機器學習模型,提供一站式服務,共建開源社區。
為Firefox瀏覽器翻譯功能優化的CPU加速神經機器翻譯模型。
一款能夠生成電影級質量視頻的圖像到視頻模型
Moonshot
$200
輸入tokens/百萬
輸出tokens/百萬
131
上下文長度
modelscope
Nexus-Gen是一個將大語言模型的語言推理能力與擴散模型的圖像生成能力相融合的統一模型
UCSC-VLAA
VLAA-Thinker是一個創新的視覺語言模型,能夠同時處理圖像和文本輸入,並生成高質量的文本輸出。該模型基於論文《SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models》的研究成果開發,專注於類似R1的推理能力。
Gemini
GemmaX2-28-9B-v0.1-Q2_K-GGUF 是一個基於 ModelSpace/GemmaX2-28-9B-v0.1 轉換而來的 GGUF 格式模型,支持多種語言的翻譯任務。
ModelsLab
魚語語音 V1.5 是一款領先的文本轉語音(TTS)模型,基於超過100萬小時的多語言音頻數據訓練而成。
基於T5-base的提示詞增強模型,可將簡短提示擴展為詳細描述
這是一個基於OpenCLIP框架、在LAION-2B英語子集上訓練的視覺語言模型,擅長零樣本圖像分類和跨模態檢索任務。
ControlNet++是一款強大的圖像生成與編輯模型,支持多種控制條件,能生成高分辨率圖像,視覺效果可與Midjourney相媲美。
基於Apache-2.0許可證的開源模型,具體功能和用途需參考完整文檔
hazyresearch
M2-BERT-8K是一個8000萬參數的長上下文檢索模型,基於論文《Benchmarking and Building Long-Context Retrieval Models with LoCo and M2-BERT》提出的架構。
基於Llama3-8b-instruct基礎模型訓練,適配中文通用場景,支持ReACT格式的智能體調用
rjhugs
基於microsoft/table-transformer-structure-recognition-v1.1-all微調的表格結構識別模型
M2-BERT-128是論文《Benchmarking and Building Long-Context Retrieval Models with LoCo and M2-BERT》中提出的8000萬參數檢索模型檢查點
openskyml
基於SDXL-Turbo的文本到圖像生成模型,結合了LCM(Latent Consistency Models)和LoRA(Low-Rank Adaptation)技術,實現快速高質量的圖像生成。
cerspense
一款基於Modelscope的無水印視頻生成模型,優化16:9畫面比例和流暢視頻輸出
vdo
基於diffusers的文本轉視頻模型,通過ModelScope微調實現動漫風格呈現,訓練分辨率為512x512像素。
strangeman3107
這是一個基於diffusers的文本轉視頻模型,通過modelscope微調後具有動漫風格外觀,支持448x384分辨率。
ali-vilab
多階段文本生成視頻擴散模型,輸入英文描述文本即可生成符合文字敘述的視頻內容
wavymulder
一個基於穩定擴散技術的文本到圖像生成模型,能夠根據文本描述生成高質量的圖像。
一個基於ModelScope圖像生成API的MCP服務器,支持通過自然語言提示詞異步生成圖像,並自動保存到本地文件。