月之暗面CEO楊植麟透露,讓開源模型逼近閉源前沿不能只堆參數算力,更要重構Transformer根基。他們重新設計了沿用近十年的優化器Adam、注意力機制和殘差連接,悄然撬動大模型訓練的地基。
通義實驗室推出Wan-Streamer v0.2,徹底解決傳統視頻通話卡頓、延遲和聲畫不同步問題。該端到端全模態模型僅550毫秒響應,將聽、看、說、演能力整合於單一Transformer架構,實現近乎真實的“面對面”自然交流。
螞蟻集團Robbyant開源LingBot-Vision模型家族,通過自監督視覺Transformer與創新“邊界建模”,在密集空間感知任務上表現卓越,多項指標超越數倍參數的大模型,突破了現有視覺基礎模型偏重物體識別的侷限,讓機器人精準感知物理空間成現實。
NVIDIA推出統一音頻-文本大模型Audex,基於純文本MoE架構,採用單一Transformer,解決多模態模型音頻增強導致文本邏輯下降的難題,實現高效音頻理解與文本能力的平衡。
基於 Diffusion Transformer 架構的十億參數文生 3D 動作模型。
1.3B參數的圖像轉視頻模型,用於生成3D一致的新場景視圖
AI21 Jamba Large 1.6 是一款強大的混合 SSM-Transformer 架構基礎模型,擅長長文本處理和高效推理。
基於Transformer實現的ViTPose模型集合
Google
$0.49
輸入tokens/百萬
$2.1
輸出tokens/百萬
1k
上下文長度
Openai
$2.8
$11.2
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$1
$10
256
$6
$24
$4
$16
$2
$20
Baidu
128
Bytedance
$1.2
$3.6
4
optimum-internal-testing
這是一個Hugging Face Hub上的🤗 Transformers模型,具體信息待補充。模型卡片為自動生成,需要模型發佈者提供更多詳細信息。
Sachin-0001
這是一個基於🤗 Transformers庫的雙向自迴歸Transformer模型,已上傳至模型中心。模型卡片由系統自動生成,具體技術細節和應用信息需要進一步補充。
riverjiang
這是一個發佈在Hugging Face模型中心的Transformer模型,具體信息待補充。模型卡片為自動生成,需要進一步補充詳細信息。
onnx-community
Supertonic-TTS-ONNX是一個基於ONNX格式的文本到語音轉換模型,能夠將英文文本轉換為自然流暢的語音。該模型基於Supertone/supertonic基礎模型開發,專為Transformers.js庫優化,支持在瀏覽器環境中高效運行。
allenai
Olmo 3是由Allen Institute for AI (Ai2)開發的一系列語言模型,包含7B和32B兩種規格,有Instruct和Think兩種變體。該模型基於Transformer架構,具有長鏈思維能力,可有效提升數學和編碼等推理任務的表現。
SAM3是基於概念的任意分割模型,能夠根據輸入的點、框等提示信息生成精確的圖像分割掩碼。該版本是ONNX格式的SAM3跟蹤器模型,通過Transformers.js庫可在瀏覽器環境中高效運行。
peterant330
這是一個上傳至Hugging Face模型中心的Transformer模型,具體功能和特性需要進一步補充信息。
Maxlegrec
BT4模型是LeelaChessZero引擎背後的神經網絡模型,專門用於國際象棋對弈。該模型基於Transformer架構設計,能夠根據歷史走法預測最佳下一步走法、評估棋局形勢並生成走法概率。
Olmo 3 32B Think SFT是基於Transformer架構的自迴歸語言模型,在長鏈思維推理方面表現出色,特別擅長處理數學和編碼等複雜推理任務。該模型在Dolma 3數據集上進行預訓練,並在Dolci數據集上進行監督微調。
NyxKrage
Moondream 3 Preview HF是基於HuggingFace Transformers架構規範對Moondream 3 (Preview)模型的重新實現,使其能夠與Hugging Face生態系統完全兼容。這是一個多模態視覺語言模型,採用專家混合(MoE)文本主幹,約90億參數,20億活躍參數。
JetBrains-Research
這是一個已發佈在Hugging Face Hub上的🤗 Transformers模型,具體信息需要從模型頁面獲取。該模型基於Transformer架構,適用於多種自然語言處理任務。
Prior-Labs
TabPFN-2.5是基於Transformer架構的表格基礎模型,利用上下文學習技術,能夠在一次前向傳播中解決表格預測問題,為結構化表格數據提供高效的迴歸和分類解決方案。
mitegvg
該模型是基於VideoMAE架構的暴力檢測模型,在Kinetics數據集預訓練的基礎上,針對暴力檢測任務進行了92輪微調。模型採用Vision Transformer架構,專門用於視頻內容分析,能夠識別視頻中的暴力行為。
strangervisionhf
這是一個基於DeepSeek-OCR的圖像文本識別模型,專門解決了在最新版本transformers庫中的兼容性問題,使模型能夠在transformers v4.57.1等最新版本中順利運行。
bn22
這是一個發佈在Hugging Face模型中心的Transformer模型,模型卡片由系統自動生成,具體模型信息需要進一步補充
ByteDance
Ouro-2.6B是一款擁有26億參數的循環語言模型,通過迭代共享權重計算實現了卓越的參數效率,在僅用26億參數的情況下達到了30-40億標準Transformer模型的性能水平。
Ouro-1.4B是由字節跳動開發的具有14億參數的循環語言模型,通過迭代共享權重計算實現了卓越的參數效率,僅用14億參數就達到了30-40億標準Transformer模型的性能水平。
danggia
這是一個已上傳至Hugging Face模型中心的transformers模型,模型卡片由系統自動生成,詳細信息需要進一步補充。
這是一個修復後的圖像文本轉文本模型,解決了原模型在最新Transformers版本中推理失敗的問題。該模型專門用於圖像識別和文本生成任務,支持多模態輸入處理。
impresso-project
Impresso NER模型是一個專門用於歷史文檔處理的多語言命名實體識別模型。基於堆疊式Transformer架構,能夠識別數字化歷史文本中的細粒度和粗粒度實體類型,包括人名、頭銜、地點等。該模型針對歷史文檔中的OCR噪聲、拼寫變化和非標準語言用法進行了優化。