DeepSeek本週發佈V4.1 Flash,架構變化巨大但未升大版本號。V4.1 Pro已確定,具體升級未公佈,性能上限或較高,但鑑於前代Pro不及預期,外界期待不宜過高。另有Code 2.0被曝即將發佈,主打電腦控制,後續還有更多大模型。
DeepSeek近期動作密集:本週低調發布V4.1 Flash,雖未調整大版本號,但底層架構升級幅度已達V5級別;後續還將推出全新大模型Code2.0及V4.1 Pro系列,其架構換代與新品路線引發行業關注。
AI服務平臺WorkBuddy宣佈全面上線DeepSeek最新V4.1-Flash模型,並開啓兩週免費試用,降低開發者與用戶體驗門檻。該模型已登陸DeepSeek API,具備原生多模態支持能力,用戶調用時只需將模型設置項調整爲對應標識即可。此舉體現大模型領域迭代持續加快。
8月13日AI產品密集發佈,馬斯克推出Grok4.6、千問開源Qwen3.8Max。DeepSeek同步低調上線V4Pro正式版DeepSeek-V4-Pro-0813,API與Chat端均已更新,用戶按原方式指定名稱即可接入。官方跑分顯示其核心指標表現優異。
Google
$0.49
輸入tokens/百萬
$2.1
輸出tokens/百萬
1k
上下文長度
Openai
$2.8
$11.2
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$1
$10
256
$6
$24
$2
$20
$4
$16
Baidu
128
Bytedance
$1.2
$3.6
4
Undi95
Lumimaid與Magnum v4合併的12B參數大語言模型,採用DELLA合併方法並加入針對Claude輸入優化的Nemo模型
anthracite-org
馬格南v4-22B是基於Mistral-Small-Instruct-2409微調的大型語言模型,專門致力於復刻Claude 3系列模型(尤其是Sonnet和Opus)的文本質量。該模型提供了GGUF量化版本,支持32K上下文長度,在多個高質量數據集上進行訓練。
TheBloke
Athena v4是一個實驗性的大型語言模型,適用於角色扮演、情感角色扮演及通用場景。使用Alpaca格式提示模板。