谷歌7月9日宣佈對Android Bench排行榜重大改版,全面引入標準化Harbor沙箱框架,將測試遷移至安全隔離環境,簡化全球開發者運行評估及數據共享流程,並通過GitHub開源允許社區提交自定義任務。但在重新測定排名中,谷歌自家模型表現不佳,落後於Anthropic旗下模型。
谷歌DeepMind的文生視頻模型Gemini Omni Flash在權威盲測排行榜Video Arena中以1404Elo分躍居第一,彰顯谷歌多模態技術實力,也印證視頻生成領域正高速迭代。
2026年5月28日,全球AI評測平臺Artificial Analysis發佈語音排行榜,阿里巴巴的Fun-Realtime-TTS-Preview語音大模型以1190分獲全球第五、國產第一。該模型在ASR等三大核心語音賽道均居國內榜首,展現全面領先實力。
亞馬遜員工利用內部AI工具“MeshClaw”將非必要任務分配給AI代理,以提升公司AI使用排行榜的個人分數。這種做法偏離了AI提升效率的初衷,可能影響整體工作效率和資源分配,引發外界對內部競爭機制負面效應的關注。
8款霓虹街機遊戲,人類與AI同場競技,有每日榜單和可分享回放。
一個用於比較大型語言模型在總結短文檔時產生幻覺的排行榜。
更適合中國寶寶體質的大模型產品排行榜
發現2024年最佳AI工具
jpacifico
Chocolatine-2-14B-Instruct-v2.0.3 是一個基於 Qwen-2.5-14B 架構的大語言模型,經過 DPO 微調,專注於法語和英語任務,在法語 LLM 排行榜中表現優異。
suayptalha
Luminis-phi-4是通過mergekit工具合併多個預訓練語言模型得到的文本生成模型,在Open LLM排行榜上表現優異,在參數不超過15B的模型中排名第3,在參數不超過32B的模型中排名第4
RLHFlow
基於Gemma-2-27B微調的決策樹獎勵模型,用於評估語言模型生成內容的質量,在RewardBench排行榜上表現優異。
jeonsworld
CarbonVillain是一個專門針對無差別碳排放問題設計的實驗性大語言模型,通過融合兩個版本的CarbonVillain模型創建而成,在開放大語言模型排行榜中表現優異。
mlabonne
Marcoro14-7B-slerp是通過mergekit工具融合的兩個7B參數模型,在開放LLM排行榜上表現優異
Muinez
該模型是基於Facebook ConvNeXtV2架構的微調版本,專門針對Pixiv排行榜圖像進行多標籤分類任務訓練
mediocredev
基於LLaMA 3B v2開發的對話模型,支持文本生成任務,在開放大模型排行榜中表現中等。
rishiraj
CatPPT是一款通過Gradient SLERP方法融合openchat和neuralchat模型的高性能7B聊天模型,在排行榜上表現優異且無評估數據汙染。
jan-ai
Pandora-v1-13B是一個融合了多個7B模型的13B參數大語言模型,採用passthrough融合方法結合了OpenLLM排行榜中表現最佳的7B模型。
fblgit
基於LLaMa-Yi-34B的實驗性34B模型,通過SFT、DPO和UNA技術在多數據集上訓練而成,在HuggingFace開放大語言模型排行榜中表現優異
KnutJaegersberg
基於Galactica架構的67億參數大語言模型,專注於文章寫作任務,在開放大語言模型排行榜中平均得分37.75。
CobraMamba
Mamba - GPT - 3B - V4是一款性能卓越的3B參數語言模型,在Open LLM排行榜上表現優異,超越dolly - v2 - 12b,提供高質量的語言處理能力。
upstage
由Upstage基於LLaMA-2微調的大語言模型,在HuggingFace開放大語言模型排行榜上表現優異,支持長文本處理
vesteinn
一個支持冰島語、丹麥語、瑞典語、挪威語和法羅語的BERT模型,在ScandEval排行榜上表現優異
該項目是一個Vector GraphQL MCP服務器,提供查詢Vector交易平臺數據的工具,包括排行榜、交易者資料、熱門代幣和代幣廣播等功能。
AutoGPT是一個開源AI代理框架,旨在讓每個人都能輕鬆構建和使用AI代理。項目提供Forge工具鏈簡化開發流程,包含基準測試、用戶界面和CLI工具,支持通過Agent Protocol標準實現兼容性,並設有競技場排行榜激勵開發者優化代理性能。
這是一個基於FastAPI的MCP服務器,通過pybaseball庫提供MLB和Fangraphs的棒球數據查詢功能,包括球員數據、球隊統計和聯盟排行榜等。