小紅書Dots Infraチームは7月22日、ネイティブマルチモーダル大規模モデル向けのパイプラインパラレル学習パラダイム「BigMac」をオープンソース化。計算速度とメモリ使用量のトレードオフを打破し、両者のバランスを実現。コードはGitHub Dots-Infraリポジトリで公開中。....
視覚大規模モデルは高性能達成に膨大なデータと計算資源が必要で、これまで一部のチームの独占だった。7月21日、小鵬集団は高効率視覚エンコーダーTuringViTを発表。アーキテクチャ・データ・訓練工程を再構築し、再現可能で低コストな最先端のViT訓練手法を提供、先進的視覚機能の業界普及を推進する。....
新浪がオープンソース化したVibeThinker-3Bは30億パラメータで、数学やプログラミングのベンチマークで100倍規模の大規模モデルに匹敵する性能を発揮。一部の競技タスクではトップ製品を上回る。この成功はアリババのQwen2を基にした独自の学習戦略によるもので、「パラメータは多ければ多いほど良い」という常識に挑戦している。....
小米技術チームがAIコーディングアシスタント「MiMo Code V0.1.0」をオープンソース化。OpenCodeをベースにMITライセンスで提供され、自由な改変や商用利用が可能。独自の永続記憶システムを搭載し、従来のAIツールの「忘れっぽさ」を解消、自己進化を実現する「モデルエージェント協調最適化」が特徴。....
ReaderLM v2は、HTMLをMarkdownとJSONに変換するための、最先端の小型言語モデルです。
Alibaba
$1
入力トークン/百万
$10
出力トークン/百万
256
コンテキスト長
$2
$20
-
Bytedance
$0.8
128
Baidu
32
Deepseek
$4
$12
$8
$1.6
Tencent
24
$0.5
$3
$9
magiccodingman
これはQwen3 VL 8Bモデルに基づく混合量子化バージョンで、MXFP4量子化技術を採用し、密集モデルで混合重みを使用しています。このモデルは、Q8に近い精度を維持しながら、より小さなファイルサイズとより高い推論速度を実現し、効率と精度のバランスに優れた解決策です。
これはQwen3 VL 8Bモデルに基づく実験的な混合量子化バージョンで、MXFP4_MOE技術を高精度の重みと組み合わせ、Q8に近い精度を維持しながら、より小さなファイルサイズとより高い推論速度を実現しています。このモデルは混合量子化方法を探索し、精度の損失とパフォーマンスの間で良好なバランスを達成しています。
Clemylia
Lam-2は、カスタムアーキテクチャAricate V4に基づいて開発された第二代の小型言語モデル(SLM)で、質問と回答のタスクで優れた性能を発揮し、卓越した言語の連貫性と創造力を持っています。前代製品と比較して、Lam-2は文法の正確性とテキスト生成の品質が著しく向上しています。
FabioSarracino
VibeVoice-Large-Q8は初の本当に使える8ビットVibeVoiceモデルで、選択的量子化技術を通じてモデルサイズを大幅に縮小しながら、元のモデルと同じ音質を維持し、VRAMが限られたシナリオに適しています。
NexaAI
Parakeet TDT 0.6B v2 MLXは、効率的な自動音声認識モデルで、句読点、大文字小文字、正確なタイムスタンプ予測をサポートし、最大24分のオーディオフラグメントを文字起こしできます。商用および非商用用途に適しています。
DFloat11
これは元のlodestones/Chroma(v39)モデルのDFloat11無損圧縮バージョンで、モデルサイズを32%縮小し、同時にビットレベルで同じ出力を維持し、高効率なGPU推論をサポートします。
py-sandy
これはGrypheのMythoMax-L2-13BモデルのGGUF変換の浮動小数点16ビット版で、高いVRAM容量を持つGPUでの全品質のローカル推論用に設計されています。
Stanford-ILIAD
MiniVLAは、より小型でありながら高性能な視覚言語アクションモデルで、Prismatic VLMsプロジェクトコードベースと互換性があります。
MiniVLAは、より小型ながら優れた性能を持つ視覚言語動作モデルで、Prismatic VLMsトレーニングスクリプトと互換性があり、ロボット技術やマルチモーダルタスクに適しています。
2121-8
Parler-TTS Mini v1は日本語に特化した小型テキスト音声変換モデルで、高品質な音声合成をサポートします。
cyan2k
Molmo-7B-DはBnB 4ビット量子化を施した大規模言語モデルで、モデルサイズが30GBから7GBに縮小され、VRAM要件が約12GBに抑えられます。
simran14
simran14/mr-model-hを基に、Common Voice 17.0マラーティー語データセットでファインチューニングされたWhisper小型音声認識モデル
fairportrobotics
FRC 578チームが開発したYOLO v10小型モデルで、教育デモンストレーション用に物体検出モデルの原理を展示
yujiepan
これはデバッグ用の小型CLIPモデルで、ViTアーキテクチャに基づき、重みをランダムに初期化しています。
1aurent
DinoBloomは血液学における細胞埋め込みタスク向けに設計されたVision Transformerベースの小型特徴抽出モデルです。
avsolatorio
NoInstruct小型埋め込みモデルv0は、検索タスクの性能向上に焦点を当てた改良型埋め込みモデルで、任意の命令エンコーディングに対する独立性を維持しています。
unum-cloud
UForm-Gen2-dpoは、直接選好最適化(DPO)を用いてVLFeedbackおよびLLaVA-Human-Preference-10K選好データセットで画像キャプション生成と視覚的質問応答タスクに対してアライメント訓練された小型生成視覚言語モデルです。
timm
ViTアーキテクチャに基づく小型CLIPモデルで、ゼロショット画像分類タスクに適しており、LAION-400Mデータセットでトレーニングされています。
fluently
Fluently V3-inpainting は複数のチェックポイントとLoRAを統合した画像修復モデルで、特に小部品や複雑な物体の修復タスクに優れています。
calum
これはTinyStories V2データセットで事前学習された小型GPT-2モデルで、300万のトレーニング可能なパラメータを持ち、優れたテキスト生成の一貫性を示します。