グーグルはDeepThink V3を基にした実験モデルMathematicaを暴露され、複雑な計算と記号問題の解決に最適化され、最も強力な数学的推論AIとなる可能性がある。APIでは内部識別子が"models/deepthink-mathematica-tf-raw-thoughts"であり、百万トークンの文脈をサポートし、出力上限は65536トークンで、不安定な実験版と表示されている。
騰訊混元は8月28日にオープンソースの旗艦大モデルHy4previewを発表しました。総パラメータ数は770B、アクティブなパラメータは49Bで、コンテキストは1Mです。実用的な生産性を目的としています。モデルはHuggingFace、GitHub、ModelScopeなどにオープンソースされており、騰訊雲のTokenHubとOpenRouterにも上陸しています。WorkBuddy/CodeBuddy、元宝、imaなどで体験できます。このモデルはソフトウェア工学、ゲーム、金融、セキュリティなどの分野の専門家のデータによって共同構築されています。
ウィンターウォークデスク2026後のアップル社の高層幹部が、「AIモデルがジミニーのカスタマイズ版」という憶測に対して応じ、Apple Foundation Models(AFM)は完全に自社で独自開発されており、グーグルのジミニー技術を単純に借りているわけではないと強調した。ジミニーを使用してトレーニングや蒸留を行ったことはあるが、最終的な製品はアップル独自のコード、技術、データシステムに基づいて独立して作成された。
アップルはWWDC26でiOS27を発表し、その深く統合された人工知能システムであるApple Foundation Models (AFM)が注目を集めている。スターウォークGoogle Geminiとされる疑問に対して、アップルの幹部は強い態度で応じた:AFMは単なる外装変更ではなく、完全に自社開発された成果であり、一部のGemini技術のみを参考にしたに過ぎない。
オープンソースのAIモデルデータベースで、モデルの仕様、価格設定、特性情報を網羅しています。
先進的な機械学習モデルを集め、ワンストップサービスを提供し、オープンソースコミュニティを共同で構築します。
映画レベルの高画質ビデオを生成可能な画像からビデオへの変換モデル
GitHub上で構築された次世代AIエンジニア向けサービス
Moonshot
$200
入力トークン/百万
出力トークン/百万
131
コンテキスト長
amd
PARD is a high-performance speculative decoding method that can convert autoregressive draft models into parallel draft models at low cost, significantly accelerating the inference of large language models.
modelscope
Nexus-Genは大規模言語モデルの言語推論能力と拡散モデルの画像生成能力を融合させた統合モデルです
UCSC-VLAA
VLAA-Thinkerは革新的な視覚言語モデルで、画像とテキストの入力を同時に処理し、高品質なテキスト出力を生成することができます。このモデルは論文「SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models」の研究成果に基づいて開発され、R1に類似した推論能力に焦点を当てています。
Gemini
GemmaX2-28-9B-v0.1-Q2_K-GGUF は ModelSpace/GemmaX2-28-9B-v0.1 から変換された GGUF 形式モデルで、多言語翻訳タスクをサポートします。
ModelsLab
フィッシュスピーチ V1.5は、100万時間以上の多言語音声データでトレーニングされた最先端のテキスト読み上げ(TTS)モデルです。
T5-baseベースのプロンプト強化モデルで、短いプロンプトを詳細な記述に拡張可能
これはOpenCLIPフレームワークに基づき、LAION-2B英語サブセットで訓練された視覚言語モデルで、ゼロショット画像分類やクロスモーダル検索タスクに優れています。
ControlNet++は強力な画像生成と編集モデルで、複数の制御条件をサポートし、高解像度の画像を生成でき、視覚的な効果はMidjourneyに匹敵します。
Apache-2.0ライセンスに基づくオープンソースモデル。具体的な機能と用途については完全なドキュメントを参照してください
hazyresearch
M2-BERT-8Kは8000万パラメータの長文検索モデルで、論文『Benchmarking and Building Long-Context Retrieval Models with LoCo and M2-BERT』で提案されたアーキテクチャに基づいています。
Llama3-8b-instructベースモデルをトレーニングし、中国語汎用シーンに適応、ReACTフォーマットのインテリジェントエージェント呼び出しをサポート
rjhugs
microsoft/table-transformer-structure-recognition-v1.1-allを基にファインチューニングした表構造認識モデル
M2-BERT-128は論文『Benchmarking and Building Long-Context Retrieval Models with LoCo and M2-BERT』で提案された8000万パラメータの検索モデルチェックポイント
Noob
これはDDPM(Denoising Diffusion Probabilistic Models)に基づく無条件画像生成モデルで、蝶の画像に特化してファインチューニングされています。
openskyml
SDXL-Turboをベースとしたテキストから画像への生成モデルで、LCM(Latent Consistency Models)とLoRA(Low-Rank Adaptation)技術を組み合わせ、高速かつ高品質な画像生成を実現します。
cerspense
Modelscopeベースの透かしなし動画生成モデル、16:9画面比率と滑らかな動画出力を最適化
kaveh
これは全スライド画像(WSI)を生成するための拡散モデルで、Denoising Diffusion Probabilistic Models(DDPM)アーキテクチャに基づいています。
vdo
diffusersベースのテキスト・トゥ・ビデオモデルで、ModelScopeのファインチューニングによりアニメスタイルを実現、トレーニング解像度は512x512ピクセルです。
strangeman3107
これはdiffusersベースのテキスト・トゥ・ビデオモデルで、modelscopeでファインチューニングされアニメ風の外観を持ち、448x384解像度をサポートします。
ali-vilab
多段階テキストから動画を生成する拡散モデルで、英語の説明テキストを入力すると、テキストの内容に合った動画を生成します
ModelScopeの画像生成APIをベースにしたMCPサーバーで、自然言語のプロンプトによる非同期画像生成をサポートし、画像を自動的にローカルファイルとして保存します。