米ニュージャージー工科大学のチームが開発した機械学習モデル「EarlyDetect」は、Transformerを用いて太陽の音響活動と磁場変化データ(SDO)を分析し、太陽活動地域の形成の前兆を早期に識別します。活動地域が現れるのは数時間ですが、完全な発達には1〜数日かかるため、このモデルは宇宙天気予報に早すぎる補完情報を提供する可能性があります。
月の暗面CEO楊植麟は、オープンモデルがクローズドに迫るにはパラメータと計算力の積み増しではなくTransformerの基盤再構築が必要と語る。彼らは10年来使われてきた最適化器Adam、注意機構、残差接続を再設計し、大規模モデル学習の根本を変えつつある。....
NVIDIAは統一音声-テキスト大規模モデルAudexをリリースしました。純粋なテキストMoEアーキテクチャをベースにし、単一のTransformerを使用して、多モーダルモデルによる音声強化がテキスト論理の低下を引き起こす問題を解決し、効率的な音声理解とテキスト能力のバランスを実現しました。
Googleが新たなオープンソース大規模モデル「Gemma412B」を公開。従来のエンコーダーを排除した「Unified」アーキテクチャを採用し、テキスト、画像、音声、動画の4つのモダリティデータを同一Transformerネットワークで直接処理。外部「翻訳」モジュールによるメモリ消費や高遅延問題を解消し、エッジ側での全モーダルAIを実現した。....
Diffusion Transformerアーキテクチャに基づき、10億パラメータを持つテキストから3D動作を生成するモデルです。
13億パラメーターの画像からビデオへの変換モデルで、3D整合性のある新しいシーンビューを生成するために使用されます。
AI21 Jamba Large 1.6は、長文処理と効率的な推論に優れた、強力な混合SSM-Transformerアーキテクチャの基礎モデルです。
TransformerベースのViTPoseモデル群
Google
$0.49
入力トークン/百万
$2.1
出力トークン/百万
1k
コンテキスト長
Openai
$2.8
$11.2
Xai
$1.4
$3.5
2k
$7.7
$30.8
200
-
Anthropic
$105
$525
$0.7
$7
$35
$17.5
$21
Alibaba
$1
$10
256
Baidu
128
$6
$24
$2
$20
$4
$16
optimum-internal-testing
これはHugging Face Hub上の🤗 Transformersモデルです。具体的な情報は後で補足されます。モデルカードは自動生成されており、モデルの公開者がより詳細な情報を提供する必要があります。
Sachin-0001
これは🤗 Transformersライブラリに基づく双方向自己回帰Transformerモデルで、モデルセンターにアップロードされています。モデルカードはシステムによって自動生成され、具体的な技術詳細とアプリケーション情報はさらに補足する必要があります。
riverjiang
これはHugging Faceモデルセンターに公開されたTransformerモデルで、具体的な情報は補充待ちです。モデルカードは自動生成され、詳細情報をさらに補充する必要があります。
onnx-community
Supertonic-TTS-ONNXは、ONNX形式に基づくテキストから音声への変換モデルで、英語のテキストを自然で流れる音声に変換することができます。このモデルはSupertone/supertonic基礎モデルに基づいて開発され、Transformers.jsライブラリ用に最適化されており、ブラウザ環境で効率的に動作します。
allenai
Olmo 3はAllen Institute for AI (Ai2)によって開発された一連の言語モデルで、7Bと32Bの2種類の規格があり、InstructとThinkの2種類のバリエーションがあります。このモデルはTransformerアーキテクチャに基づいており、長い思考チェーン能力を持ち、数学やコーディングなどの推論タスクの性能を効果的に向上させることができます。
SAM3は概念ベースの任意分割モデルで、入力された点やボックスなどのプロンプト情報に基づいて、正確な画像分割マスクを生成することができます。このバージョンはONNX形式のSAM3トラッカーモデルで、Transformers.jsライブラリを通じてブラウザ環境で効率的に動作します。
peterant330
これはHugging FaceモデルセンターにアップロードされたTransformerモデルです。具体的な機能と特性については、さらに情報を補充する必要があります。
Maxlegrec
BT4モデルはLeelaChessZeroエンジンの背後にあるニューラルネットワークモデルで、チェス対局に特化しています。このモデルはTransformerアーキテクチャに基づいて設計されており、過去の手順に基づいて次の最適な手順を予測し、局面を評価し、手順の確率を生成することができます。
Olmo 3 32B Think SFTはTransformerアーキテクチャに基づく自己回帰型言語モデルで、長い思考連鎖推論に優れており、特に数学やコーディングなどの複雑な推論タスクを処理するのに適しています。このモデルはDolma 3データセットで事前学習され、Dolciデータセットで教師付き微調整されています。
NyxKrage
Moondream 3 Preview HFは、HuggingFace Transformersアーキテクチャの仕様に基づいてMoondream 3 (Preview)モデルを再実装したもので、Hugging Faceのエコシステムと完全に互換性があります。これはマルチモーダルビジュアル言語モデルで、エキスパート混合(MoE)テキストバックボーンを採用し、約90億のパラメータと20億のアクティブパラメータを持ちます。
JetBrains-Research
これはHugging Face Hubに公開されている🤗 Transformersモデルです。具体的な情報はモデルページから取得する必要があります。このモデルはTransformerアーキテクチャに基づいており、様々な自然言語処理タスクに適しています。
Prior-Labs
TabPFN-2.5はTransformerアーキテクチャに基づく表基礎モデルで、コンテキスト学習技術を利用して、一度の順伝播で表予測問題を解決し、構造化表データに効率的な回帰と分類の解決策を提供します。
mitegvg
このモデルはVideoMAEアーキテクチャに基づく暴力検出モデルで、Kineticsデータセットで事前学習した後、暴力検出タスクに対して92エポックの微調整を行っています。モデルはVision Transformerアーキテクチャを採用し、ビデオコンテンツ分析に特化しており、ビデオ内の暴力行為を識別することができます。
strangervisionhf
これはDeepSeek - OCRに基づく画像テキスト認識モデルで、最新バージョンのtransformersライブラリでの互換性問題を特別に解決し、モデルがtransformers v4.57.1などの最新バージョンでスムーズに動作できるようにします。
ByteDance
Ouro-2.6Bは26億のパラメータを持つ循環言語モデルで、反復的な重み共有計算により卓越したパラメータ効率を実現し、わずか26億のパラメータで30 - 40億の標準Transformerモデルの性能レベルに達しています。
Ouro-1.4Bはバイトダンスによって開発された14億のパラメータを持つ循環言語モデルで、反復共有重み計算によって卓越したパラメータ効率を実現し、わずか14億のパラメータで30 - 40億の標準Transformerモデルの性能レベルに達しています。
ServiceNow-AI
Apriel-H1-15b-Thinkerは150億のパラメータを持つ混合推論モデルで、Transformerの注意力機構とMambaの状態空間層を組み合わせており、推論、数学、コーディングなどの分野で優れた性能を発揮し、高効率性と拡張性を備えています。
danggia
これはHugging Faceモデルセンターにアップロードされたtransformersモデルです。モデルカードはシステムによって自動生成され、詳細情報はさらに補充する必要があります。
これは修復された画像テキストをテキストに変換するモデルで、元のモデルが最新のTransformersバージョンで推論に失敗する問題を解決しました。このモデルは画像認識とテキスト生成タスクに特化しており、マルチモーダル入力処理をサポートしています。
impresso-project
Impresso NERモデルは、歴史文書の処理に特化した多言語の固有表現認識モデルです。スタック型Transformerアーキテクチャに基づいており、デジタル化された歴史テキスト中の細粒度および粗粒度のエンティティタイプ(人名、肩書き、場所など)を認識することができます。このモデルは、歴史文書中のOCRノイズ、スペルの変化、非標準的な言語の使い方に対して最適化されています。