IBM、複雑なドキュメントを簡単に解析するビジョン言語モデルGranite-Vision-3.1-2Bを発表
人工知能技術の進歩に伴い、視覚データとテキストデータの融合は複雑な課題となっています。従来のモデルでは、表、グラフ、インフォグラフィック、図表などの構造化された視覚ドキュメントを正確に解析することが困難であり、自動的なコンテンツ抽出と理解能力に影響を与え、ひいてはデータ分析、情報検索、意思決定などのアプリケーションに影響を与えてきました。このニーズに応えるため、IBMは最近、ドキュメント理解のために設計された小型のビジョン言語モデルであるGranite-Vision-3.1-2Bを発表しました。