SenseNova-U1.5公開、8B-MoTでエンコーダー・VAEなしの統合マルチモーダル

スペック

総パラメータ8B
4bit量子化の目安メモリ約4.8GB(16GB以上のメモリで実行可能な目安)

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

総パラメータ8BのネイティブMoTモデル「SenseNova-U1.5」が公開されました。エンコーダーなし・VAEなしのアーキテクチャで視覚コンテンツの理解・推論・生成を1つの枠組みに統合し、最大4Kのネイティブ解像度に対応します。

何が新しいか

SenseNova-U1.5は、視覚を理解し推論し生成する処理を完全なエンドツーエンドの枠組みに統合することを目指した8B-MoTのネイティブ統合マルチモーダルモデルです。視覚インターフェースは空間的に一貫したパッチ再構成によって強化されており、学習は厳選された生成・編集データ、タスク定式化の改善、構造的プロンプトの強化、そして最大4Kのネイティブ解像度でスケールさせたと説明しています。

ポストトレーニングと改善点

ポストトレーニングでは、視覚的美しさ、バイリンガルの文字描画、インフォグラフィック生成、画像編集という4領域に向けた専門家モデルを個別に最適化し、マルチエキスパートのオンポリシー蒸留でそれらの能力を統合しています。

項目 内容
総パラメータ 8B(MoT)
ネイティブ解像度 最大4K
アーキテクチャ エンコーダーなし、VAEなし
視覚インターフェース 空間的に一貫したパッチ再構成
専門家の最適化対象 視覚的美しさ、バイリンガル文字描画、インフォグラフィック生成、画像編集

広範な評価を通じて、画像の忠実度、文字描画、複雑な構図、複数参照編集、交互生成が向上し、同時に指示追従、被写体の同一性、形状、未変更領域の保持も改善したとしています。生成データ中の構造化フォーマットへの露出は限られていたものの、長く複雑で構造化された視覚指示にも効果的に一般化し、マルチモーダル理解が視覚的なプランニングと創作に転移することを示したと述べています。

試し方・提供条件

開発元は学習コードをオープンソース化する予定で、対象には教師ありファインチューニング、強化学習、オンポリシー蒸留が含まれます。

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内