InternLM、16B-A1Bの統合マルチモーダル「Intern Lumina U2」を公開

スペック

総パラメータ16B
活性パラメータ1B
ライセンスApache 2.0
4bit量子化の目安メモリ約9.6GB(16GB以上のメモリで実行可能な目安)

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

InternLMは、言語・画像・動画・3Dを単一フレームワークに統合したマルチモーダルモデル「Intern Lumina U2」のチェックポイントをInternLM/InternLumina-U2リポジトリで公開しました。総パラメータ16B・活性パラメータ1BのMoE(16B-A1B)で、ライセンスはApache 2.0です。

モデル構成

効率的なスパースバックボーンに、ATokenを基盤とする8コードブックの完全離散視覚表現を組み合わせた構成です。1つのモデルでテキストQA、テキストからの画像生成、画像理解、画像編集、動画理解、3D理解に対応するとしています。引用情報にはIntern Lumina U2 Team, Shanghai AI Laboratoryが著者として記載されています。

2系統のチェックポイント

リポジトリには、同一アーキテクチャを異なるハードウェアスタックで学習した2種類のチェックポイントが置かれています。

サブフォルダ 学習環境
ascend/ Huawei Ascend NPUsで学習
nvidia/ NVIDIA GPUsで学習

試し方

推論コード、セットアップ手順、使用例はGitHubリポジトリにあります。infer_1024_sft.shを実行する際に、CHECKPOINTをascend/またはnvidia/のいずれかのサブフォルダに向けます。

ベンチマークについては、現時点で公開されている結果は予備的かつ部分的なものであり、完全な比較表は今後の技術報告書に掲載される予定だとしています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内