InternLMは、言語・画像・動画・3Dを単一フレームワークに統合したマルチモーダルモデル「Intern Lumina U2」のチェックポイントをInternLM/InternLumina-U2リポジトリで公開しました。総パラメータ16B・活性パラメータ1BのMoE(16B-A1B)で、ライセンスはApache 2.0です。
モデル構成
効率的なスパースバックボーンに、ATokenを基盤とする8コードブックの完全離散視覚表現を組み合わせた構成です。1つのモデルでテキストQA、テキストからの画像生成、画像理解、画像編集、動画理解、3D理解に対応するとしています。引用情報にはIntern Lumina U2 Team, Shanghai AI Laboratoryが著者として記載されています。
2系統のチェックポイント
リポジトリには、同一アーキテクチャを異なるハードウェアスタックで学習した2種類のチェックポイントが置かれています。
| サブフォルダ | 学習環境 |
|---|---|
ascend/ |
Huawei Ascend NPUsで学習 |
nvidia/ |
NVIDIA GPUsで学習 |
試し方
推論コード、セットアップ手順、使用例はGitHubリポジトリにあります。infer_1024_sft.shを実行する際に、CHECKPOINTをascend/またはnvidia/のいずれかのサブフォルダに向けます。
ベンチマークについては、現時点で公開されている結果は予備的かつ部分的なものであり、完全な比較表は今後の技術報告書に掲載される予定だとしています。

まだコメントはありません。