Aleph Alpha、独英向けMoE「Kolibri 1」を78.1Bで公開

スペック

総パラメータ78.1 billion
活性パラメータ3.46 billion per token
コンテキスト長262,144 tokens natively, tested up to 1,048,576
ライセンスApache 2.0
重みの公開オープンウェイト、Hugging Faceで公開
配布形式・量子化8-bit floating point(FP8)

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

Aleph Alphaは2026年10月3日、ドイツ語・英語向けのオープンウェイトLLM「Kolibri 1」をApache 2.0ライセンスでHugging Faceに公開しました。総パラメータは78.1B、トークンごとの活性パラメータは3.46B(全体の4.4%)のMoEモデルで、ネイティブのコンテキスト長は262,144トークンです。Aleph Alphaは1,048,576トークンまで動作を検証しています。

何が新しいか

Kolibri 1は、ドイツおよびフィンランドのインフラ上で、欧州・ドイツ法の下でゼロから学習したモデルです。Aleph Alphaはこれを「主権的」と説明しています。学習には768基のNVIDIA B200 GPUを使い、約24兆トークンを投入しました。そのうち5分の1超がドイツ語です。原文はIBMのAIエンジニアTejas Kumar氏の解説記事で、技術レポート、モデルカード、ローンチ記事を基にしています。

モデルの特徴は次のとおりです。

  • ドイツ語の複合語を効率よく扱うトークナイザー: 新アルゴリズムUniBPEで学習した語彙数128,000のトークナイザーを採用しています。Bundesverfassungsgerichtはo200k_baseでは6トークンに分かれますが、Kolibriでは2トークンで済みます。
  • ドイツ語での推論: ドイツ語のプロンプトにはドイツ語で推論します。
  • 「分からない」と答える訓練: 根拠となる情報がない場合に回答を作らず、分からないと答えるよう訓練しています。

アーキテクチャと評価

アーキテクチャ

項目 内容
層数 50層
MoE 各層384専門家+共有専門家1。各トークンを6専門家へルーティング
スライディングウィンドウ注意 50層中40層が直前512トークンを参照
フル注意 5層ごとに1層が、それ以前の全トークンを参照
推論レベル reasoning_effort: none / low / medium / high
ツール呼び出し 対応
知識カットオフ 2026年6月18日

評価(Aleph Alpha自身の評価)

比較対象は、活性パラメータが約3BのオープンMoEモデルです。

指標 Kolibri 1 次点
総合スコア(英語) 75.5 74.7(Qwen3.5 35B-A3B)
総合スコア(ドイツ語) 70.8 69.8(Qwen3.5 35B-A3B)
AIME 2025(英語) 96.9 89.6(Nemotron 3 Nano)
AIME 2025(ドイツ語) 87.5 84.4(Nemotron 3 Nano)
未見の企業文書QA(英語) 89.7 87.0(Qwen3.5 35B-A3B)

長文脈では、ベースモデルが100万トークン時のRULERで63.2を記録しています。

Omniscienceテストでは、答えを知らない問題に対して44%の割合で「分からない」または部分回答を返しました。同じ指標でQwen3.5 35B-A3Bは11.1%、GPT-OSS 120Bは23.7%です。

一方、モデルカードは次の点を弱点として挙げています。

  • 記憶に頼る知識: 文書なしのクローズドブック試験で51.0となり、比較した12モデル中最下位でした。Omniscienceの正答率も14.8%にとどまります。
  • マルチターンのツール呼び出し: BFCLのマルチターンテストで39.8です。
  • コーディングエージェント性能: 弱点に含まれています。

試し方・要件

  • 重みはHugging Faceから取得できます。
  • FP8の重みで約78GBのメモリを使います。活性化されるのは一部のパラメータだけですが、モデル全体をメモリに保持する必要があります。
  • 同一サーバー上で、リクエストごとにreasoning_effortをnone、low、medium、highから選べます。
  • Apache 2.0の対象は重みと設定ファイルです。学習コードと手法の権利はAleph Alphaが保持しています。

背景

Kolibri 1は欧州で学習したモデルですが、学習データの作成には外部のモデルも使っています。英語のWebテキストの言い換えにはGoogleのGemma 4、ドイツ語の言い換えにはMistral-NeMoを使い、品質フィルタ用のラベル付けにはQwen3-32Bを利用しました。GemmaはGoogleが開発するオープンなAIモデルのファミリーです。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内