Aleph Alphaは2026年10月3日、ドイツ語・英語向けのオープンウェイトLLM「Kolibri 1」をApache 2.0ライセンスでHugging Faceに公開しました。総パラメータは78.1B、トークンごとの活性パラメータは3.46B(全体の4.4%)のMoEモデルで、ネイティブのコンテキスト長は262,144トークンです。Aleph Alphaは1,048,576トークンまで動作を検証しています。
何が新しいか
Kolibri 1は、ドイツおよびフィンランドのインフラ上で、欧州・ドイツ法の下でゼロから学習したモデルです。Aleph Alphaはこれを「主権的」と説明しています。学習には768基のNVIDIA B200 GPUを使い、約24兆トークンを投入しました。そのうち5分の1超がドイツ語です。原文はIBMのAIエンジニアTejas Kumar氏の解説記事で、技術レポート、モデルカード、ローンチ記事を基にしています。
モデルの特徴は次のとおりです。
- ドイツ語の複合語を効率よく扱うトークナイザー: 新アルゴリズムUniBPEで学習した語彙数128,000のトークナイザーを採用しています。
Bundesverfassungsgerichtはo200k_baseでは6トークンに分かれますが、Kolibriでは2トークンで済みます。 - ドイツ語での推論: ドイツ語のプロンプトにはドイツ語で推論します。
- 「分からない」と答える訓練: 根拠となる情報がない場合に回答を作らず、分からないと答えるよう訓練しています。
アーキテクチャと評価
アーキテクチャ
| 項目 | 内容 |
|---|---|
| 層数 | 50層 |
| MoE | 各層384専門家+共有専門家1。各トークンを6専門家へルーティング |
| スライディングウィンドウ注意 | 50層中40層が直前512トークンを参照 |
| フル注意 | 5層ごとに1層が、それ以前の全トークンを参照 |
| 推論レベル | reasoning_effort: none / low / medium / high |
| ツール呼び出し | 対応 |
| 知識カットオフ | 2026年6月18日 |
評価(Aleph Alpha自身の評価)
比較対象は、活性パラメータが約3BのオープンMoEモデルです。
| 指標 | Kolibri 1 | 次点 |
|---|---|---|
| 総合スコア(英語) | 75.5 | 74.7(Qwen3.5 35B-A3B) |
| 総合スコア(ドイツ語) | 70.8 | 69.8(Qwen3.5 35B-A3B) |
| AIME 2025(英語) | 96.9 | 89.6(Nemotron 3 Nano) |
| AIME 2025(ドイツ語) | 87.5 | 84.4(Nemotron 3 Nano) |
| 未見の企業文書QA(英語) | 89.7 | 87.0(Qwen3.5 35B-A3B) |
長文脈では、ベースモデルが100万トークン時のRULERで63.2を記録しています。
Omniscienceテストでは、答えを知らない問題に対して44%の割合で「分からない」または部分回答を返しました。同じ指標でQwen3.5 35B-A3Bは11.1%、GPT-OSS 120Bは23.7%です。
一方、モデルカードは次の点を弱点として挙げています。
- 記憶に頼る知識: 文書なしのクローズドブック試験で51.0となり、比較した12モデル中最下位でした。Omniscienceの正答率も14.8%にとどまります。
- マルチターンのツール呼び出し: BFCLのマルチターンテストで39.8です。
- コーディングエージェント性能: 弱点に含まれています。
試し方・要件
- 重みはHugging Faceから取得できます。
- FP8の重みで約78GBのメモリを使います。活性化されるのは一部のパラメータだけですが、モデル全体をメモリに保持する必要があります。
- 同一サーバー上で、リクエストごとに
reasoning_effortをnone、low、medium、highから選べます。 - Apache 2.0の対象は重みと設定ファイルです。学習コードと手法の権利はAleph Alphaが保持しています。
背景
Kolibri 1は欧州で学習したモデルですが、学習データの作成には外部のモデルも使っています。英語のWebテキストの言い換えにはGoogleのGemma 4、ドイツ語の言い換えにはMistral-NeMoを使い、品質フィルタ用のラベル付けにはQwen3-32Bを利用しました。GemmaはGoogleが開発するオープンなAIモデルのファミリーです。

まだコメントはありません。