ELYZA、llm-jp-4ベースの33B推論モデルをApache-2.0で公開

スペック

ライセンスapache-2.0

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

ELYZAは、LLM-jpのllm-jp/llm-jp-4-33b-baseをベースにした33Bの推論モデル「elyza/ELYZA-Thinking-1.0-llm-jp-4-33b」をHugging Faceで公開しました。MMLU-Pro (en)は77.53、JMMLU (ja)は84.69です。

LLM-jpは大規模言語モデル研究開発センターが主宰する研究者のコミュニティで、日本語の処理を重視したオープンなモデルの構築を目的とする日本発のプロジェクトです。

何が新しいか

このモデルは日本語・英語の理解と生成に向けた推論モデルです。基盤はLLM-jpが日本でゼロから事前学習したllm-jp-4で、中間学習と事後学習はすべてELYZAが実施しました。ELYZAはこの構成を「Fully domestic foundation」と位置づけています。

学習データは次の3系統です。

  • 数学・コーディング・STEMの推論データを日本語化したもの
  • 検証可能な制約を複数含む日本語の指示追従データ
  • 日本語版WikipediaとWikidataから合成した知識データ

これらにより、日本語の推論、指示追従、日本固有知識の想起を重点的に強化しています。

ベンチマーク

モデルカードには、同規模の密モデルとの比較が載っています。抜粋部分のスコアは次のとおりです。

モデル MMLU-Pro (en) JMMLU (ja)
ELYZA-Thinking-1.0-llm-jp-4-33b 77.53 84.69
llm-jp-4-33b-thinking 75.74 85.22
llm-jp-4.1-33b-thinking 78.82 85.49
OLMo 3.1 32B Think 75.23 77.59
Qwen3-32B 78.75 86.09
Qwen3.5-27B 85.42 90.11
Gemma 4 31B 85.50 90.17

平均性能は、ベンチマークをまず7つの能力グループ内で平均し、次にグループ間で平均する方法で算出しています。日本語・英語別の平均では、それぞれの言語のベンチマークだけを使います。MoE版のelyza/ELYZA-Thinking-1.0-llm-jp-4-32b-a3bについては、ELYZAが別のモデルカードで個別のスコアを掲載しています。

提供条件

ライセンスはApache-2.0で、パイプライン種別はtext-generationです。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内