ELYZAは、LLM-jpのllm-jp/llm-jp-4-33b-baseをベースにした33Bの推論モデル「elyza/ELYZA-Thinking-1.0-llm-jp-4-33b」をHugging Faceで公開しました。MMLU-Pro (en)は77.53、JMMLU (ja)は84.69です。
LLM-jpは大規模言語モデル研究開発センターが主宰する研究者のコミュニティで、日本語の処理を重視したオープンなモデルの構築を目的とする日本発のプロジェクトです。
何が新しいか
このモデルは日本語・英語の理解と生成に向けた推論モデルです。基盤はLLM-jpが日本でゼロから事前学習したllm-jp-4で、中間学習と事後学習はすべてELYZAが実施しました。ELYZAはこの構成を「Fully domestic foundation」と位置づけています。
学習データは次の3系統です。
- 数学・コーディング・STEMの推論データを日本語化したもの
- 検証可能な制約を複数含む日本語の指示追従データ
- 日本語版WikipediaとWikidataから合成した知識データ
これらにより、日本語の推論、指示追従、日本固有知識の想起を重点的に強化しています。
ベンチマーク
モデルカードには、同規模の密モデルとの比較が載っています。抜粋部分のスコアは次のとおりです。
| モデル | MMLU-Pro (en) | JMMLU (ja) |
|---|---|---|
| ELYZA-Thinking-1.0-llm-jp-4-33b | 77.53 | 84.69 |
| llm-jp-4-33b-thinking | 75.74 | 85.22 |
| llm-jp-4.1-33b-thinking | 78.82 | 85.49 |
| OLMo 3.1 32B Think | 75.23 | 77.59 |
| Qwen3-32B | 78.75 | 86.09 |
| Qwen3.5-27B | 85.42 | 90.11 |
| Gemma 4 31B | 85.50 | 90.17 |
平均性能は、ベンチマークをまず7つの能力グループ内で平均し、次にグループ間で平均する方法で算出しています。日本語・英語別の平均では、それぞれの言語のベンチマークだけを使います。MoE版のelyza/ELYZA-Thinking-1.0-llm-jp-4-32b-a3bについては、ELYZAが別のモデルカードで個別のスコアを掲載しています。
提供条件
ライセンスはApache-2.0で、パイプライン種別はtext-generationです。

まだコメントはありません。