Unslothは、zai-orgのGLM-5.3-FlashをGGUF化したunsloth/GLM-5.3-Flash-GGUFをHugging Faceで公開しました。総パラメータ320B、活性パラメータ18Bのモデルで、ライセンスはMITです。
UnslothはAIモデルの実行と学習のためのツール群で、GLMはZ.aiが開発するAIモデルのファミリーです。
何が新しいか
原文は、GLM-5.3-FlashをGLM-5シリーズ初のネイティブマルチモーダルモデルとしています。GLM-5.2をベンチマークと実運用ワークロードで上回りながら、価格はGLM-5.2の10分の1で、コーディングとエージェント系ベンチマークではClaude Opus 4.8に近づくと説明しています。
アーキテクチャ面では、新規学習したベースモデルを採用しています。GLMシリーズで初めてスパース注意と線形注意を組み合わせたハイブリッド構成を取り、長コンテキストのサービングコストを下げつつ精度を保つとしています。Manifold-Constrained Hyper-Connections(mHC)も導入し、事前学習には30T tokensのマルチモーダルコーパスを使っています。
試し方
- 実行には、Unslothのllama.cpp PRかUnsloth Desktop appを使います。
- Unsloth Desktop UIでGLM-5.3-Flashを動かせます。原文では1-bit版(Low)をUnsloth Desktopで実行する例を示しています。
- Unslothは実行ガイド「How to Run GLM-5.3-Flash Guide」を用意しています。
- Unslothは、量子化手法のUnsloth Dynamic 3.0が他の主要な量子化より高い精度を出すと述べています。
- APIはZ.ai API Platformで利用できます。
ベンチマークの評価条件
| ベンチマーク | サンプリング | 生成長・コンテキスト・タイムアウト |
|---|---|---|
| HLE w/ tools (full set) | temperature=1.0, top_p=0.95 |
最大生成163,840 tokens、最大コンテキスト300,000 tokens(ジャッジはGPT-5.6-luna (medium)) |
| NL2Repo | temperature=1.0, top_p=1.0 | max_new_tokens=64k、1Mコンテキスト |
| DeepSWE | temperature=0.95, top_p=1.0 |
mini-swe-agentハーネス、timeout=6h、400Kコンテキスト |
| Terminal-Bench 2.1 | temperature=1.0, top_p=1 | Claude Code 2.1.207上、max_new_tokens=65536、6hタイムアウト |
| BabyVision | temperature=1.0, top_p=0.95 | 最大コンテキスト164K tokens |
上記以外のベンチマークの評価条件は次のとおりです。
- Toolathlon Verified: 公式評価サービスを使い、3回の独立実行によるpass@1の平均を報告しています。
- AutomationBench: v1.0.6を使っています。
- GDPval-AA v2: Artificial Analysisが評価しています。

まだコメントはありません。