Unsloth、320B MoEのGLM-5.3-FlashをGGUFで公開

スペック

総パラメータ320B
活性パラメータ18B
ライセンスmit
重みの公開GGUF版
配布形式・量子化GGUF
4bit量子化の目安メモリ約192GB(256GB以上のメモリで実行可能な目安)

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

Unslothは、zai-orgのGLM-5.3-FlashをGGUF化したunsloth/GLM-5.3-Flash-GGUFをHugging Faceで公開しました。総パラメータ320B、活性パラメータ18Bのモデルで、ライセンスはMITです。

UnslothはAIモデルの実行と学習のためのツール群で、GLMはZ.aiが開発するAIモデルのファミリーです。

何が新しいか

原文は、GLM-5.3-FlashをGLM-5シリーズ初のネイティブマルチモーダルモデルとしています。GLM-5.2をベンチマークと実運用ワークロードで上回りながら、価格はGLM-5.2の10分の1で、コーディングとエージェント系ベンチマークではClaude Opus 4.8に近づくと説明しています。

アーキテクチャ面では、新規学習したベースモデルを採用しています。GLMシリーズで初めてスパース注意と線形注意を組み合わせたハイブリッド構成を取り、長コンテキストのサービングコストを下げつつ精度を保つとしています。Manifold-Constrained Hyper-Connections(mHC)も導入し、事前学習には30T tokensのマルチモーダルコーパスを使っています。

試し方

  • 実行には、Unslothのllama.cpp PRかUnsloth Desktop appを使います。
  • Unsloth Desktop UIでGLM-5.3-Flashを動かせます。原文では1-bit版(Low)をUnsloth Desktopで実行する例を示しています。
  • Unslothは実行ガイド「How to Run GLM-5.3-Flash Guide」を用意しています。
  • Unslothは、量子化手法のUnsloth Dynamic 3.0が他の主要な量子化より高い精度を出すと述べています。
  • APIはZ.ai API Platformで利用できます。

ベンチマークの評価条件

ベンチマーク サンプリング 生成長・コンテキスト・タイムアウト
HLE w/ tools (full set) temperature=1.0, top_p=0.95 最大生成163,840 tokens、最大コンテキスト300,000 tokens(ジャッジはGPT-5.6-luna (medium))
NL2Repo temperature=1.0, top_p=1.0 max_new_tokens=64k、1Mコンテキスト
DeepSWE temperature=0.95, top_p=1.0 mini-swe-agentハーネス、timeout=6h、400Kコンテキスト
Terminal-Bench 2.1 temperature=1.0, top_p=1 Claude Code 2.1.207上、max_new_tokens=65536、6hタイムアウト
BabyVision temperature=1.0, top_p=0.95 最大コンテキスト164K tokens

上記以外のベンチマークの評価条件は次のとおりです。

  • Toolathlon Verified: 公式評価サービスを使い、3回の独立実行によるpass@1の平均を報告しています。
  • AutomationBench: v1.0.6を使っています。
  • GDPval-AA v2: Artificial Analysisが評価しています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内