UnslothはHugging Faceでunsloth/Qwen3-Coder-Nextを公開しました。ベースモデルはQwen/Qwen3-Coder-Nextで、総パラメータ80B・活性パラメータ3BのMoE構成を持ち、コーディングエージェントとローカル開発向けのオープンウェイトモデルです(ライセンスはapache-2.0)。
UnslothはAIモデルの実行と学習のためのツール群で、QwenはAlibaba Cloudが開発する大規模言語モデルのファミリーです。
何が新しいか
原文は、活性パラメータ3Bで10〜20倍の活性パラメータを持つモデルに匹敵する性能を目指し、エージェント展開のコスト効率を高めるモデルだと説明しています。長期推論、複雑なツール利用、実行失敗からの復旧に対応し、256kコンテキストと各種スキャフォールドへの適応により、Claude Code、Qwen Code、Qoder、Kilo、Trae、Clineなどとの統合を想定しています。
モデルはnon-thinking modeのみに対応し、出力に思考ブロックを生成しません。enable_thinking=Falseの指定も不要です。
アーキテクチャ
レイアウトは12 * (3 * (Gated DeltaNet -> MoE) -> 1 * (Gated Attention -> MoE))のハイブリッド構成です。
| 項目 | 値 |
|---|---|
| 非埋め込みパラメータ | 79B |
| 隠れ次元 | 2048 |
| レイヤー数 | 48 |
| Gated Attentionヘッド | Q 16 / KV 2、ヘッド次元256、RoPE次元64 |
| Gated DeltaNetヘッド | V 32 / QK 16、ヘッド次元128 |
| エキスパート数 | 512 |
| 活性化エキスパート | 10 |
| 共有エキスパート | 1 |
| エキスパート中間次元 | 512 |
| コンテキスト長 | 262,144(ネイティブ) |
試し方・要件
Transformersは最新版の使用を推奨しています。AutoTokenizer.from_pretrainedとAutoModelForCausalLM.from_pretrainedにQwen/Qwen3-Coder-Nextを指定し、torch_dtype="auto"、device_map="auto"で読み込みます。サンプルではWrite a quick sort algorithm.を入力し、model.generate(**model_inputs, max_new_tokens=65536)で生成します。OOMが出る場合は、コンテキスト長を32,768など短い値に減らすよう原文は勧めています。
ローカル実行ではOllama、LMStudio、MLX-LM、llama.cpp、KTransformersが対応しています。
SGLangではsglang>=v0.5.8が必要です。
pip install 'sglang[all]>=v0.5.8'
python -m sglang.launch_server --model Qwen/Qwen3-Coder-Next --port 30000 --tp-size 2 --tool-call-parser qwen3_coder
このコマンドでhttp://localhost:30000/v1にOpenAI互換APIエンドポイントを立ち上げます。デフォルトのコンテキスト長は256Kで、サーバーが起動しない場合は32768などへの削減を検討するよう原文は記しています。

まだコメントはありません。