Qwen3-Coder-Next、活性3B・総80BのMoEでエージェント向けに公開

スペック

総パラメータ80B
活性パラメータ3B
コンテキスト長262,144 natively
ライセンスapache-2.0
重みの公開オープンウェイト
4bit量子化の目安メモリ約48GB(64GB以上のメモリで実行可能な目安)

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

UnslothはHugging Faceでunsloth/Qwen3-Coder-Nextを公開しました。ベースモデルはQwen/Qwen3-Coder-Nextで、総パラメータ80B・活性パラメータ3BのMoE構成を持ち、コーディングエージェントとローカル開発向けのオープンウェイトモデルです(ライセンスはapache-2.0)。

UnslothはAIモデルの実行と学習のためのツール群で、QwenはAlibaba Cloudが開発する大規模言語モデルのファミリーです。

何が新しいか

原文は、活性パラメータ3Bで10〜20倍の活性パラメータを持つモデルに匹敵する性能を目指し、エージェント展開のコスト効率を高めるモデルだと説明しています。長期推論、複雑なツール利用、実行失敗からの復旧に対応し、256kコンテキストと各種スキャフォールドへの適応により、Claude Code、Qwen Code、Qoder、Kilo、Trae、Clineなどとの統合を想定しています。

モデルはnon-thinking modeのみに対応し、出力に思考ブロックを生成しません。enable_thinking=Falseの指定も不要です。

アーキテクチャ

レイアウトは12 * (3 * (Gated DeltaNet -> MoE) -> 1 * (Gated Attention -> MoE))のハイブリッド構成です。

項目 値
非埋め込みパラメータ 79B
隠れ次元 2048
レイヤー数 48
Gated Attentionヘッド Q 16 / KV 2、ヘッド次元256、RoPE次元64
Gated DeltaNetヘッド V 32 / QK 16、ヘッド次元128
エキスパート数 512
活性化エキスパート 10
共有エキスパート 1
エキスパート中間次元 512
コンテキスト長 262,144(ネイティブ)

試し方・要件

Transformersは最新版の使用を推奨しています。AutoTokenizer.from_pretrainedとAutoModelForCausalLM.from_pretrainedにQwen/Qwen3-Coder-Nextを指定し、torch_dtype="auto"、device_map="auto"で読み込みます。サンプルではWrite a quick sort algorithm.を入力し、model.generate(**model_inputs, max_new_tokens=65536)で生成します。OOMが出る場合は、コンテキスト長を32,768など短い値に減らすよう原文は勧めています。

ローカル実行ではOllama、LMStudio、MLX-LM、llama.cpp、KTransformersが対応しています。

SGLangではsglang>=v0.5.8が必要です。

pip install 'sglang[all]>=v0.5.8'
python -m sglang.launch_server --model Qwen/Qwen3-Coder-Next --port 30000 --tp-size 2 --tool-call-parser qwen3_coder

このコマンドでhttp://localhost:30000/v1にOpenAI互換APIエンドポイントを立ち上げます。デフォルトのコンテキスト長は256Kで、サーバーが起動しない場合は32768などへの削減を検討するよう原文は記しています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内