Unslothはunsloth/Qwen3.8-Flash-Next-GGUFを公開しました。元のQwen3.8-Flash-Nextは総パラメータ125B・活性6Bのモデルで、Qwen4を支えるアーキテクチャの実験的プレビューとして最初にオープンウェイトで出たモデルです。
QwenはAlibaba Cloudが開発する大規模言語モデルのファミリーで、UnslothはAIモデルの実行と学習のためのツール群です。
何が新しいか
原文は、このアーキテクチャの要素として次の4点を挙げています。
- Hybrid Attention with QSA: 従来のGated DeltaNetとGated Attentionの組み合わせを、Gated DeltaNetとQwen Sparse Attention(QSA)に置き換えています。QSAは個別トークンではなくマイクロブロック単位で処理し、原文は長いコンテキストでのレイテンシーを大きく削減すると説明しています。
- Gated Residual: 拡幅したresidual streamを、要素ごとのデータ依存のread gateとブランチごとのスカラーwrite gateで制御します。
- N-gram Embedding: 短いn-gramでインデックスする埋め込みでパラメータを増やします。原文はMoEより計算が少なくオフロードしやすいと説明しています。
- 訓練手法: 重みの種類ごとにMuonとAdamWを使い分け、batch-size warmupをなくして最初から目標バッチサイズで訓練します。
仕様
総125Bとは別に、51BのN-gram embeddingと4BのMTPパラメータがあります。
| 項目 | 値 |
|---|---|
| 種別 | Causal Language Model with Vision Encoder(image-text-to-text) |
| レイヤー数 | 48 |
| Hidden Layout | 12 × (3 × (Gated DeltaNet → MoE) → 1 × (QSA → MoE)) |
| Hidden Dimension | 2560 |
| エキスパート数 | 512(活性: 10 Routed + 1 Shared) |
| Expert Intermediate Dimension | 640 |
| QSAヘッド | Q 24 / KV 2、Head Dimension 256 |
| QSA Budget | 512 blocks または 2048 tokens |
| Gated DeltaNetヘッド | V 48 / QK 16、Head Dimension 128 |
| N-gram Embedding | 20,000,000(レイヤー2のbigram/trigram) |
| MTP | 1レイヤー(multi-stepsで訓練) |
| コンテキスト長 | ネイティブ262,144、最大1,000,000 tokensまで拡張可能 |
| ライセンス | other |
試し方
Unslothは、llama.cppまたはUnsloth Desktop appでの実行を案内しています。Unsloth Desktop appではthinkingの制御を使えます。UnslothではMTPが利用でき、推論が1.3〜1.7倍速くなるとしています。UnslothはUnsloth Dynamic 3.0が高い精度を示し、他の主要な量子化を上回ると述べています。実行方法については「Run Qwen3.8-Flash-Next Guide」の参照を案内しています。

まだコメントはありません。