Unsloth、Qwen4基盤の実験モデルQwen3.8-Flash-NextのGGUFを公開

スペック

総パラメータ125B
活性パラメータ6B activated
コンテキスト長262,144 natively and extensible up to 1,000,000 tokens
ライセンスother
重みの公開オープンウェイト
配布形式・量子化GGUF
4bit量子化の目安メモリ約75GB(96GB以上のメモリで実行可能な目安)

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

Unslothはunsloth/Qwen3.8-Flash-Next-GGUFを公開しました。元のQwen3.8-Flash-Nextは総パラメータ125B・活性6Bのモデルで、Qwen4を支えるアーキテクチャの実験的プレビューとして最初にオープンウェイトで出たモデルです。

QwenはAlibaba Cloudが開発する大規模言語モデルのファミリーで、UnslothはAIモデルの実行と学習のためのツール群です。

何が新しいか

原文は、このアーキテクチャの要素として次の4点を挙げています。

  • Hybrid Attention with QSA: 従来のGated DeltaNetとGated Attentionの組み合わせを、Gated DeltaNetとQwen Sparse Attention(QSA)に置き換えています。QSAは個別トークンではなくマイクロブロック単位で処理し、原文は長いコンテキストでのレイテンシーを大きく削減すると説明しています。
  • Gated Residual: 拡幅したresidual streamを、要素ごとのデータ依存のread gateとブランチごとのスカラーwrite gateで制御します。
  • N-gram Embedding: 短いn-gramでインデックスする埋め込みでパラメータを増やします。原文はMoEより計算が少なくオフロードしやすいと説明しています。
  • 訓練手法: 重みの種類ごとにMuonとAdamWを使い分け、batch-size warmupをなくして最初から目標バッチサイズで訓練します。

仕様

総125Bとは別に、51BのN-gram embeddingと4BのMTPパラメータがあります。

項目 値
種別 Causal Language Model with Vision Encoder(image-text-to-text)
レイヤー数 48
Hidden Layout 12 × (3 × (Gated DeltaNet → MoE) → 1 × (QSA → MoE))
Hidden Dimension 2560
エキスパート数 512(活性: 10 Routed + 1 Shared)
Expert Intermediate Dimension 640
QSAヘッド Q 24 / KV 2、Head Dimension 256
QSA Budget 512 blocks または 2048 tokens
Gated DeltaNetヘッド V 48 / QK 16、Head Dimension 128
N-gram Embedding 20,000,000(レイヤー2のbigram/trigram)
MTP 1レイヤー(multi-stepsで訓練)
コンテキスト長 ネイティブ262,144、最大1,000,000 tokensまで拡張可能
ライセンス other

試し方

Unslothは、llama.cppまたはUnsloth Desktop appでの実行を案内しています。Unsloth Desktop appではthinkingの制御を使えます。UnslothではMTPが利用でき、推論が1.3〜1.7倍速くなるとしています。UnslothはUnsloth Dynamic 3.0が高い精度を示し、他の主要な量子化を上回ると述べています。実行方法については「Run Qwen3.8-Flash-Next Guide」の参照を案内しています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内