arXivに公開された論文「Characterizing High Bandwidth Flash for LLM Serving」は、高帯域フラッシュ(HBF)をLLMサービングに組み込むシステム構成とスケジューリングを評価し、HBFを追加した最速構成がHBMのみの構成に比べて完了時間を36.1〜87.0%短縮すると報告しました。
何が新しいか
著者らはHBM-HBF-hostの階層ストレージシステムと、バッファ付きキャッシュ認識スケジューリング(buffered cache-aware scheduling)を提案しました。高スループットのエージェント型LLMサービングを対象に、トレース駆動シミュレーションで性能、エネルギー消費、HBFの書き込み寿命への効果を分析しています。追加容量がどの条件でサービング性能とエネルギー効率を改善するかを見極めることが目的です。
主な数値
| 項目 | 値 | 条件 |
|---|---|---|
| 完了時間短縮率 | 36.1〜87.0% | HBF追加の最速システム、HBMのみとの比較 |
| モデル化されたエネルギー削減率 | 最大55.8% | 評価ワークロード全体 |
| 推定HBF書き込み寿命 | 4.77年 → 14.82年 | 評価構成、バッファ付きキャッシュ認識スケジューリング適用 |
一方で、一部の軽量なワークロードではHBFの追加によりエネルギー消費が増加しました。
背景と意味
LLMサービングではモデル重みとKVキャッシュの保存に大容量のメモリが必要で、モデルの大規模化とコンテキストの長期化によりメモリ容量と帯域がボトルネックになります。エージェント型ワークロードは拡大するコンテキスト上で対話を繰り返すため、再利用に向けたKV状態の保持が重要になります。HBFはアクセラレータのメモリ容量を拡張できますが、アクセスコストと限られた書き込み耐久性が課題です。論文は、データ配置とスケジューリングを協調させることで、サービング効率を高めつつ実用的なHBF書き込み寿命を維持できると結論づけています。

まだコメントはありません。