arXivで公開された論文「Dating the Model: Hidden Dates in System Prompts Affect LLM Evaluation」は、システムプロンプトに隠れて注入される現在日付だけを要因として、LLMの評価性能が数学推論で最大14%変動し、モデルの順位まで入れ替わることを9モデル・6データセットで示しました。
何が新しいか
著者らは、ハードウェアやバッチングによって出力がばらつくという既知の指摘に加え、見落とされてきた要因として「現在日付のシステムプロンプトへの隠れた注入」を特定しました。この日付はユーザーが制御できず、毎日変化します。
数値
調査対象は最近のLLM 9種と、多肢選択式QA(MCQA)・数学推論・コード生成・機械翻訳にまたがる6データセットです。現在日付のみで生じた性能差は以下のとおりです。
| タスク | 日付のみによる性能差 |
|---|---|
| MCQA | 最大6% |
| 数学推論 | 最大14% |
| コード生成 | 最大7% |
| 機械翻訳 | 2.84 BLEU |
さらに論文は、この日付効果がバッチサイズや数値精度といった他の非決定性の要因を上回ると述べています。
プロンプト技法では緩和されない
チェーン・オブ・ソートと少数例プロンプトは、いずれも日付への感度を低減しませんでした。チェーン・オブ・ソートについては、感度を増幅すると報告されています。
意味
日付によってモデルの順位も変わるため、リーダーボードにも影響します。著者らは、LLM研究における再現性と公平な比較を確保するには、慎重な評価プロトコルが必要だと結論づけています。

まだコメントはありません。