MicroLLM Labは、ブラウザー上で7種類の小型LLMを実行し、チャット、ベンチマーク、モデル間の比較、証明書生成、カスタム評価を行える機能を提示しています。Hacker Newsでは81ポイント・26コメントを集めました。
ベンチマークの内容
ベンチマークは速度と客観的テストの合格率を測定します。評価対象は正規表現や完全一致トークンなどの客観的チェックで、文章の品質は評価しません。原文は「135Mモデルは失敗してよい、それが測定である」として、小規模モデルの失敗を許容すること自体を測定対象に据えています。
実行方法は、モデルを選択したうえでアクティブなモデルにスイートを実行する、読み込み済みの全モデルにスイートを実行する、256トークンの連続デコードによる持続速度テストを実行する、の3通りです。実行時間の推定には、利用可能な場合は直近のtok/sを使います。
| 指標 | 内容 |
|---|---|
| Highest Peak Speed | 単一テストで最速のもの |
| Highest Sustained Speed | 256トークン連続デコード |
| Avg Sustained Speed | テスト済みモデル横断の平均 |
| Total Benchmark Score | スイートの累積wall time |
| テストごと | 実行時間(ms)と精度 |
比較画面のチャートは、モデルごとの最新スイートの結果を使用します。表示項目は精度(最新スイート)、速度(平均tok/s)、スイートのwall time(ms)で、保存済みの比較結果はクリアできます。数値はこのマシン上に保存されます。
カスタム評価とその書き方
カスタム評価では、JavaScriptでベンチマークを記述します。エディターの内容はこのオリジンでeval()され、その後に各チェックがモデルのデコード済みテキストに対して実行されます。記述形式としてオブジェクト形式と関数形式の例が示され、より大きなLLMに書かせるためのプロンプトをコピーする導線も用意されています。
証明書の生成と共有
検証可能なパフォーマンス証明書を生成できます。証明書には名前またはハンドル、端末とハードウェアの情報、ピークおよび持続のtokens/secondが含まれ、PNG画像としてダウンロードするか、画像のコピー、X、LinkedInでの共有、テキスト要約のコピーが可能です。

まだコメントはありません。