FeSensはGitHubで、AIエージェントがハードウェア設計を担ったオープンソースAIアクセラレーター「openTPU」を公開しています。Inspur YPCB-00338カード(Xilinx Kintex-7 xc7k480t、DDR3 2チャネル)上で10個のモデルを実際の重みで動かし、カードとシミュレーターの出力はトークン単位でビット一致します。
何が新しいか
openTPUは、SystemVerilogのハードウェア、命令セット、ビット一致シミュレーター、カーネル言語とコンパイラー、PCIeカード用ホストソフトウェアを1つのリポジトリに収めています。READMEは「AIエージェントはハードウェア設計をどこまでできるか、自分の推論を動かすチップを作れるか」を問いとして掲げています。シーケンサーが1サイクル1命令を発行し、DMA、int8重みの行列ユニット(4列シストリック)、fp32ベクトルユニット、量子化器を動かす構成で、キャッシュはありません。ライセンスはApache License 2.0で、GitHubスターは84、フォークは5です。
仕様と測定結果
| 項目 | 値 |
|---|---|
| 動作周波数 | 133.33 MHz(全モデル共通の1ビットストリーム) |
| メモリ | DDR3-1066、4 GiB、ピーク17.1 GB/s |
| DDR3キャリブレーション | 12秒(ホスト関与なし) |
| 4ビット重み | FP4、2段階ブロックスケール、4.25ビット/重み、LMヘッドはint8 |
測定は2026-09-29〜10-01、512トークンのプロンプト後に64トークンをgreedyでデコードする条件です(device値)。
| モデル | 重み | デコード | プリフィル | DRAM帯域 |
|---|---|---|---|---|
| LFM2.5-230M | 4-bit, int8 head | 85.8 tok/s | 335.4 tok/s | 14.1 GB/s (82%) |
| Qwen3-0.6B | 4-bit, int8 head | 31.3 tok/s | 103.4 tok/s | 13.9 GB/s (82%) |
| Qwen3.5-2B | 4-bit, int8 head | 12.09 tok/s | 41.7 tok/s | 15.8 GB/s (92%) |
| Gemma 4 E2B | 4-bit, 4-bit head | 12.14 tok/s | 29.9 tok/s | 15.5 GB/s (91%) |
| Phi-4-mini (3.8B) | 4-bit, int8 head | 6.56 tok/s | 15.0 tok/s | 15.8 GB/s (92%) |
| Qwen3.5-4B | 4-bit, int8 head | 5.88 tok/s | 12.9 tok/s | 15.7 GB/s (92%) |
4ビット重みは1トークンあたりのバイト数を約3分の1減らし、デコードを40%(Qwen3.5)〜45%(Qwen3、LFM2)速くしますが、パープレキシティには測定可能なコストがあります。4 GiBを超えるMoEモデルは、エキスパートをホストストレージからストリーミングして動かします。LFM2.5-8B-A1Bは10.6 tok/s、Qwen3.5-35B-A3Bは3.95 tok/s(PCIe経由で1トークンあたり153 MB、1.41 GB/s)でした。デコードはDRAM律速です。
試し方
カード以外はノートPCで動きます。
pip install -e .、pip install pytest torch transformers、python3 -m pytest -q(RTLテストにはVerilator 5が必要)hf download LiquidAI/LFM2.5-230M --local-dir models/LFM2.5-230Mでモデルを取得otpu-chat --model lfm2 --backend isaでシミュレーター上でチャット
カードを使う場合は、boards/ypcb-00338でmake bitを実行してビットストリームを作り、JTAGでロードした後にsudo otpu-setupとotpu-chat --backend boardを実行します。otpu-smiは温度・電力・DRAM帯域・ユニット別利用率を表示し、otpu-lensは実行を記録してプロファイラーで開きます。otpu-selftestとotpu-diagでカードの動作を確認できます。
背景
QwenはAlibaba Cloudが、GemmaはGoogleのチームが開発するオープンなモデルファミリーです。今後の課題としてopenTPUは、DRAM効率の残り数%、133.33 MHzでのタイミングマージン(WNS +0.032 ns)、行列ユニットの乗算レートに律速されるプリフィルの高速化を挙げています。

まだコメントはありません。