Cactus、8〜29MBのNeedle 3を公開 2〜20層から選べる

スペック

総パラメータ29-121M
重みの公開8-29 MB binary
配布形式・量子化CQ2 quantisation
4bit量子化の目安メモリ約0.1GB(16GB以上のメモリで実行可能な目安)

メモリの目安はパラメータ数×0.6バイトの概算で、実際はコンテキスト長と実装で変わります

Cactusは、モバイルやウェアラブル、ロボット、スマートホーム、車載機器、マイクロコントローラー向けの自動化基盤モデル「Needle 3」を公開しました。モデル全体が8〜29MBの単一バイナリで、2層から20層までのサブネットワークを1組の重みから選べる「intelligence ladder」を採用しています。

モデル構成と数値

Needle 3はCactusのSimple Attention Networkを基盤とし、総パラメータは29〜121M、CQ2量子化で配布されます。学習は独自の構造化データセット360Bトークンです。Cactusは、同構成のTransformerと比べてトークン当たりのMFLOPsを2倍超削減すると説明し、その代わりに一般的なチャット能力を犠牲にしていると述べています。

項目 値
サブネットワークの深さ 2〜20 layers
デコード速度(Raspberry Pi 5) 400〜4k tokens/s
プリフィル速度(Raspberry Pi 5) 1〜10k tokens/s
学習トークン数 360B tokens

各層は容量が単調に増加するサブネットワークになっており、それぞれがfine-tuning可能です。Cactusは、下流タスクで1エポックfine-tuningした4層(4L)サブネットワークがDeepSeek V4 Flashに並ぶとしています。DeepSeekは杭州の深度求索が展開するAI開発企業・ブランドで、モデルの重みやAPIを提供しています。

使い方と入出力

入力はテキストプロンプトに加えて、ツール定義または抽出スキーマを与えます。出力はツール呼び出しまたは抽出結果を含む構造化JSONです。開発者は用途に合わせて2Lから20Lまでのサブネットワークを選びます。

  • ツール呼び出し: アプリが公開する関数定義を渡すと、Needle 3が関数を選択し引数を埋めます。2つ依頼すれば順序どおり2つの呼び出しが返り、該当するツールがない場合は推測ではなく空リストを返します。
  • 構造化抽出: 抽出スキーマの形状を宣言し、請求書・予約・通知・フォームなどのテキストを型付きフィールドに変換します。デコード時の文法により出力がパースできることを保証すると説明されています。抽出は分類問題にも汎化したとしています。
  • テキスト埋め込み: 同じモデルが文のベクトルを返し、検索・照合・ルーティングを端末上で実行できます。

想定用途

Cactusは、スマートホームでのオフライン実行(「寝室を暗くして戸締まり」を2つの呼び出しへ)、掃除ロボットへの細かい指示、スマートフォン上でのアルバム作成や画面調整、ウェアラブルでの通知の構造化(カード決済を店舗名・金額・日付へ)、ARグラスでのネットワーク不要のナビゲーションと周辺検索、車載での空調・メディア・ナビ・通話操作、コンピューターの自然言語操作、端末外に出ない埋め込みによるセマンティック検索や数百規模のツールとのマッチング、近似重複アラートの統合を挙げています。

評価はツール呼び出し3スイートの平均と抽出3スイートの平均で示され、ツール呼び出し側にはAndroidのintentへ変換するMobile Actions(961行、exact call)、2つの呼び出しを要する場合もあるDroidCall(200行、順序どおりのexact calls)、Berkeley function callのBFCL v4が含まれます。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内