OpenAIは、会計業務を自動化するAIエージェントを開発するBasisが、GPT-6 Astraを使って50タブの税務ワークブックをGPT-5.6 Solの半分の時間で完成させたと伝えました。Basisの内部評価スコアも約20%改善しています。GPTはOpenAIが開発するAIモデルのファミリーで、自然言語の指示に基づき文章やコード、構造化データなどを生成し、ツール呼び出しを組み合わせた処理にも対応します。
50タブのワークブックでの比較
Basisは、GPT-6 AstraとGPT-5.6 Solを、50タブの複雑な税務ワークブックを正確かつ信頼性高く完成させるタスクで比較しました。共同創業者のMitch Troyanovsky氏は「GPT-6 Astraは、GPT-5.6 Solの半分の時間でそのワークブックを完成させられる」と述べています。
Basisは、GPT-6 Astraがタスク開始時の判断を改善しており、エージェントがより直接的な経路で作業を進め、誤りの修正に費やす時間が減ったとしています。Troyanovsky氏は、これがトークン使用の効率化にもつながると述べています。
| 項目 | 内容 |
|---|---|
| 比較タスク | 50タブの税務ワークブックの完成 |
| 完了時間 | GPT-5.6 Solの半分 |
| 内部評価スコア | 約20%改善 |
タスクに応じた推論量の調整
BasisはGPT-6 Astraに、タスクの進行に応じて推論量を調整させています。難しい段階では計算量を増やし、簡単な段階では減らす運用で、調整中もキャッシュを保持できます。Troyanovsky氏は、これがコストと応答時間の削減につながり、長時間実行タスクをBasisと顧客にとってより経済的にすると述べています。
内部評価と実運用での位置づけ
Basisは、エージェントの作業過程と最終回答の両方を評価しています。テンプレートに従っているか、税務の質問で一次資料を参照しているか、自身の作業を確認しているかなどが評価項目です。GPT-6 Astraはこうした期待をより広い文脈から推論でき、明示的な指示が少なくて済むとしています。
Basisによると、約20%の内部評価スコア改善は、質問すべき時、前提を指摘すべき時、指示に従うべき時といったユーザー意図の理解が向上したことによるものです。個別の状況ごとにルールを書く必要が減り、内部テストでカバーしていない状況にもエージェントが対応できるという確度が高まったとしています。

まだコメントはありません。