GPT-6 Astra、50タブの税務ワークブックをSolの半分の時間で完成

OpenAIは、会計業務を自動化するAIエージェントを開発するBasisが、GPT-6 Astraを使って50タブの税務ワークブックをGPT-5.6 Solの半分の時間で完成させたと伝えました。Basisの内部評価スコアも約20%改善しています。GPTはOpenAIが開発するAIモデルのファミリーで、自然言語の指示に基づき文章やコード、構造化データなどを生成し、ツール呼び出しを組み合わせた処理にも対応します。

50タブのワークブックでの比較

Basisは、GPT-6 AstraとGPT-5.6 Solを、50タブの複雑な税務ワークブックを正確かつ信頼性高く完成させるタスクで比較しました。共同創業者のMitch Troyanovsky氏は「GPT-6 Astraは、GPT-5.6 Solの半分の時間でそのワークブックを完成させられる」と述べています。

Basisは、GPT-6 Astraがタスク開始時の判断を改善しており、エージェントがより直接的な経路で作業を進め、誤りの修正に費やす時間が減ったとしています。Troyanovsky氏は、これがトークン使用の効率化にもつながると述べています。

項目 内容
比較タスク 50タブの税務ワークブックの完成
完了時間 GPT-5.6 Solの半分
内部評価スコア 約20%改善

タスクに応じた推論量の調整

BasisはGPT-6 Astraに、タスクの進行に応じて推論量を調整させています。難しい段階では計算量を増やし、簡単な段階では減らす運用で、調整中もキャッシュを保持できます。Troyanovsky氏は、これがコストと応答時間の削減につながり、長時間実行タスクをBasisと顧客にとってより経済的にすると述べています。

内部評価と実運用での位置づけ

Basisは、エージェントの作業過程と最終回答の両方を評価しています。テンプレートに従っているか、税務の質問で一次資料を参照しているか、自身の作業を確認しているかなどが評価項目です。GPT-6 Astraはこうした期待をより広い文脈から推論でき、明示的な指示が少なくて済むとしています。

Basisによると、約20%の内部評価スコア改善は、質問すべき時、前提を指摘すべき時、指示に従うべき時といったユーザー意図の理解が向上したことによるものです。個別の状況ごとにルールを書く必要が減り、内部テストでカバーしていない状況にもエージェントが対応できるという確度が高まったとしています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内