Anthropic、Claude Sonnet 5.5を公開 Terminal-Bench 4.0で70.6%

AnthropicはClaude 5.5ファミリー2番目のモデル「Claude Sonnet 5.5」を2026年9月28日に発表しました。Claude Sonnet 5より30%以上高速で、ほとんどの作業でタスク単位のコストが最大30%低く、エージェント型コーディング評価のTerminal-Bench 4.0ではSonnet 5の10.3%に対して70.6%を記録しています。

ClaudeはAnthropicが開発する大規模言語モデルのファミリーで、コード作成やツール利用、画像の理解に対応します。

位置づけ

AnthropicはSonnet 5.5を、慎重な判断を要する複雑な作業向けのClaude Opus 5.5を補完する、高速・低コストのモデルと説明しています。範囲が明確な日常作業、バグ修正、体裁の整った文書・スライド・表計算の作成に強く、デザインの見極めも得意としています。長時間の作業と画像理解でもSonnet 5から改善し、スクリーンショットのみでPokémon Redをクリアした最初のSonnetモデルだとしています。高volume・コスト重視の用途向けのClaude Haiku 5.5は、今後数週間以内にClaude 5.5ファミリーに加わる予定です。

協働面では、Opus 5.5と同様に前世代より明確な文章を書くとされ、初期テスターはSonnet 5より協働の相手として優れていると評したとしています。

ベンチマーク

評価 Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6
Terminal-Bench 4.0 70.6% 10.3% 66.4%¹ —
FrontierCode 1.1 (Main) 46.2% (Max) 42.4% 54.4% 52.1% (Xhigh: 49.3%)
CursorBench 4.0 55.5% 34.1% 57.8% —
GDPval-AA v2.1 1844 1449 1846 1487
AA-Briefcase v1.1 1811 1359 1822 1483
Humanity's Last Exam (with tools) 64.5% 54.9% 67.7% —
OSWorld 2.1 (partial) 80.1% 57.0% 81.8% —
Chartography (no tools) 61.6% 15.6% 64.4% 53.6%

Anthropicは、いくつかの評価でMax effortのSonnet 5.5がOpus 5.5に匹敵するとしつつ、複雑で持続的な判断を要するオープンエンドな作業ではOpus 5.5が明確に強いままだと述べています。評価の実施方法はSonnet 5.5のシステムカードに記載されているとしています。

価格とコスト

Sonnet 5.5の価格はSonnet 5と同一で、入力が100万トークンあたり2ドル、出力が100万トークンあたり10ドル、キャッシュ読み取りが100万トークンあたり0.20ドルです。同じ作業に必要なトークン数が大幅に少ないため、Anthropicの検証ではタスクあたりのコストが前世代より最大30%低くなるとしています。出力生成はSonnet 5より30%以上高速で、これまでで最速のSonnetだとしています。

安全性

自動化された行動監査では、アラインメントのほとんどの指標でSonnet 5と同等以上に改善したとしています。サイバーセキュリティ能力がOpus 5と同程度であることから、最も高性能なモデル向けに開発したものと同様のサイバーセーフガードとフォールバックを備えて出荷される最初のSonnetモデルとなります。生物学関連のセーフガードはSonnet 5と同じです。Anthropicは、いずれのセーフガードも高リスクな要求の狭い範囲を対象とし、通常のソフトウェア開発と大半のライフサイエンス業務には影響しないとしています。

この記事の固有名詞

コメント (0)

まだコメントはありません。

コメントを書く

2000文字以内