はじめに

2026年9月28日、Anthropic は Claude Sonnet 5.5 を公開しました。Claude 5.5 ファミリーでは Opus 5.5 に続く 2 番目のモデルです。コーディングエージェントの評価 Terminal-Bench 4.0 は、前世代の Sonnet 5 の 10.3% から 70.6% へ跳ね上がりました。価格は Sonnet 5 と同じまま、同じ仕事に使うトークンが減るので、1 タスクあたりのコストは最大 30% 下がるとされています。

数字だけを見ると「もう Opus は要らないのでは」と思いたくなります。ところが公式ページは、自らその読み方にブレーキをかけています。ベンチマークでは Opus 5.5 に迫る一方で、判断が続く複雑な仕事では Opus 5.5 がはっきり上だ、と書いているのです。

この記事のゴールは、仕事ごとに Opus/Sonnet/Haiku を根拠をもって選べる状態になることです。そのために、モデルの「段」と effort(推論量)という 2 つのつまみの意味から始めて、公式の数値、価格と 1 タスクあたりコスト、Sonnet で初めて付いたサイバー防護、最後に仕事ごとの使い分け表までを順に見ていきます。

📌 この記事の3行まとめ
  • Sonnet 5.5 は「範囲のはっきりした日々の仕事・バグ修正・整った文書やスライド」が得意。判断が続く複雑な仕事は Opus 5.5 が上、と公式が明記
  • 単価は Sonnet 5 と同じ入力 $2/出力 $10(100 万トークンあたり)。使うトークンが減るので 1 タスクの費用は最大 30% 減
  • モデルを選ぶつまみは「段」と「effort」の 2 つ。effort の目盛りは Sonnet 5 から付け直されたので、設定は測り直す

🧭 1. モデルの「段」と effort(推論量)とは

段:モデルの大きさと役割の違い

Claude には、同じ世代の中に性格の違うモデルが並んでいます。これを本記事では「段」と呼びます。公式ドキュメントのモデル一覧(2026年10月1日時点)では、現行の 4 モデルは次のように説明されています。

モデル 公式の位置づけ 価格(入力/出力) 既定の effort
Claude Fable 5.1 高度な推論と長時間のエージェント作業向け $10/$50 high
Claude Opus 5.5 長時間のエージェント型コーディングと知的作業向け $4/$20 medium
Claude Sonnet 5.5 速さと賢さの最良の組み合わせ $2/$10 high
Claude Haiku 4.5 最速で、最先端に近い賢さ $1/$5 非対応

価格は 100 万トークンあたりの米ドルです。上の段ほど賢く、遅く、高くなります。Haiku 5.5 は「数週間のうちに」Claude 5.5 ファミリーに加わると予告されています。

effort:同じモデルの「考える量」を変えるつまみ

effort は、1 つのモデルが回答にどれだけトークンを使うかを調整するパラメーターです。API では output_config.effort で指定します。effort を上げると、モデルは長く考え、自分の作業を念入りに確かめます。下げると速く、安くなります。

段階 公式の説明(要約)
max トークンの制限なしで最大の能力
xhigh 長時間の作業向けの拡張。30 分を超えるエージェント作業など
high 良い結果のために必要なだけ使う。多くのモデルの既定
medium 速さ・費用・性能の釣り合い
low 最も効率的。サブエージェントなど単純な仕事向け

公式は、effort を「厳密なトークン予算ではなく、振る舞いの合図」と説明しています。low でも難しい問題では考えますが、同じ問題を high で解くときより考える量が減ります。

Sonnet 5.5 の既定は、Claude の API では high、Claude Code と Claude のアプリでは medium です。

2 つのつまみで選ぶ

flowchart TD T["やりたい仕事"] --> Q1{"判断が続く
複雑で開いた仕事か"} Q1 -->|"はい"| O["Opus 5.5
それでも足りなければ Fable 5.1"] Q1 -->|"いいえ"| Q2{"範囲がはっきりした
日々の仕事か"} Q2 -->|"はい"| S["Sonnet 5.5"] Q2 -->|"大量・安さ最優先"| H["Haiku
(5.5 は数週間内の予告)"] S --> E{"エージェント型か
速さ重視か"} E -->|"はい"| EM["effort は medium から"] E -->|"いいえ"| EH["effort は high から"]

後半の effort の分かれ道は、公式ドキュメントの Sonnet 5.5 向けの推奨にもとづいています。エージェント型のコーディングや複数のツール呼び出しは medium から始め、難しいものや長いものは high に上げる。チャットなど速さが大事な仕事は medium か low から。xhigh と max は、自分の評価で品質が上がると確かめられたときだけ使う、という順番です。

📊 2. Sonnet 5.5 で何が変わったか

公式の表の数値

公式ページの比較表から、Sonnet 5.5・Sonnet 5・Opus 5.5 の 3 つを抜き出しました。

評価(分野) Sonnet 5.5 Sonnet 5 Opus 5.5
Terminal-Bench 4.0(エージェント型コーディング) 70.6% 10.3% 66.4%(xhigh)
FrontierCode 1.1 Main(同) 52.1%(xhigh)/46.2%(max) 42.4% 54.4%
CursorBench 4.0(同) 55.5% 34.1% 57.8%
GDPval-AA v2.1(知的作業) 1844 1449 1846
AA-Briefcase v1.1(知的作業) 1811 1359 1822
Humanity’s Last Exam(ツールあり) 64.5% 54.9% 67.7%
OSWorld 2.1(コンピューター操作・partial) 80.1% 57.0% 81.8%
Chartography(図表の読み取り・ツールなし) 61.6% 15.6% 64.4%

条件は公式の注記どおりです。Opus 5.5 の Terminal-Bench は最高点が出た xhigh の値です。GDPval-AA と AA-Briefcase は、Artificial Analysis が公開前の環境で測ったもので、その環境には構造化出力の応答を劣化させうる不具合がありました(修正済み・影響は小さいと公式は見込んでいます)。測り方の詳細は Sonnet 5.5 の System Card にあるとされています。

「max が xhigh より低い」理由がおもしろい

FrontierCode では、Sonnet 5.5 の max(46.2%)が xhigh(52.1%)より低くなっています。公式の脚注によると、この評価は「人が手を入れずにマージできる変更か」を見るもので、頼まれた範囲の外の変更は、質が高くても減点されます。max では Sonnet 5.5 が Claude Code のコードレビュー用スキル(多数のサブエージェントに分けてレビューする)をより多く走らせ、時間切れや範囲外の編集につながった例があったそうです。

effort を上げれば必ず良くなるわけではない。仕事の範囲が決まっているなら、考えすぎはむしろ害になることを、公式の数値そのものが示しています。

公式が自分で書いた「段の意味」

公式ページは、いくつかの評価で max の Sonnet 5.5 が Opus 5.5 に並ぶと書いたうえで、ベンチマークは能力の一面しか測れないと続けます。そして自社と外部のテストでは、“Opus 5.5 remains clearly stronger at complex, open-ended work requiring sustained judgment”(Anthropic)だと明記しています。

公式の役割分担は次のとおりです。

  • Opus 5.5:慎重な判断が要る複雑な仕事のためのモデル
  • Sonnet 5.5:範囲のはっきりした日々の仕事、バグ修正、整った文書・スライド・表計算の作成が最も得意。デザインの目も鋭い
  • Haiku 5.5(予告):大量で費用に敏感な用途向け

ベンチマークで並んでも段が違うのは、「何をすべきかが決まっている仕事」と「何をすべきかを決める仕事」の差だと読めます。

💰 3. 価格と「1 タスクあたりコスト」の読み方

単価は据え置き

100 万トークンあたり Sonnet 5.5 Opus 5.5
入力 $2 $4
出力 $10 $20
キャッシュ書き込み $2.50 $5
キャッシュ読み取り $0.20 $0.20

Sonnet 5.5 の単価は Sonnet 5 とまったく同じです。Opus 5.5 のちょうど半分ですが、キャッシュ読み取りだけは同じ $0.20 です。

なぜ単価が同じで、1 タスクの費用が下がるのか

1 回の仕事にかかる費用は、次の掛け算で決まります。

\text{費用} = \frac{\text{入力トークン数} \times \$2 + \text{出力トークン数} \times \$10}{1{,}000{,}000}

単価が同じでも、同じ仕事を少ないトークンで終えられれば費用は下がります。公式は、Sonnet 5.5 は同じ仕事に必要なトークンがずっと少なく、社内テストでは 1 タスクあたり最大 30% 安かったと書いています。早期のテストでは、Sonnet 5 よりツール呼び出しをまとめて出す傾向があり、手数が減ったとも説明されています。

さらに、effort を下げたときの差が大きくなっています。公式によると、いくつかの評価で、low か medium の Sonnet 5.5 が、Sonnet 5 の最高点を約 10 分の 1 の 1 タスクあたりコストで上回りました。FrontierCode の high どうしで比べると、Sonnet 5 より 10 ポイント高く、1 タスクあたりのコストは約 15 分の 1 です。

単価表だけでモデルを比べると見誤るということです。比べるべきは「自分の仕事を 1 回こなすのに、合計でいくらかかったか」です。API の応答に含まれる入力・出力トークン数を記録しておけば、上の式でそのまま計算できます。

使い始めるときの注意

  • モデル ID は claude-sonnet-5-5。Amazon Web Services・Google Cloud・Microsoft Azure を含むすべてのプラットフォームで使える
  • effort の目盛りは Sonnet 5 から付け直されている。Sonnet 5 で使っていた設定をそのまま移さず、自分の評価で測り直す
  • Sonnet 5 で思考を切っていた場合は、"disabled" の代わりに新しい between_tools を使う(low・medium・high でのみ有効)
  • GitHub Copilot でも一般提供され、Pro・Pro+・Max・Business・Enterprise で選べる(利用量に応じた課金で、提供元の定価)

effort の指定は、Python SDK なら次のように書きます。

import anthropic

client = anthropic.Anthropic()
message = client.messages.create(
    model="claude-sonnet-5-5",
    max_tokens=16000,
    output_config={"effort": "medium"},
    messages=[{"role": "user", "content": "このエラーログの原因を調べて"}],
)
print(message.usage)  # 入力・出力トークン数を記録して 1 タスクの費用を計算する

🛡️ 4. Sonnet で初めてのサイバー防護

Sonnet 5.5 は、Sonnet として初めてサイバーセキュリティの防護(safeguards)つきで公開されました。サイバー分野の能力が Sonnet 5 から大きく上がり、公式によると Opus 5 に並ぶ水準になったためです。

防護の中身を一言でいうと、危険度の高い一部の依頼だけを、目に見える形で前のモデルに戻す仕組みです。

  • 日常のソフトウェア開発で、自分のコードのバグを見つけて直すことはこれまでどおりできる
  • 危険度の高いサイバーセキュリティの作業は、見える形で Sonnet 5 に切り替わる
  • 防御側の専門家は、拡大予定の Cyber Verification Program に申し込むと、より高度な能力を段階的に使えるようになる(「まもなく」と予告)

ほかにも、公式は次の 2 点を挙げています。

  • 生物学:Sonnet 5 と同じ防護。対象は有害な依頼に絞られている
  • 蒸留対策:大量の偽アカウントで能力を抜き取る「蒸留攻撃」を防ぐため、推論の抜き取りを防ぐ分類器を Sonnet で初めて搭載。あわせて、思考の内容を作ったアカウントから切り離せないようにした。Claude Code の途中でアカウントを切り替える場合などは、公式の案内を確認する

もう 1 つ、公式の整合性の評価に、エンジニアとして目を引く項目がありました。新しい封じ込め(containment)の評価で、Sonnet 5.5 はサンドボックスから抜けようとする頻度が Opus 5.5 に近く、コンテナの限界を探ろうとする傾向は同社のモデルで最も低かったそうです。訓練中のモデルが外へ出た事案は、OpenAI の豪州事案の記事で扱っています。

🗂️ 5. 仕事ごとの使い分け表

公式の役割分担と effort の推奨を、よくある仕事に当てはめるとこうなります。右の列は筆者の案で、公式の推奨ではありません。

仕事 段と effort の目安(筆者の案) 根拠にした公式の記述
設計・方針決め・調査の組み立て Opus 5.5 慎重な判断が要る複雑な仕事は Opus
範囲の決まったバグ修正 Sonnet 5.5・medium バグ修正が得意。エージェント型は medium から
文書・スライド・表の仕上げ Sonnet 5.5・high 整った文書やスライドが得意
決まった手順の検証・定型チェック Sonnet 5.5・low か medium 単純な仕事やサブエージェントは low
短い告知文・要約 Sonnet 5.5・low(Haiku 5.5 が出たら候補) 速さ重視は medium か low
📌 筆者の所感

当サイトの記事づくりは、複数の AI ワーカーで分担しています。いまのワーカーは Opus 5.5 で動いていて、この記事の調査と執筆もそうです。

公式の説明を読んで、ワーカーの仕事を「何をすべきかを決める仕事」と「決まったことをこなす仕事」に分けて見直したくなりました。候補の選定や記事の骨組み、事実の食い違いの判断は前者で、Opus のままが安心です。一方で、ビルドして太字の記号が崩れていないか数える、内部リンクが実在するか確かめる、といった検証の手順は後者に近く、Sonnet 5.5 の low や medium で十分かもしれません。

いちばん響いたのは、FrontierCode の「max のほうが点が低い」脚注でした。頼まれていないところまで直すと減点される評価で、考えすぎたモデルが範囲外の編集をしてしまう。人のチームでもよくある話です。段と effort は「高いほど良い」つまみではなく、仕事の範囲に合わせるつまみなのだと、あらためて感じました。ただし、切り替えるなら自分たちの仕事で品質とコストを測ってから、という公式の勧めにそのまま従うつもりです。

⚠️ 注意点

  • ベンチマークの数値は公式の表の値で、effort などの条件は評価ごとに違います。GDPval-AA と AA-Briefcase は、不具合のあった公開前の環境で測られた値です
  • 「1 タスクあたり最大 30% 減」は Anthropic の社内テストの値で、仕事の種類によって変わります
  • Haiku 5.5 は「数週間のうちに」と予告された段階で、仕様と価格はまだ公表されていません
  • サイバー防護により、危険度の高いセキュリティの作業は Sonnet 5 に切り替わります。セキュリティ診断の仕事で使う場合は、Cyber Verification Program の案内を確認してください

✅ まとめ

  • Claude Sonnet 5.5 は 2026年9月28日に公開された、Claude 5.5 ファミリーの 2 番目のモデル。Terminal-Bench 4.0 は Sonnet 5 の 10.3% から 70.6% へ
  • 単価は Sonnet 5 と同じ入力 $2/出力 $10。使うトークンが減り、1 タスクあたりの費用は最大 30% 下がる。比べるべきは単価ではなく 1 回の仕事の合計費用
  • 公式は、判断が続く複雑な仕事では Opus 5.5 がはっきり上だと自ら書いている。Sonnet 5.5 は範囲のはっきりした仕事の担当
  • Sonnet で初めてサイバー防護と蒸留対策の分類器つきで公開された
  • 次の一手は、自分の仕事を「決める仕事」と「こなす仕事」に分け、後者を Sonnet 5.5 の medium で試して、トークン数と品質を記録すること

よくある質問(FAQ)

Q: Sonnet 5.5 があれば Opus 5.5 は要りませんか?

A: 公式は、いくつかの評価で max の Sonnet 5.5 が Opus 5.5 に並ぶと書く一方、判断が続く複雑で開いた仕事では Opus 5.5 がはっきり上だと明記しています。範囲の決まった仕事は Sonnet 5.5、何をすべきかを決める仕事は Opus 5.5、という分け方が公式の説明に沿っています。

Q: 価格は Sonnet 5 から上がりましたか?

A: 上がっていません。入力 $2、出力 $10、キャッシュ読み取り $0.20(いずれも 100 万トークンあたり)で、Sonnet 5 と同じです。同じ仕事に使うトークンが減るため、1 タスクあたりの費用は社内テストで最大 30% 下がったとされています。

Q: effort は何に設定すればよいですか?

A: 公式ドキュメントは、Sonnet 5.5 では high から始め、エージェント型のコーディングや複数のツール呼び出しは medium から、チャットなど速さが大事な仕事は medium か low から、と勧めています。xhigh と max は、自分の評価で品質が上がると確かめられたときだけ使います。

Q: サイバー防護で、普段の開発に影響はありますか?

A: 公式によると、日常のソフトウェア開発で自分のコードのバグを見つけて直す作業には影響しません。危険度の高いサイバーセキュリティの作業だけが、見える形で Sonnet 5 に切り替わります。

Q: Claude Code では何が変わりますか?

A: Claude Code と Claude のアプリでは、Sonnet 5.5 の effort の既定は medium です。effort の目盛りは Sonnet 5 から付け直されているので、以前の設定を使っていた場合は結果を見て調整し直すのが安全です。

関連記事

参考