Opus 5.5とGPT-6 Sol・Lunaは何が変わったのか。同じお題で42回測ってみた
かつ
2026/09/23
2026年9月22日、AnthropicとOpenAIが同じ日に新しいモデルを出しました。Anthropicは Claude Opus 5.5、OpenAIは GPT-6 Sol と GPT-6 Luna です。
どちらも発表の中心は「賢さ」より「安さ」でした。Opus 5.5 は動かす費用が前のモデルより40%少ない、Sol と Luna は料金が半分、とそれぞれ打ち出しています。
この記事では、両社の発表から何が変わったのかを整理したうえで、同じお題をモデルだけ変えて7通り・42回走らせ、トークン数と費用を実際に測りました。
3行でまとめると
- Opus 5.5 は「Fable 5.1 並みの力を、Opus 5 より安く」。料金は2割下がり、Claude Code の標準のモデルにもなった
- GPT-6 Sol と Luna は、前のモデルから料金が半分。最上位の Astra の下に並ぶ、安く速いモデル
- 実測では、同じ努力の設定で Opus 5.5 は Opus 5 の約6割の費用・約6割の時間。公式の「40%少ない」とほぼ同じ値になった
何が起きたのか
| 日付 | 出来事 |
|---|---|
| 9月4日 | OpenAIが GPT-6 Astra を公開(最上位) |
| 9月22日 | Anthropicが Claude Opus 5.5 を公開 |
| 9月22日 | OpenAIが GPT-6 Sol・GPT-6 Luna を公開 |
API名は claude-opus-5-5・gpt-6-sol・gpt-6-luna です。3つとも、各社のモデル一覧APIに実際に出ていることを確かめました(2026年9月23日・カツプロ調べ)。
同じ日に出たため、どちらの発表も、相手の新しいモデルとは比べていません。Anthropicの表の比較相手は GPT-6 Astra と GPT-5.6 Sol(前の Sol)、OpenAIの表の比較相手は Claude Opus 5 と Fable 5.1 です。
Claude Opus 5.5 で変わったこと
料金が下がり、速くなった
| 100万トークンあたり | Opus 5 | Opus 5.5 |
|---|---|---|
| 入力 | $5 | $4 |
| 出力 | $25 | $20 |
| キャッシュ読み込み | $0.50 | $0.20 |
Anthropicの発表では、ほとんどの仕事で Claude Fable 5.1 と同じ水準で、動かす費用は Opus 5 より40%少ないとされています。出力の速さも Opus 5 より30%以上速いとのことです。
読み込める長さは100万トークン、1回に出せるのは最大12万8千トークンで、知識は2026年6月までです。
試験の成績
Anthropicの発表の表から、主なものを抜き出しました。
| 試験 | Opus 5 | Opus 5.5 |
|---|---|---|
| Terminal-Bench 4.0(コマンド操作) | 52.3% | 66.4% |
| AutomationBench(業務の自動化) | 26.9% | 40.0% |
| FrontierCode v1.1(そのまま使えるコード) | 48.0% | 54.4% |
| OSWorld 2.0(パソコン操作) | 74.0% | 81.8% |
同じ表で、上位の Fable 5.1 はそれぞれ 55.8%・31.4%・50.3%・80.7% です。この4つでは Opus 5.5 が Fable 5.1 を上回っています。
Claude の月額プランと Claude Code
発表では、Pro・Max・Team・席単位のEnterpriseで、5時間ごとの使用上限を引き上げるとしています。
Claude Code(VS Code版)でモデルを選ぶ画面を開くと、「Default (recommended)」が Opus 5.5 になっていました。努力(effort)の表示は Medium で、前の Opus 5 には「新しい版があります」と出ます(2026年9月23日・カツプロ調べ)。
APIで使っている人が気をつけること
開発者向けの変更点のページには、前のモデルのコードがそのままでは動かなくなる変更が書かれています。主なものはこの3つです。
- 考える機能を切れない。切る指定や、考える量をトークン数で決める指定を送ると、エラー(400)で返る。深さは effort で決める
- 「必ずこの道具を使え」という指定ができない。
tool_choiceのanyとtoolはエラーになる - effort を指定しないときの既定が high から medium に下がった
3つ目はエラーにならないぶん、気づきにくい変更です。モデル名だけ差し替えると、考える深さが一段下がった状態で動きます。これまでと同じ深さで動かしたいなら、effort を明示しておく必要があります。
なお、自分たちのサービス(カツプロほか)のコードを調べたところ、エラーになる書き方は使っていませんでした。モデル名を差し替えれば動く見込みです。
GPT-6 Sol・Luna で変わったこと
料金が半分になった
| 100万トークンあたり | 入力 | 出力 |
|---|---|---|
| GPT-5.6 Sol → GPT-6 Sol | $4 → $2 | $20 → $10 |
| GPT-5.6 Luna → GPT-6 Luna | $0.20 → $0.10 | $1.20 → $0.50 |
OpenAIは、9月4日に出した最上位の Astra と同じような方法で訓練し、速く安くしたモデルと説明しています。Sol については「難しい仕事もこなせる」と書かれています。キャッシュを読み込む分は90%引きになります。
Claude と比べた数字
OpenAIの発表には、Claude と比べた数字がいくつか載っています。
- AutomationBench:Sol(effort xhigh)が33.2%で、1回あたりの費用は $0.27。Opus 5(max)は26.9%で費用は11.1倍
- DeepSWE 1.1:Sol(max)が68.8%。Fable 5 の最高点69.9%と1.1ポイント差で、費用は約80%少ない
- OSWorld 2.0(オフライン):Sol(xhigh)が60.5%、Opus 5(medium)が60.3%。費用は約80%少ない
使える場所
ChatGPT Work と Codex で、Plus・Pro・Business・Enterprise・Edu の利用者が使えます。無料と Go のプランでは、デスクトップアプリで Luna だけが使えます。発表の時点では、普段のチャット画面ではまだ使えないと書かれています。
両社の数字は横に並べられるのか
発表どうしを並べたくなりますが、そのまま並べられるものと、並べられないものがあります。
AutomationBench は、ある程度並べられそうです。Anthropicの表でも OpenAIの表でも、Opus 5 は26.9%、Fable 5.1 は31.4%と、同じ値になっています。そのうえで並べると、Opus 5.5 は40.0%、GPT-6 Sol は33.2%です。ただし effort の設定が違い、Anthropic側は試験の版を書いていないので、同じ条件とまでは言えません。
OSWorld 2.0 は並べられません。同じ Opus 5 が、Anthropicの表では74.0%、OpenAIの表では60.3%です。OpenAIは「オフラインの問題で、部分点を含めた点数」と書いており、測り方が違います。
名前が同じ試験でも、同じモデルの点数が一致しているかを先に見ると、並べてよいかが分かります。
実際に測った。同じお題を、モデルだけ変えて
発表の数字は、各社が自分で測ったものです。そこで、自分でも同じお題を投げて、トークン数と費用を測りました。
測り方
- お題A(文章だけ):ホームページの保守契約を結ぶ前に確認すべきことを5つ、それぞれ2文で
- お題B(ファイルを作る仕事):ホームページ制作の見積もりシミュレーターを HTML 1枚で作り、自分で読み直して計算を確かめてから終える
- Claude は Claude Code から、GPT は API から動かした。どちらにも「ファイルを読む・書く・一部を直す」の3つの道具だけを渡した
- 7通りの設定で、お題ごとに3回ずつ。合計42回
- 費用は「API料金で払ったらいくらか」で比べた
1つ注意があります。Claude は Claude Code を通しているので、道具の説明などを毎回読み込んでいます。お題Aで比べると、Claude は2,400〜5,600トークン、GPT はお題の90トークンだけを読んでいました。会社をまたいだ費用の比較は、Claude にやや不利な条件です。同じ会社の中(Opus 5 と Opus 5.5)は同じ条件です。
お題B:ファイルを作る仕事の結果
| モデル(effort) | かかった時間 | API換算の費用 |
|---|---|---|
| Opus 5(high) | 108.9秒 | $0.420 |
| Opus 5.5(high) | 66.2秒 | $0.251 |
| Opus 5.5(medium) | 46.6秒 | $0.180 |
| Sonnet 5(high) | 39.6秒 | $0.085 |
| Fable 5.1(high) | 76.7秒 | $0.524 |
| GPT-6 Sol(high) | 63.5秒 | $0.095 |
| GPT-6 Luna(high) | 49.7秒 | $0.003 |
3回の平均です(カツプロ調べ)。出したトークンの量は次のとおりです。
| モデル(effort) | 出力トークン | うち考えた分 |
|---|---|---|
| Opus 5(high) | 10,045 | 2,608 |
| Opus 5.5(high) | 7,927 | 1,130 |
| Opus 5.5(medium) | 5,369 | 425 |
| Sonnet 5(high) | 4,765 | 550 |
| Fable 5.1(high) | 6,592 | 850 |
| GPT-6 Sol(high) | 6,282 | 1,597 |
| GPT-6 Luna(high) | 4,295 | 860 |
作ったものは、全部ちゃんと動いた
安く速くても、計算が間違っていたら意味がありません。作られた21枚のHTMLを全部ブラウザで動かし、3つの場面(10ページ・全部あり/1ページ・全部なし/30ページ・スマホ対応だけ)で合計金額が合うかを確かめました。
結果は、21枚すべてで3つの場面の金額が合っていました。スマホの幅で横にはみ出したものも、画面のエラーもありませんでした。
1枚だけ、Luna が「基本料金とは別に、全ページに1ページ15,000円」と読んで作っていました。お題の書き方が2通りに読めるので、間違いではなく読み方の違いです。ほかの20枚は「基本料金に1ページ目が入っている」と読んでいました。
測って分かったこと
① Opus 5.5 は、公式どおり約4割安かった
同じ high の設定で比べると、Opus 5.5 の費用は Opus 5 の0.60倍、時間は0.61倍でした。発表の「動かす費用は40%少ない」と、ほぼ同じ値です。3回の費用は、Opus 5 が $0.36〜0.50、Opus 5.5 が $0.20〜0.32 で、1回も重なりませんでした。
標準の medium にすると、費用は Opus 5 の0.43倍、時間も0.43倍まで下がります。
② 考える量は減った。ただし回によって大きくぶれる
考えた分のトークンは、同じ high で 2,608 → 1,130 と、平均では半分以下になりました。
ただし、Anthropicの開発者向けページには「同じ effort なら、1回あたりに考える量は Opus 5 より多くなる傾向」と書かれていて、今回の結果とは逆向きです。文章だけのお題Aでは、281 → 308 と少し増えていました。3回の幅も、Opus 5 が1,041〜3,938、Opus 5.5 が814〜1,594と重なっています。考える量は、お題と回によって大きく変わると見ておくのがよさそうです。
③ Fable 5.1 並みの仕事を、半分以下の費用で
Opus 5.5(high)の費用は、Fable 5.1(high)の0.48倍でした。今回のお題では、どちらも計算の合うものを作っています。
④ 安さだけなら Sonnet と Luna
このくらいの仕事なら、Sonnet 5 は Opus 5.5(medium)の半分以下の費用で、同じように動くものを作りました。GPT-6 Luna は $0.003 で、Opus 5.5(medium)の約60分の1です。
ただし今回のお題は、1枚のHTMLで済む小さな仕事です。長く複雑な仕事で同じ差になるかは、今回の実験では分かりません。
まとめ
9月22日の2社の発表は、どちらも「同じくらいの力を、もっと安く」という方向でした。
- Opus 5.5:Opus 5 より約4割安く、Claude Code の標準になった。自分で測っても、公式とほぼ同じ下がり幅だった
- GPT-6 Sol・Luna:料金が半分。Luna は、小さな仕事ならほとんど費用がかからない
- APIで使っている人:Opus 5.5 は effort の既定が medium に下がった。モデル名だけ差し替えると、考える深さが変わる
発表の数字を並べるときは、同じモデルの点数が両社の表で一致しているかを先に見るのがおすすめです。一致していなければ、測り方が違います。
参考にした公式の資料:Introducing Claude Opus 5.5(Anthropic)/What's new in Claude Opus 5.5(Claude Platform Docs)/Introducing GPT-6 Sol and Luna(OpenAI)
この記事の著者・監修
カツ
カツプロ運営者のカツです! AI・Web関連から、日常のことなど、私目線の回答も交えながらお伝えします!
この記事をシェア