AIモデルの選び方
Claude(Anthropic)と GPT(OpenAI)を公式の数字で比べる

2026年9月23日時点 / 出典はすべて Anthropic・OpenAI・Microsoft の公式ページ
3行まとめ
① 迷ったら Claude は Opus 5.5、GPT は GPT-6 Sol
② どうしても解けない難問だけ Fable 5.1/GPT-6 Astra に上げる。簡単で大量の作業は Haiku 4.5/GPT-6 Luna に下げる。
③ Claude と GPT は総合ではほぼ互角。「何を頼むか」で選ぶ(コード・事務・難問=Claude、科学・セキュリティ=GPT)。

1. 場面別:どのモデルに頼む?

Claude

こんな時頼む相手
Opus 5.5 で2回やってもダメな難問/何時間も任せきりの長い作業(切り札)Fable 5.1
普段の仕事ほぼ全部(文章・資料・分析・コード)Opus 5.5
日常のコード作業を速く・安くSonnet 5
分類・短い要約など簡単で大量の作業、とにかく速くHaiku 4.5

GPT(ChatGPT・Codex)

こんな時頼む相手
何段階もの手順・複数ツールをまたぐ最難関、パソコン操作の代行GPT-6 Astra
普段の仕事・複雑なコード(Codexの基本)GPT-6 Sol
手順が決まった単純な繰り返し・大量処理・無料で試すGPT-6 Luna

旧モデル(Claude Opus 5・Fable 5、GPT-5.6 Sol/Terra/Luna・GPT-5.5)は新しく選ぶ理由なし(新モデルが上位互換)。GPT-5.5 は 10/14 に ChatGPT・Codex から引退。Microsoft 365 Copilot での選び方は5章。

2. 賢さランキング(会社別)

Claude(公式の格付け順)

順位モデルひとことで出力料金
/100万
1Fable 5.1公式の「最高性能」。切り札$50
2Opus 5.5普段の主力。数字では Fable と同等以上$20
3Sonnet 5速さと賢さのバランス型$10
4Haiku 4.5最速・最安$5

GPT

順位モデルひとことで出力料金
/100万
1GPT-6 Astra公式「全分野で最高」。最難関用$50
2GPT-6 Sol普段の主力。Astra より少し下で値段は5分の1$10
3GPT-6 Luna最速・最安。じっくり考えさせると旧主力並み$0.5

上位2つの関係(同じ会社の中での対決)

Fable 5.1 vs Opus 5.5 → 普段は Opus 5.5。公式比較の9項目すべてで Opus 5.5 が上、値段は4割。Anthropic の言い方は「ほとんどの仕事で Fable 5.1 と同じ水準」で、Fable を最高性能とする位置づけは変えていません。Fable が数字で勝つ場面は公開されておらず、使うのは最難関・長時間作業の「保険」です。

GPT-6 Astra vs GPT-6 Sol → 普段は Sol。賢さははっきり Astra が上(3〜8ポイント差)。ただし Sol に最大まで考えさせると、Astra を軽く考えさせた時と同じくらいになり、値段は5分の1です。

数字の根拠を見る
テスト(何を測る?)Opus 5.5Fable 5.1
Terminal-Bench 4.0(コード作業)66.4%55.8%
FrontierCode(難しいコード)54.4%50.3%
CursorBench 4.0(実務のコード)57.8%51.8%
GDPval-AA(事務・ホワイトカラーの仕事)18461735
AutomationBench(業務の自動化)40.0%31.4%
HLE(超難問・ツールあり)67.7%65.6%
Terminal-Bench-Science(科学の作業)58.7%52.6%
OSWorld 2.0(パソコン操作)81.8%80.7%
Chartography(図表の読み取り)89.0%88.4%
テスト(何を測る?)AstraSol
Agents' Last Exam(プロの複雑な作業)59.3%56.4%(max)
DeepSWE(実際のコード開発)74.1%68.8%(max)
AutomationBench(業務の自動化)41.4%33.2%(xhigh)
同上・Astra を軽く(low)30.3%33.2%

出典:Anthropic「Claude Opus 5.5」OpenAI「GPT-6 Astra」OpenAI「GPT-6 Sol and Luna」

3. 会社対決:Claude vs GPT

結論:総合ではほぼ互角。分野で勝ち負けがはっきり分かれる。
Claude が強い=コード作業・事務の仕事・超難問。GPT が強い=科学・セキュリティ・ひらめき型の推論。
普段使いどうし(Opus 5.5 vs GPT-6 Sol)は、賢さは Opus 5.5 が上、値段は Sol が半額。

分野別の勝敗(最上位どうし)

分野ClaudeGPT-6 Astra勝ち
コード作業(Terminal-Bench 4.0)66.4%57.9%Claude
実際のコード開発(DeepSWE)67.4%(Fable 5.1)74.1%GPT(Opus 5.5 は未測定)
難しいコード(FrontierCode)54.4%53.3%互角
事務・ホワイトカラーの仕事(GDPval-AA)18461542Claude(大差)
業務の自動化(AutomationBench)40.0%41.4%互角
超難問(HLE・ツールあり)67.7%57.2%Claude(大差)
科学の作業(Terminal-Bench-Science)58.7%64.6%GPT
セキュリティ(ExploitGym)30.4%(Fable 5.1)42.4%GPT(大差)
ひらめき型の推論(ARC-AGI-2)90.0%(Fable 5.1)95.0%GPT
超長文の読み取り記載なし96.3%比較不可
パソコン操作(OSWorld 2.0)81.8%72.6%比較不可(測った会社で数字がずれる)
第三者の総合指数(Artificial Analysis)65.7(Fable 5.1)61.2Claude(Opus 5.5 は未測定)

Claude 列は特記なしなら Opus 5.5。どちらも自社測定のため、2ポイント以内は互角と判定。

AnthropicOpenAI(旧モデルも並べたグラフ。バーにカーソルを合わせると出典が出ます)

例:「AIの仕組みづくり」はどっちに頼む?

→ 作るのは Claude(Opus 5.5)、チェックは GPT(Codex)。

4. エフォート(考える強さ)の切り替え方

結論:基本は「初期設定(GPTは公式おすすめの段階)」のまま。困った時だけ1段ずつ動かす。
答えが浅い・間違う → 1段上げる。簡単な作業・急ぎ → 1段下げる
いちばん上まで上げてもダメ → そこで初めて上のモデルに替える(Anthropic公式:「エフォートの調整の方が、モデルを替えるより効くことが多い」)。
このルールは Claude・GPT・Copilot 共通。モデルごとに違うのは「始める段階」だけ。

段階ごとの使いどころ(共通)

段階こんな時
low(Light・軽)簡単・大量・速さ最優先
medium普段の仕事
high難しい分析・ややこしいバグ・計画づくり
xhigh(Extra High)30分を超える長い自律作業、深い調査
max最難関の1問に全力を出させる時だけ

上げるほど遅くなり、使用量(料金・クレジット・利用上限)が増える。GPT-6 Sol・Luna には即答の none もある。Haiku 4.5 は切り替え不可。

始める段階(ここだけモデルで違う)

モデル始める段階
Opus 5.5medium(初期設定)
Fable 5.1・Sonnet 5high(初期設定。claude.ai・Cowork の Fable 5.1 は medium)
GPT-6 AstraLight(軽)(公式のおすすめ。Codex では Light・Medium・Extra High の3段)
GPT-6 SolMedium(公式のおすすめ)
GPT-6 LunaHigh(公式のおすすめ。小さいモデルは強めに)

Codex の画面を開いた時の初期値は「Sol Light」(プラン・環境で変わる)。

5. Microsoft 365 Copilot では?

⚠️ この資料を読むときの注意

出典

OpenAI:GPT-6 AstraGPT-6 Sol and LunaGPT-5.6AstraSolLuna モデル資料 / ReasoningCodexのモデル選び
Anthropic:Claude Opus 5.5Claude Fable 5.1Claude Opus 5Claude Sonnet 5モデルの選び方モデル一覧Effort
Microsoft:GPT-6 Astra in Microsoft CopilotGPT-5.6 in Microsoft 365 CopilotClaude Opus 5 in Microsoft 365 CopilotCopilot Cowork models