AIモデルの選び方
Claude(Anthropic)と GPT(OpenAI)を公式の数字で比べる
② どうしても解けない難問だけ Fable 5.1/GPT-6 Astra に上げる。簡単で大量の作業は Haiku 4.5/GPT-6 Luna に下げる。
③ Claude と GPT は総合ではほぼ互角。「何を頼むか」で選ぶ(コード・事務・難問=Claude、科学・セキュリティ=GPT)。
1. 場面別:どのモデルに頼む?
Claude
| こんな時 | 頼む相手 |
|---|---|
| Opus 5.5 で2回やってもダメな難問/何時間も任せきりの長い作業(切り札) | Fable 5.1 |
| 普段の仕事ほぼ全部(文章・資料・分析・コード) | Opus 5.5 |
| 日常のコード作業を速く・安く | Sonnet 5 |
| 分類・短い要約など簡単で大量の作業、とにかく速く | Haiku 4.5 |
GPT(ChatGPT・Codex)
| こんな時 | 頼む相手 |
|---|---|
| 何段階もの手順・複数ツールをまたぐ最難関、パソコン操作の代行 | GPT-6 Astra |
| 普段の仕事・複雑なコード(Codexの基本) | GPT-6 Sol |
| 手順が決まった単純な繰り返し・大量処理・無料で試す | GPT-6 Luna |
旧モデル(Claude Opus 5・Fable 5、GPT-5.6 Sol/Terra/Luna・GPT-5.5)は新しく選ぶ理由なし(新モデルが上位互換)。GPT-5.5 は 10/14 に ChatGPT・Codex から引退。Microsoft 365 Copilot での選び方は5章。
2. 賢さランキング(会社別)
Claude(公式の格付け順)
| 順位 | モデル | ひとことで | 出力料金 /100万 |
|---|---|---|---|
| 1 | Fable 5.1 | 公式の「最高性能」。切り札 | $50 |
| 2 | Opus 5.5 | 普段の主力。数字では Fable と同等以上 | $20 |
| 3 | Sonnet 5 | 速さと賢さのバランス型 | $10 |
| 4 | Haiku 4.5 | 最速・最安 | $5 |
GPT
| 順位 | モデル | ひとことで | 出力料金 /100万 |
|---|---|---|---|
| 1 | GPT-6 Astra | 公式「全分野で最高」。最難関用 | $50 |
| 2 | GPT-6 Sol | 普段の主力。Astra より少し下で値段は5分の1 | $10 |
| 3 | GPT-6 Luna | 最速・最安。じっくり考えさせると旧主力並み | $0.5 |
上位2つの関係(同じ会社の中での対決)
Fable 5.1 vs Opus 5.5 → 普段は Opus 5.5。公式比較の9項目すべてで Opus 5.5 が上、値段は4割。Anthropic の言い方は「ほとんどの仕事で Fable 5.1 と同じ水準」で、Fable を最高性能とする位置づけは変えていません。Fable が数字で勝つ場面は公開されておらず、使うのは最難関・長時間作業の「保険」です。
GPT-6 Astra vs GPT-6 Sol → 普段は Sol。賢さははっきり Astra が上(3〜8ポイント差)。ただし Sol に最大まで考えさせると、Astra を軽く考えさせた時と同じくらいになり、値段は5分の1です。
数字の根拠を見る
| テスト(何を測る?) | Opus 5.5 | Fable 5.1 |
|---|---|---|
| Terminal-Bench 4.0(コード作業) | 66.4% | 55.8% |
| FrontierCode(難しいコード) | 54.4% | 50.3% |
| CursorBench 4.0(実務のコード) | 57.8% | 51.8% |
| GDPval-AA(事務・ホワイトカラーの仕事) | 1846 | 1735 |
| AutomationBench(業務の自動化) | 40.0% | 31.4% |
| HLE(超難問・ツールあり) | 67.7% | 65.6% |
| Terminal-Bench-Science(科学の作業) | 58.7% | 52.6% |
| OSWorld 2.0(パソコン操作) | 81.8% | 80.7% |
| Chartography(図表の読み取り) | 89.0% | 88.4% |
| テスト(何を測る?) | Astra | Sol |
|---|---|---|
| Agents' Last Exam(プロの複雑な作業) | 59.3% | 56.4%(max) |
| DeepSWE(実際のコード開発) | 74.1% | 68.8%(max) |
| AutomationBench(業務の自動化) | 41.4% | 33.2%(xhigh) |
| 同上・Astra を軽く(low) | 30.3% | 33.2% |
出典:Anthropic「Claude Opus 5.5」/OpenAI「GPT-6 Astra」/OpenAI「GPT-6 Sol and Luna」
3. 会社対決:Claude vs GPT
普段使いどうし(Opus 5.5 vs GPT-6 Sol)は、賢さは Opus 5.5 が上、値段は Sol が半額。
分野別の勝敗(最上位どうし)
| 分野 | Claude | GPT-6 Astra | 勝ち |
|---|---|---|---|
| コード作業(Terminal-Bench 4.0) | 66.4% | 57.9% | Claude |
| 実際のコード開発(DeepSWE) | 67.4%(Fable 5.1) | 74.1% | GPT(Opus 5.5 は未測定) |
| 難しいコード(FrontierCode) | 54.4% | 53.3% | 互角 |
| 事務・ホワイトカラーの仕事(GDPval-AA) | 1846 | 1542 | Claude(大差) |
| 業務の自動化(AutomationBench) | 40.0% | 41.4% | 互角 |
| 超難問(HLE・ツールあり) | 67.7% | 57.2% | Claude(大差) |
| 科学の作業(Terminal-Bench-Science) | 58.7% | 64.6% | GPT |
| セキュリティ(ExploitGym) | 30.4%(Fable 5.1) | 42.4% | GPT(大差) |
| ひらめき型の推論(ARC-AGI-2) | 90.0%(Fable 5.1) | 95.0% | GPT |
| 超長文の読み取り | 記載なし | 96.3% | 比較不可 |
| パソコン操作(OSWorld 2.0) | 81.8% | 72.6% | 比較不可(測った会社で数字がずれる) |
| 第三者の総合指数(Artificial Analysis) | 65.7(Fable 5.1) | 61.2 | Claude(Opus 5.5 は未測定) |
Claude 列は特記なしなら Opus 5.5。どちらも自社測定のため、2ポイント以内は互角と判定。
例:「AIの仕組みづくり」はどっちに頼む?
→ 作るのは Claude(Opus 5.5)、チェックは GPT(Codex)。
- 作る側に Claude:ルールの文章・手順書・設定ファイル・小さなプログラムは、Claude が勝っている「コード作業」「事務の仕事」「超難問の判断」にあたる。
- チェックに GPT:別の会社のモデルは間違え方の癖が違うので、同じ見落としをしにくい(一般論で、公式データではない)。
- 大きなプログラムを書く時:実際のコード開発(DeepSWE)は GPT が上なので、Codex(GPT-6 Sol)に任せる手もある。
4. エフォート(考える強さ)の切り替え方
いちばん上まで上げてもダメ → そこで初めて上のモデルに替える(Anthropic公式:「エフォートの調整の方が、モデルを替えるより効くことが多い」)。
このルールは Claude・GPT・Copilot 共通。モデルごとに違うのは「始める段階」だけ。
段階ごとの使いどころ(共通)
| 段階 | こんな時 |
|---|---|
| low(Light・軽) | 簡単・大量・速さ最優先 |
| medium | 普段の仕事 |
| high | 難しい分析・ややこしいバグ・計画づくり |
| xhigh(Extra High) | 30分を超える長い自律作業、深い調査 |
| max | 最難関の1問に全力を出させる時だけ |
上げるほど遅くなり、使用量(料金・クレジット・利用上限)が増える。GPT-6 Sol・Luna には即答の none もある。Haiku 4.5 は切り替え不可。
始める段階(ここだけモデルで違う)
| モデル | 始める段階 |
|---|---|
| Opus 5.5 | medium(初期設定) |
| Fable 5.1・Sonnet 5 | high(初期設定。claude.ai・Cowork の Fable 5.1 は medium) |
| GPT-6 Astra | Light(軽)(公式のおすすめ。Codex では Light・Medium・Extra High の3段) |
| GPT-6 Sol | Medium(公式のおすすめ) |
| GPT-6 Luna | High(公式のおすすめ。小さいモデルは強めに) |
Codex の画面を開いた時の初期値は「Sol Light」(プラン・環境で変わる)。
5. Microsoft 365 Copilot では?
- Copilot Chat:最新は GPT-5.6 と Claude Opus 5。GPT-6・Opus 5.5 はまだ来ていない(公式発表なし)。エフォートは選べず、「Think deeper(じっくり考える)」を使うかどうかだけ。
- Copilot Cowork:GPT-6 Astra(9/4〜)、Fable 5.1、Opus 5、Sonnet 5 などを選べる。エフォートも Light〜Max で選べる(上げるほどクレジットを多く使う)。
- 選び方:1回ごとの料金がかからないので「速さ」で選ぶ。簡単・急ぎ → Sonnet 5/大事・難しい → Opus 5(Chat では Claude の最上位)/迷ったら → 自動(Auto)(Microsoft のおすすめ)。
⚠️ この資料を読むときの注意
- 個人の理解用の「ざっくりまとめ」です。数字は各社の公式発表から集めましたが、一つひとつ原文とは照合していません。正確な数字は出典の公式ページで確認してください。
- 数字は各社が自分で測った値。自社に有利なテストを選びがちなので、1〜2ポイントの差は互角と考える。
- 同じテストでも出典で数字が少しずれる(例:Opus 5 の Terminal-Bench 4.0 は 51.8%/52.3%/52.6%)。
- 「どれだけ考えさせるか」の設定をそろえずに比べている表がある。
- Anthropic 自身も「この水準では点数の差は実際の使い心地の差になりにくい」と書いている。
- 2026年9月23日時点の情報。Sonnet 5.5・Haiku 5.5 は「数週間以内」と予告済み。
出典
OpenAI:GPT-6 Astra / GPT-6 Sol and Luna / GPT-5.6 / Astra・Sol・Luna モデル資料 / Reasoning / Codexのモデル選び
Anthropic:Claude Opus 5.5 / Claude Fable 5.1 / Claude Opus 5 / Claude Sonnet 5 / モデルの選び方 / モデル一覧 / Effort
Microsoft:GPT-6 Astra in Microsoft Copilot / GPT-5.6 in Microsoft 365 Copilot / Claude Opus 5 in Microsoft 365 Copilot / Copilot Cowork models