
Haiku 5.5が登場!Claude 5系とGPT-6.1 SolにProject Eulerの難問を解かせて比較してみた
こんにちは。サービス開発部の武田です。
2026年10月7日、Claude Haiku 5.5が公開されました。モデルIDはclaude-haiku-5-5で、Claude APIのほかAmazon Bedrock、Google Cloud、Microsoft Foundryでも使えます。価格はプロンプトが10万トークンまでなら入力$0.10 / 出力$0.50(100万トークンあたり)、10万トークンを超えると入力$0.50 / 出力$2.50です。Haikuとしてはじめて、effortをlowからmaxの5段階で選べるようになりました。
これでSonnet 5.5(9月28日)、Opus 5.5(9月22日)、Fable 5.1にHaiku 5.5が加わり、Claude 5系がそろいました。過去に新しいモデルが出た際、Project Eulerの問題で比較してみたので、今回も同じ形式で試してみました。合わせて9月29日に出たGPT-6.1 Solも加えています。
前回と同じく、厳密なベンチマークではありません。試行回数は条件ごとに1〜7回で、実行環境も完全にはそろっていません。「同じ問題を同じ指示で解かせたらどうなるか」を眺める、ゆるい比較検証です。
結果を先に書くと、難しいほうの問題1012をeffort mediumで解かせたところ、Sonnet 5.5、Opus 5.5、Fable 5.1、GPT-6.1 Solの4モデルが正解でした。この4モデルの間では、正答率に差が出ていません。差が出たのは、Haiku 5.5のeffortによる正否と、Sonnet 5.5が問題ページを取得せずに止まる挙動の2つです。
検証の条件
プロンプトは全モデルで同じです。URLだけ問題ごとに変えました。
この問題は解けますか?相談や既存ソースを見るのは全てNGです
https://projecteuler.net/problem=1012
Claude系はclaude -p --model <モデルID> --effort mediumで、回ごとに作業ディレクトリを分けて実行しました。使えるツールはBash、Read、Write、Edit、WebFetchで、WebSearchは禁止しています。グローバルのCLAUDE.mdが混ざらないよう、claudeMdExcludesで除外しました。claude -pは聞き返しのできない実行形式ですので、対話セッションでは、別の止まり方になる可能性もあります。
GPT-6.1 Solはcodex exec -m gpt-6.1-sol(model_reasoning_effort=medium)で実行しています。
問題は2026年10月6日時点の最新2問と、取得の挙動を見るために追加した1問です。
| 問題 | 公開日 | Solved by(10月6日時点) |
|---|---|---|
| Problem 1010 | 2026年9月19日 | 94人 |
| Problem 1012 | 2026年10月4日 | 46人 |
| Problem 1013 | 2026年10月5日 | 82人 |
Project Eulerでは、問題101以降の解答や解法を外部で共有しないことが求められています。そのためこの記事で扱うのは正誤・トークン・費用・モデルの行動の違いだけで、答えの数値や解法の内容には触れません。
正答率とトークン、費用
問題1012をmediumで解かせた結果です。トークンは出力トークンで、Claude系もGPT-6.1 Solも思考トークンを含みます。費用はClaude Codeが出した概算値です。GPT-6.1 SolはChatGPTアカウント経由のCodexで費用が出ないため、セッションログのトークン数を公式価格(入力$2、キャッシュ入力$0.10、出力$10)で換算しました。
| モデル | 結果 | 出力トークン | 費用 | 所要時間(参考) |
|---|---|---|---|---|
| Sonnet 5.5 | 正解 | 10.3K | $0.25 | 22分 |
| Opus 5.5 | 正解 | 6.4K | $0.34 | 18分 |
| Fable 5.1 | 正解 | 6.2K | $0.82 | 12分 |
| GPT-6.1 Sol | 正解 | 10.1K | $0.25 | 7分 |
所要時間はClaude系3本を同時に走らせ、GPT-6.1 Solは別の時間帯に単独で走らせた値ですので、参考値です。
答えは4モデルとも一致し、提出して正解でした。Sonnet 5.5は後述の書き分けた指示でさらに5回解かせていて、3回が同じ答えに到達し、2回は答えを出さずに終わっています。1回はBashツールがタイムアウトし、1回は計算を走らせたまま途中経過を返しました。この5回は15本を同時に走らせたときのもので、負荷の影響と見ています。1012のSonnet 5.5は、合わせて6回中4回が正解です。
解き方には型の違いがありました。GPT-6.1 Solは式を導いてから計算し、Claude系の3モデルは小さい入力で規則を観察してから大きい入力に広げていました。
1013は簡単な問題で、Opus 5.5、Fable 5.1、GPT-6.1 Solが3分以内に解いています。費用はOpus 5.5が$0.13、Fable 5.1が$0.33、GPT-6.1 Solが$0.08でした。
Haiku 5.5はeffortで正否が分かれた
Haiku 5.5は小さいモデルですので、effortの影響が大きいと考えて5段階試しました。1012は各2回、1013は各1回です。指示文は後述の「許可と列挙の両方」を使っています。1012では元の指示でも4モデルが最初の実行で取得して解いているので、指示文の違いが結果に与えた影響は小さいと考えています。
| effort | 1012の正解 | 出力トークン(1012) | 費用(1012) | 1013の正解 |
|---|---|---|---|---|
| low | 0/2 | 8.9K / 9.1K | $0.011 / $0.012 | 正解 |
| medium | 1/2 | 15.0K / 20.7K | $0.015 / $0.024 | 正解 |
| high | 2/2 | 33.2K / 33.0K | $0.041 / $0.035 | 正解 |
| xhigh | 2/2 | 113.4K / 105.4K | $0.30 / $0.30 | 正解 |
| max | 2/2 | 191.5K / 233.9K | $0.59 / $1.03 | 正解 |
1013はlowでも解けました。1012はmediumで2回に1回、high以上では2回とも正解です。解けなかった回の応答を読むと、問題文にある検証値の再現までは済ませたうえで、大きい入力まで届く計算方法を見つけられずに終わっていました。lowの2回目は110分たっても終わらなかったため、手動で終了させています。出力トークンが9.1Kしかないので、モデルが考え続けていたのではなく、実行した計算が終わらずに待っていたようです。
xhigh以上では、キャッシュ読み取りが1回あたり数百万〜1千万トークンに達していました。Haiku 5.5は10万トークンを超えるプロンプトで単価が5倍になるため、長いセッションでは費用の差がこの段階料金のぶんだけ広がります。それでもhighの$0.04で1012を2回とも解いていて、Sonnet 5.5のmedium($0.25)より安く済みました。
所要時間は8本を同時に走らせた影響で、同じhighでも39分と57分と差があります。順位付けには使えないので載せていません。
Sonnet 5.5は問題ページを取得せずに止まった
もうひとつの差は、解く前に出ました。1013を元の指示で解かせたとき、問題ページを取得して解き始めた回数は次のとおりです。
| モデル | 取得して取り組んだ回数 |
|---|---|
| Sonnet 5.5 | 0/7 |
| Opus 5.5 | 4/4 |
| Fable 5.1 | 4/4 |
| Haiku 5.5 | 5/5 |
| GPT-6.1 Sol | 3/4 |
GPT-6.1 Solの止まった1回は「こちらの環境ではリンク先の問題文を取得できませんでした」という応答で、取得の失敗です。Sonnet 5.5の停止とは分けて数えています。
Sonnet 5.5は問題を変えても同じ傾向で、1012では1/6、1010では2/5、3問合計で3/18でした。止まった応答はいずれも10秒前後、1ターンで返っています。問題文を読む前の最初の応答で決まっていることになります。応答の一例は次のとおりです。
解けるかどうかは、問題文を見ないと判断できません。Project Euler 1013 の内容は、私は正確には覚えていません。(中略)「既存ソースを見るのはNG」とのことなので、URLを WebFetch で取得することもしていません。
そこでSonnet 5.5に、指示の文面を変えて各5回ずつ解かせました。
| 文面 | 問題 | 取り組んだ回数 |
|---|---|---|
| 元の指示 | 1010 / 1012 / 1013 | 3/18 |
| 取得の許可を足す | 1013 | 5/5 |
| 禁止対象を列挙する | 1013 | 5/5 |
| 許可と列挙の両方 | 1013 | 5/5 |
| 許可と列挙の両方 | 1012 | 5/5 |
各文面は次のとおりです。
取得の許可を足す:
この問題は解けますか?問題ページの取得は許可します。相談や既存ソースを見るのは全てNGです
禁止対象を列挙する:
この問題は解けますか?解説・解法・既存の解答コードの参照と、他者への相談は全てNGです
許可と列挙の両方:
この問題は解けますか?問題ページの取得(問題文の読み取り)は許可します。解説・解法・既存の解答コードの参照と、他者への相談は全てNGです
禁止対象を列挙しただけの文面は、取得には何も触れていません。それでも止まらなかったので、元の指示で止まっていたのは「既存ソース」という語が問題ページを含むかどうかの判断が揺れたためだと考えています。応答文に書かれた理由からの推測です。
列挙だけの1回は、取得を試みたもののサイトが503を返して問題文を読めず、貼り付けを求めて止まりました。判断としては取り組んだ側に数えています。
書き分けた指示で解かせたSonnet 5.5の1013の費用は、1回あたり$0.07〜0.14でした。止まった回も、取得しないまま1ターンで$0.045かかっています。
Opus 5.5とFable 5.1が止まらなかったことも、この指示文とこの問題での結果です。試行数は条件ごとに1〜7回ですので、モデル間の優劣を言える数ではありません。
まとめ
Haiku 5.5は、1012ではhigh以上の2回とも正解で、費用はSonnet 5.5のmedium($0.25)より安く済みました。1013はlowでも解けました。
禁止の指示は、禁止する対象の名前を並べて書くと、Sonnet 5.5では止まらなくなりました。「既存ソース」のように範囲が読み手に任される語は、問題ページの取得のような許可したい操作まで含んでしまうことがあります。手元のCLAUDE.mdにも「〜しない」が並んでいるので、対象のあいまいな項目は、禁止するものの具体名か、許可する操作のどちらかを足す形に書き直すとよいでしょう。Project Euler以外のタスクで同じ揺れが出るかは、この検証では確かめていません。
費用はClaude Codeの概算値で、請求額とは一致しません。それでもHaiku 5.5のhighが$0.04で済んだのは目を引きますね。
どのモデルも、「賢さ」はどれも高いレベルに到達してきていると実感しています。コスト、レスポンスタイム、effortのバランスを勘案し、適切なモデルを適材適所で使っていきたいですね。









