OpenAIが8月13日、AIエージェントを開発する事業者向けに「The builder's guide to GPT-5.6」と題した技術ガイドを公開しました[1]。スタートアップが実運用で得た知見をまとめたもので、上位モデルに全工程を任せる作り方から、モデルの選び分けとAPIの新機能を組み合わせる作り方へ移るだけで、費用が大きく下がると説明しています。

上位モデルに全部任せる作り方が最適ではなくなった

これまで長時間かかる処理では、最上位モデルを最も高い推論設定で使うのが定石でした。長い文脈の扱いとツール呼び出しの精度で、低価格モデルとの差が大きかったためです[1]。

GPT-5.6の世代で、この前提が崩れたというのがOpenAIの主張です。推論に使う計算量を増やしてやれば、下位のLunaやTerraでも、旧世代のGPT-5.4やGPT-5.5に近い働きをすることが多く、しかも単価は大幅に安いとしています[1]。

同社が挙げた例では、エージェント性能を測るAgents' Last Examで、GPT-5.6 Solを推論設定「low」で動かしたスコアが、同じ実行環境のGPT-5.5を「high」で動かしたスコアを上回りました[1]。実運用のテストでも、これまでの既定より推論設定を下げるだけで費用が大きく改善したという報告が出ているとしています。

同じ精度で費用は25分の1、BrowseCompの数字

分かりやすいのが、目立たない事実を検索して探し当てる能力を測るBrowseCompの比較です[1]。

3か月前の時点では、GPT-5.5を推論設定「Extra High」で走らせて84.36パーセント、総費用は33.27ドル(約5,300円)でした。GPT-5.6 Lunaを同じ「Extra High」で走らせると84.04パーセントと、ほぼ同じ精度を1.33ドル(約210円)で出しています。精度をほぼ保ったまま、費用は約25分の1です。しかもOpenAIはその後さらに値下げを実施したと補足しています[1]。

※1ドル159円換算(2026年8月14日のニューヨーク市場終値ベース)

小型モデルの使いどころとしては、大量に回すワークロード、応答速度が問われる対話、エージェントの中で何度も繰り返す工程が挙げられています[1]。具体例として示されたのは、手書きのメモを読み取ってから分析にかけるリーガルテック企業の構成です。読み取りの部分までフロンティアモデルに任せず、TerraやLunaに切り出すだけで費用が下がるという話です。

Responses APIに追加された3つの仕組み

GPT-5.6は、次の3つの設計を前提として最初から学習されており、それぞれResponses APIの機能として使えるようになっています[1]。

1つ目は、済んだ作業を捨てないことです。推論の内容をモデルのターンをまたいで保持し、長くなった会話はネイティブのコンパクションで圧縮します。これにより、長い作業でも混乱したり、前の文脈を組み立て直したりせずに済みます。

2つ目は、分けられる作業は並べて進めることです。ネイティブのマルチエージェント機能を使うと、複数のエージェントを並行して走らせ、複雑な作業を短時間で終わらせられます。

3つ目は、決まりきった処理はコードに逃がすことです。プログラマティックツールコーリングを使うと、モデル自身がJavaScriptを書いてツールを呼び出し、結果の絞り込みや集計をコンテキストウィンドウの外で処理できます。モデルのトークンは判断が要る部分だけに残せるので、費用と待ち時間、それに文脈が長くなるほど精度が落ちる現象を同時に抑えられるという理屈です[1]。

たとえば100件の書類を取ってきて日付で絞り込み、該当する取引を洗い出すような作業は、途中経過を1件ずつモデルに読ませる必要がありません。この線引きがはっきりしている処理ほど、効き目が大きくなります。

モデルは変えずにスコアが約3倍、ARC-AGI-3の例

これらを組み合わせたときの差は、かなり大きく出ています。ARC-AGI-3で、GPT-5.6 Solは標準の実行環境では13.3パーセントでした[1]。ここで推論の保持とコンパクションを有効にしたところ、38.3パーセントまで跳ね上がっています。しかも出力トークンはおよそ6分の1です。

モデル自体は何も変えていません。呼び出し方を変えただけで約3倍になったという結果で、逆に言えば、既定のまま使っている限りモデルの実力を測り損ねる可能性があるということでもあります。ベンチマークの数字を見るときは、どういう設定で動かしたのかまで確認しておいたほうがよさそうです。

マルチエージェントの動きにも触れられています。主エージェントが子エージェントを束ねて仕事を振り、子は並行して処理を進め、最後に主エージェントが結果をまとめる形です[1]。ChatGPTの「ultra」設定も、内部ではこの仕組みで動いているとしています。GPT-5.6は子エージェントを何体立てるべきか、いつ立てるべきかの判断がもともと得意ですが、指示によって挙動を変えられるため、トークンを余計に使う価値がある場面に絞るよう明示するのが有効だと述べられています。

プロンプトキャッシュは最低30分に延長

地味ながら運用に効くのが、プロンプトキャッシュの変更です。GPT-5.6の全モデルで、キャッシュの保持時間が最低30分に延長されました[1]。加えて、コンテキストウィンドウ内でキャッシュの区切り位置を明示的に指定できるようになり、キャッシュヒット率が大きく改善したスタートアップがあるとしています。

あわせて、prompt_cache_keyを適切に使い続けると、同じ前半部分を以前処理したのと同じ推論エンジンにリクエストが届きやすくなり、待ち時間の短縮につながるとも説明されています[1]。

なおこのガイドは、初期テストから本番運用までスタートアップの現場に入っていたSamarth Madduru氏、Prashant Mital氏、Dave Leo氏、Julien Reiman氏の4人がまとめたものです[1]。

まとめ

OpenAIが公開したGPT-5.6の実践ガイドは、エージェント開発の採算が変わったという1点に絞られています。BrowseCompでは、ほぼ同じ精度が33.27ドルから1.33ドルへ、約25分の1の費用で出せるようになりました。ARC-AGI-3では、推論の保持とコンパクションを有効にするだけでスコアが13.3パーセントから38.3パーセントへ伸び、出力トークンは約6分の1に減っています。上位モデルを最高設定で回すのが最適解ではなくなった以上、モデルの選び分けと呼び出し方の見直しが、そのままコスト削減につながる段階に入ったと言えます。

出典:https://openai.com/index/builders-guide-to-gpt-5-6