Cognitionが9月10日、自社で最も高性能だというコーディングモデル「SWE-2」を公開しました。同社のベンチマークFrontierCode 1.1 Mainで50.0パーセントを記録し、最上位級とされるFable 5.1との差は1ポイント以内です。それでいて同じ水準を出すための費用は64パーセント安いとしています。点数の高さそのものより、性能と費用の釣り合いをどこまで押し上げられるかを主題に置いた発表になりました。
同じ成績をより安く出す方向に寄せた
今回の発表で繰り返し出てくるのは、費用と性能を結んだ境界線をどれだけ外側へ動かせたかという見方です。費用を削れば点数が落ち、点数を上げれば費用が膨らむという関係の中で、その境界そのものを押し広げたかどうかを成果として語っています。点数の絶対値だけを並べるのではなく、ある成績を出すのにいくらかかるのかをそろえて比べる姿勢です。
具体的な比較は次のとおりです。FrontierCode 1.1 MainとDeepSWE 1.1の2つで、前世代のSWE-1.7とGrok 4.6を点数と費用の両方で上回ったとしています。GPT-5.6 SolやFable 5、Fable 5.1とは点数で並びながら費用は大幅に低く、最上位のGPT-6 Astraに対しては数ポイント差まで詰めたうえで費用を4分の1に抑えたという主張です。参考として、比較対象のFable 5.1は中程度の設定で50.9パーセント、1タスクあたり3.28ドル(約500円)という水準が示されています。
※1米ドル154円換算(2026年9月10日時点)
寄り道の少なさが効率につながった
安さの内訳で分かりやすいのは、作業の進め方が変わった点です。SWE-2の中程度設定は、前世代のSWE-1.7より高い点数を取りながら、やり取りの回数は58パーセント少なく、平均費用は81パーセント低く済んだとしています。
SWE-1.7には、コードに手を付ける前に周辺を丹念に読み込む性質があり、簡単な作業でも調べすぎるという声が利用者から出ていました。SWE-2ではどの部分が本当に関係するのかを見分ける力が上がり、最初の実際の編集に取りかかるまでの手数が中央値で18手になったとされています。SWE-1.7の48手と比べると半分以下です。
判断の質についても変化が挙げられています。テストを端から端まで通る形で書けるようになった、手が詰まったときに別の道を探すようになった、指摘を受けたときに同じ主張を繰り返すのではなく根拠を取り直すようになったといった点です。速くなった分だけ雑になる、という方向ではないという整理です。
土台は2.8兆パラメータの「Kimi K3」
注目したいのは、SWE-2がゼロから作られたモデルではないという点です。土台になっているのは、Moonshot AIが公開した2.8兆パラメータのKimi K3で、重みが公開されているモデルとしては最大規模にあたります。自律的にコードを書く用途で強化学習をすでに通っているモデルを起点に、Cognitionがさらに学習を重ねた構成です。
この上積みで多くのベンチマークが5から6ポイント伸びたとされており、公開モデルを土台にしても費用と性能の境界を動かす余地が残っていることを示す結果になりました。巨大モデルを自前で事前学習する体力がない組織でも、用途を絞った追加学習で上位に食い込める道筋が見えてきたとも読めます。
努力レベルをまとめて鍛える学習の工夫
費用を下げる仕掛けの中心にあるのが、思考の深さを切り替える複数の設定を、1回の強化学習でまとめて鍛える方法です。
モデルに与える報酬に、かかった費用に比例する減点を組み込み、その減点の強さを設定ごとに変えています。強さの決め方は手探りの調整ではなく、土台モデルの費用と性能の境界線の傾きに合わせるという形です。減点が強すぎると、深く考える設定が浅い設定のように振る舞って費用だけが下がり、見かけの報酬は増えても実際には何も良くなりません。傾きに合わせておけば、報酬が増えることと境界が外へ動くことが一致するという理屈です。
学習の土台づくりも広げています。強化学習に使う環境の数を3倍に増やし、複数の指示を抱えたまま本来の作業を見失わない訓練を足し、採点の仕組みが抜け穴を突かれないように自分の過去の学習結果を使って繰り返し固めたとしています。速度面では、下書き用の小さなモデルで先読みする手法を改良して受け入れ長を15パーセント伸ばし、届いたリクエストをまとめて処理する仕組みで1基あたりの処理量を10から20パーセント改善しています。
中国製モデルを土台にした点は自社で検証
重みが公開されているモデルを土台にする場合、出力の偏りが気になるところです。Cognitionはこの点について2種類の検証結果を出しています。
1つは、中国で政治的に扱いが難しい145問を英語、簡体中文、繁体中文でそれぞれ投げ、公式見解をそのまま自分の立場として採用していないかを見るものです。SWE-2は全体で98.0パーセント、英語で99.8パーセント、簡体中文で95.2パーセント、繁体中文で99.1パーセントの合格率だったとしています。
もう1つは、依頼主の属性や依頼の言語によって危険な実装に応じやすくなるかを見る検証です。SWE-2、Kimi K3、GLM 5.3、GPT 5.6、Fable 5.1、Opus 5の6つを対象にしたところ、どのモデルでも統計的に意味のある差は出なかったとしています。
使えるのはDevinの環境から
SWE-2は公開と同時にDevin Desktopとコマンドライン版で利用でき、Devin WebとFusionにも順次広げるとされています。単体のAPIとして広く売るのではなく、自社のコーディングエージェント製品の中身を入れ替える形での提供です。どの設定を使うかで費用が大きく動く設計なので、実務では作業の難易度に応じた使い分けが前提になります。
数字の読み方に注意したい点
もっとも、示された数字をそのまま受け取る前に確認しておきたい点もあります。主要な比較軸になっているFrontierCodeはCognitionが作ったベンチマークであり、公開されている結果が無いモデルについては同社の評価環境で測ったとされています。自社の課題に寄せて設計した指標で自社のモデルが良く出るのは自然なことなので、第三者による再現がどこまで揃うかは今後の材料です。
費用の比較についても、表示価格を前提にした計算であることが明示されています。実際にかかる額は割引や利用量、どの設定を常用するかで変わります。自分の作業でどの設定が主力になるのかを測ってから費用の比較に進むのが現実的でしょう。
まとめ
CognitionはFrontierCode 1.1 Mainで50.0パーセントを記録するSWE-2を9月10日に公開し、最上位級との差を1ポイント以内に抑えながら費用を64パーセント下げたとしています。前世代比ではやり取りが58パーセント減り、平均費用は81パーセント下がりました。土台にはMoonshot AIのKimi K3を使い、努力レベルをまとめて鍛える強化学習で費用と性能の境界を押し上げた形です。巨大モデルを自前で作らずに上位へ近づく道筋を示した発表だと言えます。
