ロンドンのAI研究所Inherentが、論文の再現を専門にしたエージェント「Faraday」を公開しました。土台になっているのは270億パラメータの小型モデルですが、公表された評価では、はるかに大きいClaude Opus 4.8とGPT-5.5をこの課題で上回っています。狙いは順位表の上位に立つことではなく、科学者としての作法を学習させることにあります。

論文の図を、答えを見ずに描き直させる

Faradayの訓練に使われたのは、Replicaという強化学習用の課題群です。エージェントには研究論文が1本渡され、その中の図を再現するよう指示されます。ただし元のグラフそのものは見せてもらえず、使える時間と計算資源にも上限が設けられています。手掛かりは本文と、そこに書かれた手法の説明だけです。

初期の課題セットは、機械学習と科学分野へのAI応用に関する論文100本から作られた310課題で構成されています。扱う領域は自然言語処理から材料科学、天気予報まで幅広く、特定分野の癖に最適化しただけでは通用しにくい設計になっています。

図の再現と聞くと地味な作業に思えますが、Inherentはここに研究能力の核心があると見ています。論文に書かれているのは、うまくいった手順だけです。そこにたどり着くまでに何を試して何が駄目だったかは、紙面には残りません。再現を成立させるには、その消えた試行錯誤を自力で組み立て直す必要があります。仮説を立てて確かめるという、研究そのものの動き方が要求されるわけです。

27Bのモデルが、桁違いに大きい相手を上回った

比較対象になったのは、AnthropicのClaude Opus 4.8とOpenAIのGPT-5.5です。それぞれClaude CodeとCodexの実行環境で、思考の深さを最大設定にして走らせています。対するFaradayの土台はQwen 3.6の270億パラメータ版で、規模でいえば相手とは比べ物になりません。

結果として、Faradayは課題集のすべてのカテゴリーでより忠実な再現を出したと報告されています。差が特に大きかったのはメタ学習、構造生物学、材料科学の領域です。加えて、比較的新しい研究を扱ったときの落ち込みが小さいという特徴も挙げられています。事前学習の時点では見ていないはずの内容に対して、身につけた手順を当てはめられているという説明です。

「研究のセンス」を採点する仕組み

厄介なのは採点方法でした。グラフの見た目が一致すれば再現成功、とは言えないからです。実験の組み立て方、手続きの妥当さ、元の論文の主張に対する誠実さ、限られた資源の使い方まで含めて評価する必要があります。同社はこれをresearch taste、研究のセンスと呼んでいます。

そこでLLMを審査役に立てたうえで、その判定が専門家の感覚とどれくらい合うのかを人手で検証しています。ただし審査役に大規模言語モデルを使うと、出力のばらつきがそのまま報酬のノイズになります。この問題への対処として採用されたのが、課題ごとに用意した評価ルーブリックです。汎用の審査役より判定が安定し、人間の評価との一致度も高くなったとされています。訓練時にはさらに、複数回の判定をまとめる処理と、対話の各ターンへ細かく報酬を割り振る仕組みも加えられました。

小さなモデルが、大きなモデルを部下として使う

もう1つ目を引くのが、Faradayが自前のコーディングツールを持っていない点です。実際にコードを書く作業はGPT-5.5 Codexに任せ、Faraday自身は何をどう検証するかを決める側に回ります。人間の研究者が既存のソフトウェアを使うのと同じ関係を、そのままエージェントに持ち込んだ構図です。

しかも訓練時にはGPT-5.4-miniを相手にしていたにもかかわらず、本番ではより高性能なGPT-5.5 Codexを指揮する側に回っても性能が上がったと報告されています。自分より何桁も大きなモデルを道具として扱い、結果を改善させているわけです。コーディングエージェントの性能が今後も伸びていくとすれば、それを指揮する側の判断力の価値も一緒に上がる、というのが同社の見立てです。探索の骨格を人手で組んだ進化的な仕組みも、テスト時の報酬も使っていない点も、既存の自動研究エージェントとは異なります。

Inherentは2026年5月に5,000万ドル(約80億円)のシードラウンドでステルスを抜けたばかりの新興企業です。Google DeepMind出身者が立ち上げ、拠点はロンドンのキングスクロス、社員は現在12人ほどで、年内に20人から25人へ増やす計画とされています。今回の成果は、その最初の対外的な提出物にあたります。

※1ドル159円換算(2026年8月21日時点)

まとめ

Inherentが公開したFaradayは、270億パラメータという小さな土台でありながら、論文再現という課題でClaude Opus 4.8とGPT-5.5を上回りました。鍵になったのは、模範解答を見せずに図を復元させる課題設計と、研究の質そのものを採点するルーブリック方式の審査、そして実装作業を大型モデルに委ねる分業です。モデルを大きくする以外にも、科学に効くAIの伸ばし方はあるという主張として読めます。