位于伦敦的 AI 实验室 Inherent 发布了专门用于复现已发表研究的智能体 Faraday。它的底座只是一个 270 亿参数的模型,但在公布的评测中,这项任务上的表现超过了规模大得多的 Claude Opus 4.8 和 GPT-5.5。其目标并不是登上排行榜,而是让智能体学会真正科研人员的做事方式。
不给答案,让它把论文里的图重新画出来
训练 Faraday 使用的是名为 Replica 的强化学习任务空间。智能体拿到一篇研究论文,被要求复现其中的一张图。原始图表不会提供,可用的时间和算力也都设有上限,它能依靠的只有正文以及其中描述的方法。
初始任务集包含 310 个任务,取自机器学习与 AI for science 领域的 100 篇论文。覆盖范围从自然语言处理延伸到材料科学和天气预报,因此仅针对单一领域的特点做优化很难奏效。
复现一张图听上去像是杂活,但 Inherent 认为科研能力的核心恰恰在这里。论文记录的是走通了的步骤,作者试过又放弃的部分不会出现在纸面上。要完成复现,智能体必须自己把这些消失的试错重新搭建起来,而这需要以假设为驱动的探索,也正是科研本身的运作方式。
270 亿参数胜过体量高出数个量级的对手
对照组是 Anthropic 的 Claude Opus 4.8 与 OpenAI 的 GPT-5.5,分别在 Claude Code 和 Codex 的运行环境中执行,思考强度设为最高档。Faraday 的底座则是 Qwen 3.6 的 270 亿参数版本,规模上完全不在同一量级。
Inherent 表示,Faraday 在任务集的所有类别上都给出了更忠实的复现结果,其中元学习、结构生物学和材料科学的领先幅度最为明显。面对较新的研究时性能下滑也更小,该公司据此认为,智能体能够把学到的做法迁移到基础模型在预训练阶段未曾见过的内容上。
如何给研究品味打分
真正棘手的是评分方式。图看起来一样,并不等于复现成功。实验设计、科学操作是否规范、对原论文主张的忠实程度,以及对有限资源的使用方式,都需要纳入评价。该公司把这一整套称为 research taste,也就是研究品味。
为此,团队让大语言模型担任评委,并通过人工研究验证其判断与专家感觉的吻合程度。问题在于,语言模型评委的输出存在随机性,这种波动会直接变成奖励噪声。解决办法是为每个任务准备专属的评分细则,其一致性优于通用评委,与人类评分的吻合度也更高。训练阶段还追加了两项措施:对多次判断结果做聚合,以及把奖励细分到对话的每一轮。
小模型指挥大模型
另一个值得注意的地方是,Faraday 自身并没有编码工具。实际写代码的工作交给 GPT-5.5 Codex,Faraday 负责决定验证什么、怎么验证。这与人类研究者使用现成软件的关系如出一辙,只是被原样搬进了智能体。
更出人意料的是,Faraday 训练时的搭档是 GPT-5.4-mini,但在测试阶段改由它指挥性能更强的 GPT-5.5 Codex 后,表现反而提升。它把比自身大出数个量级的模型当作工具使用,并改善了结果。如果编码智能体的能力继续增长,Inherent 判断,负责指挥的那一层判断力只会更有价值。此外 Faraday 不依赖人工搭建的进化式框架,也不使用测试期奖励,这一点与既有的自动研究智能体不同。
Inherent 是一家刚起步的公司,2026 年 5 月以 5,000 万美元(约 80 亿日元)的种子轮融资走出隐身状态,由 Google DeepMind 的前成员创办,总部设在伦敦国王十字区。目前团队约 12 人,计划在年内扩充到 20 至 25 人。这次的成果是它对外交出的第一份答卷。
※1 美元 = 159 日元(截至 2026 年 8 月 21 日)
总结
Inherent 发布的 Faraday 底座只有 270 亿参数,却在论文复现任务上超过了 Claude Opus 4.8 与 GPT-5.5。关键在于三点:不给出标准答案、要求还原图表的任务设计;对科研质量本身打分的评分细则式评委;以及把实现工作交给更大模型的分工方式。把它当作一种主张来读,它想说的是,让 AI 对科学有用,除了把模型做大之外还有别的路径。
