由多位前 Google DeepMind 成员创立的英国 AI 新创 Inherent,近期正式公开旗下 AI 科学研究代理 Faraday。
公司宣称,在「独立重现科学论文研究成果」的特定测试中,Faraday 击败了 OpenAI GPT-5.5 与 Anthropic Claude Opus 4.8;更值得注意的是,Faraday 底层仅采用一个 270 亿参数(27B)的 Qwen 3.6 模型。
Inherent 想证明:与其单纯把基础模型做得更大,能否透过强化学习(RL)、工具使用与长时间自主工作,把相对小型的模型训练成特定领域的专家 Agent?
而 Inherent 最终的野心也不只是「重做别人的论文」,而是打造能自行提出问题、设计实验,甚至发现人类尚未发现的新知识的 AI Scientist(AI 科学家)。
Inherent 将这套 AI Agent 命名为 Faraday,名称来自英国科学家 Michael Faraday(法拉第)。Inherent 解释,1821 年 Faraday 在撰写电磁学领域回顾时,选择亲自重现过去的研究成果,并在过程中发现通电导线可以绕着磁铁运动,最终成为电动马达发展的重要起点。
公司因此建立名为 Replica 的训练任务。初始版本包含来自 100 篇机器学习与 AI for Science 论文的 310 项任务,涵盖自然语言处理、材料科学、天气预测等领域。AI 并不是读完论文后回答选择题,必须在有限时间与算力下,自行重现论文中的研究图表,而且不能事先取得原始图表。
Inherent 共同创办人兼首席科学家 Edward Hughes 表示,论文重现本身就是科学训练的重要环节,「许多博士生其实就是从这件事开始」。
Faraday 建立在只有 27B 参数的 Qwen 3.6 之上,但 Inherent 公布的 Replica 测试显示,它在论文重现任务上的平均表现超越 Claude Opus 4.8 与 GPT-5.5。Inherent 在测试 Claude Opus 4.8 与 GPT-5.5 时,分别透过 Claude Code 与 Codex 执行,并将 reasoning/thinking effort 设定至极高。公司表示,Faraday 在测试中的各类论文都产生更忠实的重现结果,面对较新的研究也较不容易失败。
OpenAI 过去其实也推出过类似概念的 PaperBench,要求 AI Agent 从零开始理解论文、编写代码并执行实验。OpenAI 当时测试的最佳 Agent 平均重现分数仅 21%,而且尚未超越机器学习博士生基准,凸显「真正重做研究」远比单纯回答论文问题困难。
更有意思的是,Inherent 认为单纯把实验结果做对还不够。公司希望 Faraday 学会所谓的 Research Taste(研究品味):知道什么问题值得研究、什么实验值得做,以及如何在有限资源下设计出好的实验。因此 Inherent 采用长时间跨度的强化学习(long-horizon RL),透过结果给予模型奖励,而不是直接告诉模型每一步该怎么操作。公司另外设计评分标准,并透过真人研究验证 AI 评审与专家判断的一致程度。
Hughes 表示,公司始终以建立 AI Scientist Agent 为「北极星」,其中重要的一环,就是让 Agent 具备研究品味。这也是 Inherent 与一般「AI 帮你查论文」产品最大的差异。
Inherent 这家位于伦敦的 AI 实验室由 Edward Hughes、Louis Kirsch、Kaloyan Aleksiev 与 Tantum Collins 共同创立,其中包括多名 Google DeepMind 前成员。就在公布 Faraday 前几周,Inherent 才刚结束隐身模式,完成高达 5,000 万美元的种子轮融资。公司接下来预计在年底前将团队扩张至约 20~25 人,除了 AI Scientist,Inherent 的研究野心还涵盖 world models。
免责声明:本文提供的信息不是交易建议。BlockWeeks.com不对根据本文提供的信息所做的任何投资承担责任。我们强烈建议在做出任何投资决策之前进行独立研究或咨询合格的专业人士。