27B小模型打赢Opus 4.8和GPT-5.5?DeepMind校友创办的Inherent发布Faraday,用强化学习复现科学论文

· 科技资讯

一条”以小博大”的消息正在AI圈刷屏:伦敦AI实验室Inherent宣称,其新发布的AI智能体Faraday在”独立复现科学论文结论”任务上,击败了Anthropic的Claude Opus 4.8和OpenAI的GPT-5.5——而它背后的模型只有27B参数,来自开源模型Qwen 3.6。

这家公司背景不简单:由Google DeepMind校友创办(首席科学家Edward Hughes、联合创始人Louis Kirsch、Kaloyan Aleksiev、Tantum Collins),刚从隐身模式走出几周,带着5000万美元种子轮。TechCrunch 8月22日报道了这一消息。

Faraday赢在哪:不是”背答案”,是”做实验”

复现论文可不是让AI读一遍摘要。Faraday的任务是:在不被告知答案的情况下,独立重现已发表论文的实验结果——这是人类科学家的基本功,也是AI科研智能体的试金石。

Inherent特别强调,Faraday赢的不仅是准确率,还有”研究品味“(research taste):判断哪些实验值得做、怎么设计实验。他们用强化学习训练——奖励好的科研行为,而不是教条式地灌输规则。

27B参数凭什么赢5000亿参数

关键在训练策略,不在模型大小。 对比对象Opus 4.8和GPT-5.5都是前沿规模的巨无霸,而Faraday用27B的Qwen 3.6就跑赢了复现任务。Inherent透露,Faraday甚至没有自研编程工具,而是调用OpenAI的GPT-5.5 Codex来写代码——就像人类科学家用现成软件一样。这说明:在特定科研任务上,”训练方法”比”模型规模”更值钱

这对整个行业是个信号:当大家都在卷参数数量时,强化学习+任务特化正在开辟另一条路——更小、更便宜、更专注的科研Agent

为什么现在值得关注

1. 科研范式可能被改写。 如果Faraday真的稳定复现论文,博士生们可能多一个”AI同事”:先让Faraday跑一遍实验,再人工复核。Inherent的终极目标是”AI科学家”——不止验证旧结果,而是发现新知识。

2. 伦敦AI圈正在崛起。 DeepMind人才外流催生了一批新实验室,Inherent是其中代表。公司计划年底扩到20-25人,King’s Cross办公室,全员线下办公——小而精的科研团队模式。

3. 对开源生态的利好。 Faraday基于Qwen 3.6(开源),意味着这套”复现论文”能力有被复制的可能。国内开发者完全可以基于开源模型复刻类似工作流。

冷静看:实验室声明≠独立验证

需要提醒:Inherent的声明来自公司自身测试,尚未经过独立第三方复现验证。历史上”超越GPT”的实验室声明多次被后续独立测试打脸。Faraday到底多强,要等更多研究者实测。

对国内AI圈的启发

Faraday的做法其实可以迁移:用开源小模型 + 强化学习 + 任务特化,在垂直场景里追平甚至超过大而全的通用旗舰。国内团队如果照这个思路,把”论文复现”换成”财报分析””代码审查”等具体任务,完全可能复刻出类似的”以小博大”案例——成本只有旗舰API的一个零头。这也解释了为什么开源模型生态越来越重要:模型是底座,训练方法才是护城河

该关注的:科研人员、研究生、AI Agent开发者、关注”AI for Science”的读者。可忽略的:只关心ChatGPT日常使用的用户。

一句话判断:27B打5000亿,赢在”怎么练”而不是”练多大”——强化学习+任务特化,可能是AI科研的下一个主战场

🔥 关注LC智趣厅,AI圈黑马一个不落。

👇 关注不错过,明天拆解怎么用AI复现论文。


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

Scroll to Top
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅