AI搞科学准确率从16.9%飙升至92.8%:不是因为模型变聪明了

· 科技资讯

🔥 关注 → 星标,不错过 AI 前沿

AI 搞科学,一直有个尴尬的真相:大模型在现实科学问题上准确率只有 16.9%。你可以让它写一首关于蛋白质折叠的诗,但让它正确预测一个药物分子的结合位点——抱歉,准头跟掷骰子差不多。

cover-3-ai-science.png

而就在几天前,Anthropic 的 AI for Science 活动上公布了一个令人震惊的数字:加上确定性工具后,准确率直接飙到 92.8%

🔥 16.9% → 92.8%:不是因为模型变聪明了

关键不是让大模型变得更”懂科学”,而是给它配了确定性工具——传统的计算化学算法、已知的物理规律模拟器、经过验证的结构数据库。大模型负责理解自然语言、提出假说和分析方向;具体的分子对接、结合能计算、基因组比对——交给传统算法。两者结合,准确率翻了 5.5 倍。

这不是”AI 替代科学家”,而是”科学家 + AI + 确定性工具”的铁三角。每个人做自己最擅长的事。

同期另一条数据同样惊人:在生物学基准上,加入工具链后 AI 的输出从”经常胡说”变成了”可复现的科学结果”。这意味着 AI 辅助科研正在从”灵感助手”进化到”实验伙伴”。

🔥 Claude Science AI Workbench:macOS 上就能跑

同期发布的 Claude Science AI Workbench 定位为科学家的”AI 工作台”。60+ 预配置技能覆盖基因组学、蛋白质组学、单细胞分析、化学信息学。本地 macOS/Linux 就能跑,也可以接到 HPC 集群——让大学实验室的研究生不用排队等超算。

内置的审稿 Agent 会自动检查引用的真实性和计算的正确性——相当于每个实验多了一个终身审稿人。NVIDIA 的 BioNeMo Agent Toolkit 被集成其中,提供 GPU 加速的分子模拟。

选定 AI for Science 项目可获得最高 $30,000 的算力积分——Anthropic 在用真金白银测试 AI 科学的可行性边界。

🔥 GeneBench-Pro:用合成数据破解评估难题

OpenAI 同期发布了 GeneBench-Pro——129 道基因组学基准题,覆盖统计遗传学、癌症基因组学、临床诊断等 10 个领域。用合成数据(已知因果结构)做确定性打分,避免了传统基准中”数据泄漏”的问题。

GPT-5.6 Sol 得分 28.7%,而 GPT-5 在原版 GeneBench 上不到 5%。进步巨大,但离”替代人类专家”还有漫长距离。129 题中只有 10 道被开源在 Hugging Face 上——剩下的需要在隔离环境中运行以防止污染训练数据。

🔥 这波 AI+Science 的真正信号

Anthropic 和 OpenAI 同时押注科学方向,不是巧合。当对话式 AI 的差异化空间越来越窄,科学发现正成为下一块衡量模型能力上限的试金石。谁能帮生物学家找到新药靶点、帮材料学家预测新晶体结构、帮气候学家模拟碳循环,谁就定义了 AI 的下一个十年。

👇 关注我,不被 AI 科学的口号忽悠,只看硬数据


— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn

滚动至顶部
微信公众号:LC智趣厅

扫码关注微信公众号
LC智趣厅