AI搞科学准确率从16.9%飙升至92.8%:不是因为模型变聪明了
🔥 关注 → 星标,不错过 AI 前沿
AI 搞科学,一直有个尴尬的真相:大模型在现实科学问题上准确率只有 16.9%。你可以让它写一首关于蛋白质折叠的诗,但让它正确预测一个药物分子的结合位点——抱歉,准头跟掷骰子差不多。

而就在几天前,Anthropic 的 AI for Science 活动上公布了一个令人震惊的数字:加上确定性工具后,准确率直接飙到 92.8%。
🔥 16.9% → 92.8%:不是因为模型变聪明了
关键不是让大模型变得更”懂科学”,而是给它配了确定性工具——传统的计算化学算法、已知的物理规律模拟器、经过验证的结构数据库。大模型负责理解自然语言、提出假说和分析方向;具体的分子对接、结合能计算、基因组比对——交给传统算法。两者结合,准确率翻了 5.5 倍。
这不是”AI 替代科学家”,而是”科学家 + AI + 确定性工具”的铁三角。每个人做自己最擅长的事。
同期另一条数据同样惊人:在生物学基准上,加入工具链后 AI 的输出从”经常胡说”变成了”可复现的科学结果”。这意味着 AI 辅助科研正在从”灵感助手”进化到”实验伙伴”。
🔥 Claude Science AI Workbench:macOS 上就能跑
同期发布的 Claude Science AI Workbench 定位为科学家的”AI 工作台”。60+ 预配置技能覆盖基因组学、蛋白质组学、单细胞分析、化学信息学。本地 macOS/Linux 就能跑,也可以接到 HPC 集群——让大学实验室的研究生不用排队等超算。
内置的审稿 Agent 会自动检查引用的真实性和计算的正确性——相当于每个实验多了一个终身审稿人。NVIDIA 的 BioNeMo Agent Toolkit 被集成其中,提供 GPU 加速的分子模拟。
选定 AI for Science 项目可获得最高 $30,000 的算力积分——Anthropic 在用真金白银测试 AI 科学的可行性边界。
🔥 GeneBench-Pro:用合成数据破解评估难题
OpenAI 同期发布了 GeneBench-Pro——129 道基因组学基准题,覆盖统计遗传学、癌症基因组学、临床诊断等 10 个领域。用合成数据(已知因果结构)做确定性打分,避免了传统基准中”数据泄漏”的问题。
GPT-5.6 Sol 得分 28.7%,而 GPT-5 在原版 GeneBench 上不到 5%。进步巨大,但离”替代人类专家”还有漫长距离。129 题中只有 10 道被开源在 Hugging Face 上——剩下的需要在隔离环境中运行以防止污染训练数据。
🔥 这波 AI+Science 的真正信号
Anthropic 和 OpenAI 同时押注科学方向,不是巧合。当对话式 AI 的差异化空间越来越窄,科学发现正成为下一块衡量模型能力上限的试金石。谁能帮生物学家找到新药靶点、帮材料学家预测新晶体结构、帮气候学家模拟碳循环,谁就定义了 AI 的下一个十年。
👇 关注我,不被 AI 科学的口号忽悠,只看硬数据
— END —
LC 智趣厅 · 科技与生活的交点
ihygg.cn
