Google在9月15日更新AI & Economy ATLAS,并公布与Google DeepMind、MIT FutureTech合作的一项研究。研究分析了2600个专业AI模型,并调查600多名美国和英国科学家。结果显示,接近一半受访科学家每天使用某种AI,受访者自报每周节省接近7小时。但研究同时发现,更多假设被快速生成后,物理实验、临床验证和结果核查出现积压。这个结论比“AI让科研提速”更完整:模型能缩短部分脑力流程,却不能自动扩充实验室、样本和审批资源。
七小时不是自动增加的科研产出,而是被重新分配的时间
科学家使用AI的方式并不单一。大语言模型横跨多个学科和任务,用于查找资料、整理思路、写代码和处理文字;专业模型更集中在生命科学、健康研究以及特定的数据预测、生成和模拟。两类工具相互补充:通用模型降低表达和编程门槛,专业模型把领域知识与数据结构做得更深。把所有AI使用都归为“聊天机器人”,会忽略真正影响科研流程的专用系统。
受访者报告的近7小时属于自报节省,不等于经过随机试验验证的平均生产率,也不代表所有学科都获得同样收益。熟悉编程、数据充足的团队,可能更快把AI接进工作流;依赖昂贵设备、长期随访或现场采样的领域,前端节省的时间未必能缩短项目总周期。调查对象主要来自美国和英国,也不宜直接代表全球科学界。
研究最有启发的部分,是“假设积压”。当文献归纳、数据分析和候选生成变快,研究人员可以提出更多值得测试的问题。但实验设备、伦理审批、临床样本和资深研究者的判断没有同步扩容,于是瓶颈从想法生成转向验证。企业软件常见的规律也出现在实验室:优化一个环节,往往只是把排队移到下一个环节。
这意味着评估AI科研工具不能只计算写作或代码节省多少分钟。更重要的是,最终验证了多少有价值的假设,错误候选是否减少,实验失败率是否下降,论文和数据能否复现。如果模型让团队产生十倍候选,却没有更好的排序和淘汰机制,实验负担可能反而上升。
Google同时开放新的ATLAS交互体验,让用户查看不同职业、国家和任务中的AI使用。官方举例称,在经合组织国家,计算与数学、商业与金融职业的使用领先;在非经合组织国家,办公室行政、创意媒体和教育等职业更突出。美国工作相关AI使用中,计算和数学职业占30%,约为其他地区相应占比的两倍。这些数据描述使用构成,不应被误读为30%的美国技术人员都在使用AI。
科研机构要改造的是验证体系,而不只是给每个人开一个账号
第一步是把AI输出与研究证据分开记录。文献摘要、代码、数据清洗和候选预测应保留模型版本、提示、输入来源和人工修改。研究结论必须回到原始数据、实验与同行审查。工具可以提出解释,但不能把高置信度语气当作证据等级。
第二步是投资下游能力。如果假设生成更快,机构应增加共享实验平台、自动化仪器、数据工程和统计复核资源,并建立候选优先级。否则节省的七小时会变成更多等待。管理者需要观察项目周期的整体变化,而不是只看员工使用次数。
第三步是识别偏差。专业模型依赖既有数据,稀有疾病、低资源语言和代表性不足的人群更容易被遗漏。大模型还可能编造引用或复述已存在的主流假设。团队应保留独立检索、阴性结果和反证流程,避免效率工具把学术共识中的盲点进一步放大。
第四步是调整人才训练。年轻研究者如果直接获得整理后的答案,可能跳过理解实验设计和数据局限的过程。合理做法不是禁用AI,而是要求解释选择、复核引用、重现实验,并把节省的时间投入更深的领域学习。只有能发现模型错误的人,才能安全使用模型。
ATLAS本身是一项长期研究项目,Google表示将继续与学术伙伴扩展。当前结果提供的是采用情况和受访者感受,不是AI已经带来某种确定比例的科学发现增长。尤其“每天使用”和“节省时间”都可能受到样本、任务定义与自我报告影响,需要后续独立研究验证。
这份研究把AI生产率讨论推进了一步。真正的问题不是科学家能否更快写代码或总结论文,而是整个发现链条能否吸收新增速度。当实验、临床和复核跟不上时,模型创造的是候选库存,而不是知识。未来最成功的科研机构,可能不是生成假设最多的机构,而是最会筛选、验证并公开不确定性的机构。












