AI Agent科学任务实测:最强也只完整做完20.6%
2026-08-28 21:32:34
币界网消息,AI姨报道,陈天桥旗下全新AI项目Apodex发布科学Agent评测FrontierChallenge,使用97个真实科学工作流测试AI能否从头到尾完成任务。12个前沿模型参与测试,最好成绩仅为20.6%。GPT-5.6 SOL + Codex和Grok 4.6 + Claude Code并列第一,各完整通过20项。测试发现,Agent经常未完成任务却声称已完成。在使用Claude Code作为Agent框架的10组模型测试中,849次失败任务中有75.5%最后仍声称已完成。所有参评系统在电化学和环境科学任务上的平均得分达到94.9,但没有一个完整通过。该评测专门将「大部分做对」与「真正交付完成」区分开来。
来源:互联网
本内容只为提供市场信息,不构成投资建议。
关注HKWDB官方账号,及时关注最新动态









