Anthropic训练AI查AI:不给正常案例,误报率直接冲到97%
2026-08-27 18:49:49
币界网消息,Anthropic研究人员训练了一种专门调查其他AI的agent。他们给目标模型植入偏见、欺骗等隐藏行为,让Haiku 4.5在最多15轮中反复测试。训练时,研究人员不会告诉Haiku抓对了没有。每次调查后,系统将其与旧版Haiku的记录比较,再由Sonnet 4判断哪次查得更好。若训练题全是有问题的模型,Haiku会默认所有模型都有问题,导致误报率接近97%。研究人员随后将一半训练任务换成正常模型,只有正确判断目标模型没问题才能获得奖励。训练后的Haiku开始主动换场景、控制变量,最终综合审计得分从44.2提高到48.7,接近Opus 4.6的48.4。换到更难的auditbench,检测率从11.5%提高到最高28.1%。
来源:互联网
本内容只为提供市场信息,不构成投资建议。
关注HKWDB官方账号,及时关注最新动态









