AI 模型基准测试正从学术题库走向更贴近实际业务的评估体系。TechCrunch 报道称,成立于 2024 年的初创公司 Vals 正试图借此切入市场。该公司上月完成 4000 万美元 A 轮融资,由 Andreessen Horowitz 领投。
不再只测通识能力
Vals 的判断是,传统公开基准已越来越难反映新一代模型的真实能力。一方面,模型更新速度很快;另一方面,公开测试题也可能被模型开发方反复针对,导致分数与实际表现出现偏差。
这家公司没有把重点放在通用知识问答或考试式测试上,而是更强调模型能否完成具体行业任务。报道显示,Vals 主要评估法律、金融、编程等场景中的复杂工作,并尝试比较模型产出与人工结果的质量差异。
封闭测试覆盖更多场景
与许多公开基准不同,Vals 不披露具体测试材料。其思路是减少“对题训练”带来的干扰,让评估结果更接近模型在真实环境中的表现。
除了常见行业任务,Vals 也在扩大测试范围。公司称,当前评估内容已延伸至递归自我改进、心理健康、网络安全、生物安全,以及武装冲突法等方向,同时也会观察模型可能带来的负面结果。
收入增长并拓展政府客户
Vals 的商业模式是向模型开发方收费,提供评测服务。报道提到,这类服务虽然看起来像是“付费发现问题”,但对企业而言,持续测量有助于定位短板并改进模型,也会影响采购方对模型的选择。
- 当前收入约为上年同期的 8 倍
- 团队人数已从年初的 8 人增至 25 人
- 计划继续招聘 10 至 15 人
此外,Vals 近期还推出了面向美国联邦机构的模型评估项目,试图把业务从科技公司扩展到政府客户。TechCrunch 认为,随着更多 AI 公司走向资本市场,模型评测结果可能逐步进入公开披露、采购决策和投资沟通环节。












