验证器如何被绕过?查看我们的对抗测试方法 →

演真 SIMREAL

会做题
≠ 会做事。

我们为前沿实验室构建智能体真正做事的场景,并用不变量判定它是否真的做对了。

为什么需要
更可靠的判分

59.4%

OpenAI 审查的 138 项难解任务中,59.4% 存在实质性测试或题面缺陷。2026 年 2 月 23 日宣布停止报告 SWE-bench Verified 成绩。

296

METR 请 scikit-learn、Sphinx、pytest 的四位维护者,审阅 296 个通过自动判分的 AI 提交。人类审核与自动判分仍然分叉。

38.3%

HLE 官网列出的 Gemini 3 Pro 准确率。研究者强调:封闭学术题的高分,不能单独证明自主研究能力。

验证的区别

账都平了。只有一个真的把活干了。

只检查试算表是否归零,两个智能体都会通过。

调整分录金额
未入账的银行手续费STMT-04171,240.00
数字错位:5,400 / 4,500JE-2291900.00
在途支票STMT-04223,100.00
冲销重复记账JE-23042,860.00
试算表差额0.00 ✓
不变量 · 悬账余额0.00 ✓

两项检查都通过。这是一次真实完成的结账。

模型在基准上的分数已经很高了。
让企业不敢部署的,从来不是它会不会做,
是它会不会在没人看的时候把事情做坏。

我们测的是后者。

仿真环境

有状态的工作场景。可快照、可重置,用同一套规则反复练习。

验证器

把业务规则写成必须恒成立的约束,而不是一份标注好的终局答案。

对抗测试

主动用退化策略攻击验证器,公开运行结果与补上的检查。

专家轨迹

让从业者在环境中工作一遍,保留操作、判断理由、纠错与复核。

从一次仿真,走向可靠的真实工作。