仿真环境
把网球挥拍练一万次,不等于会打比赛。真正的检验只发生在对局里。
我们构建有状态的工作场景:软件、数据、任务与例外一起运行。每次练习都能重置、回放和检查。智能体在里面完成工作,每一步都会改变接下来发生的事。
一个人怎么学会做一份工作?不是读完手册。
是做错了被人指出来,然后再做一遍。
而指出错误的那个人,知道一些手册上从来没写下来的东西。
我们的产品都在做同一件事:
把那些没被写下来的判断,变成机器可以被检验的形式。
把网球挥拍练一万次,不等于会打比赛。真正的检验只发生在对局里。
我们构建有状态的工作场景:软件、数据、任务与例外一起运行。每次练习都能重置、回放和检查。智能体在里面完成工作,每一步都会改变接下来发生的事。
账平了,不等于账做对了。把差额塞进悬账科目,试算表照样归零。
我们不只比对标注好的终局状态,还检查不变量——那些在整条轨迹上不能被破坏的约束。同一领域的不同任务,可以复用业务规则,并用证据验证完成质量。
所有人都说自己的判分很严。很少有人告诉你,它曾经被绕过多少次。
我们用已知退化策略攻击验证器,保留第一轮的漏洞、补上的检查,以及再次运行的结果。可执行的案例和检查代码一同公开,让每一个数字都能被追问。
一个资深会计和一个新人做同一笔对账,结果可能一样,过程完全不同。而值钱的是过程。
我们让从业者在环境里工作一遍,记录每一次操作、关键判断的依据,以及在哪里停下来重新思考。轨迹保留返工;专业复核决定它能否进入训练数据。
老师批改作文,不会只在末尾写一个分数。他会在第三段画一道线。
我们把检查落到每一步:操作是否有效,证据是否充分,约束是否被打破。过程判断与最终得分分别保存,为过程奖励模型提供可追溯的监督信号。
同一份方案,五个资深的人会给出五种改法。他们之间的分歧,比他们的共识更有信息。
我们设计独立完成与独立复核流程,把分歧点单独标出来。保留不同判断的依据,再交由领域复核者裁决,让数据呈现专业工作真正困难的部分。
考题只要公开得够久,就会失效。持续更新,是评测的一部分。
我们将评测实例与训练数据分开,按版本保存任务分布、验证器和污染检查记录。季度刷新是评测集的交付计划,每次更新都应附带检查报告。
学会在一种软件里工作,不代表能走进另一家公司,接着把事情做完。
我们的环境路线图覆盖飞书、钉钉、企业微信、金蝶、用友、1688、Shopee 与 Lazada。从本地业务习惯和工作流出发,逐步构建中国及其他非美国软件生态中的训练场景。
一座图书馆要几代人才能填满,但你明天就能走进去读。
教育、营销、办公协作、数学、编程与客服的首批任务已经可以运行。六类环境、十八个场景模板,共用状态、动作、奖励和回放接口,可以接入训练与评测流程。
让智能体学会把真实工作做对。