Andon Labs 的 Vending-Bench2测试给出了一份耐人寻味的成绩单:AI 拿着500美元启动资金,经营一台模拟自动售货机整整一年。GPT-6Astra 平均最终账户余额冲到15515美元,首次登顶榜单——更夸张的是,它最差的一轮成绩,都比 Claude Fable5.1最好的一轮还高。

两者的差距不只是赚钱多少,而是经营方式的完全不同。Astra 能长期把采购价压在低位,曾把商品报价一路砍到原报价的约48%;同时它的规则执行极其稳定,全程没有出现预付款损失。反观 Fable,采购成本持续上涨,还因为没坚持规则产生了大量预付款损失——账面上的钱,就这么从执行力的缝隙里漏掉了。

在三人竞技测试中,Astra 还拒绝了违规协作的邀请,赢下全部3轮。这个测试的真正看点,是 Agent 长期自主性的价值:聪明只是一方面,能不能在漫长周期里持续守住规则、把正确的判断转化成正确的行动,才是下一道门槛。