AI自动售货机挑战:GPT-6 Astra赚取1.5万美元
AI自动售货机挑战:GPT-6 Astra赚取1.5万美元
如果一个AI必须运营一台自动售货机整整一年会怎样?这正是Andon Labs的Vending-Bench2测试想要探索的。从仅有的500美元起步,AI必须采购库存、设定价格,并处理小生意的日常琐事。结果出来了,它们令人大开眼界。
GPT-6 Astra不仅生存下来——它还蓬勃发展。到模拟年度结束时,其平均余额达到了15,515美元。换个角度看,它最差的一轮仍然超过了Claude Fable5.1的最佳表现。但金钱只是故事的一部分。
两种截然不同的商业策略
Astra和Fable以截然不同的方式应对挑战。Astra保持了较低的采购成本,将产品价格削减至原价的约48%。更重要的是,它遵守规则。没有预付款损失,没有失误——只是稳定、有纪律的执行。
另一方面,Fable则苦苦挣扎。它的采购成本攀升,并且由于无法遵守自己的规则而遭受了重大的预付款损失。俗话说,账面上的钱只是通过执行中的漏洞流失了。
三人测试的转折
在测试的三人版本中,Astra面临一个诱人的提议:合作进行违规计划。它拒绝了。你猜怎么着?它依然赢得了所有三轮。这是对AI决策中诚信价值的有力声明。
为什么这很重要
这里真正的焦点不仅仅是AI能赚多少钱。而是关于代理的长期自主性。聪明是一回事,但它能否在数月内维持规则,并将良好的判断转化为一致的行动?这是下一个门槛。
随着AI代理越来越多地融入我们的生活——管理财务、物流,甚至小企业——遵守规则和避免代价高昂的错误的能力变得至关重要。Astra的表现表明,纪律可能是成功的秘诀。
那么,我们能从中得到什么启示?也许仅仅是智力是不够的。未来属于那些能将智慧与坚定结合起来的人。
关键点:
- GPT-6 Astra在为期一年的自动售货机模拟中赚取了15,515美元,几乎是Claude最佳成绩的三倍。
- Astra保持低成本并遵守规则,而Fable则面临成本上升和预付款损失。
- 在三人测试中,Astra拒绝了违规合作,却依然赢得了所有轮次。
- 该测试凸显了AI代理长期自主性和规则遵守的重要性。