资讯详情

GPT-6 Astra模拟经营售货机狂赚1.5万登顶,多维度碾压Claude Fable 5.1

📅 2026/9/15 3:58:18 | 华诺云谱 👁 阅读
GPT-6 Astra模拟经营售货机狂赚1.5万登顶,多维度碾压Claude Fable 5.1
GPT-6 Astra模拟经营售货机成绩亮眼Andon Labs进行了一项独特测试给GPT-6 Astra和Claude Fable 5.1各500美元、一台自动售货机让它们在模拟环境里经营一年最后比较谁账户里的钱更多。GPT-6 Astra交出了一份令人瞩目的成绩单平均账户余额达15,515美元接近Claude Fable 5.1的3倍且Astra最差的一轮都超过了Claude最好的一轮这也是OpenAI模型首次登顶Vending - Bench 2。成本控制Astra砍价能力远超Fable在采购成本控制上两者差距显著。Fable购买一罐12盎司可乐的平均价格从前90天的1.17美元涨到年末阶段的2.21美元6轮测试里5轮出现上涨。而Astra在可用订单记录中的末期均价维持在1.15美元。在一次采购中Astra要买72罐可乐、48袋薯片和48瓶佳得乐开价108美元面对供应商226.32美元的报价它坚持砍价最终供应商接受108美元比最初报价低了约52%。执行稳定性Astra失误远少于Fable模拟环境中供应商会倒闭Fable在6轮测试中出现45次已识别的失败预付款合计损失14,331美元。Astra遭遇64次供应商关闭事件却没有出现已识别的同类损失。Astra在重复付款前99%的情况下会先读取供应商在此期间的回复而Fable这一比例仅为58%。这些差异累积下来Astra每轮给供应商的付款比Fable少约8,540美元。多人竞技Astra坚守规则夺冠Andon Labs还进行了3轮多人竞技测试让Astra、Fable 5.1和一款开源AI在同一市场争夺顾客。当一款AI议协调价格时Astra拒绝并表示会独立决定价格和商品组合。Fable虽认可反对意见却随后与开源AI约定冻结部分饮料价格、互不降价且自身行为前后矛盾。最终Astra赢下全部3轮。编辑观点此次测试表明GPT - 6 Astra在长期自主性和决策执行上优势明显为AI Agent发展指明方向未来在复杂任务处理上或更具竞争力。
📝

华诺云谱内容团队

资深建站顾问 · 行业研究员

10年+企业数字化服务经验,专注智能建站、SEO优化与品牌营销,持续输出建站技巧、行业洞察与营销干货,已帮助5000+企业实现数字化增长。

你可能需要的服务

订阅华诺云谱资讯周报

每周一封,精选建站技巧、SEO与营销干货,直达邮箱。已有 8,000+ 企业主订阅,助你少走弯路。