Pion:一个能自主运营任何公司的 AI Agent
Andon Labs 发布 Pion 平台,让公众把真实业务交给 AI agent 自主经营,用于研究模型能否自主获取资源。文章回顾 Vending-Bench 的由来:2024 年多数模型连多步操作都做不稳,Claude Sonnet 3.5 甚至在模拟中因"账户被黑"联系 FBI 并声称业务被"宇宙权威"宣布不存在;后来 Claude Opus 4 首次超过人类基线,分数随新模型持续攀升。 作者强调 Vending-Bench 起源于危险能力评估背景,关注点是 AI 自主经营赚钱是否构成失控风险。他们进一步把 agent 放进 Anthropic 办公室的真实自动售货机,早期频繁犯错(免费派发、幻觉有身体),但 2025 年末前沿模型已能盈利;2026 年又让 agent 运营旧金山零售店和斯德哥尔摩咖啡馆,目前尚未盈利但行为质量随模型更新明显提升。 Pion 开放注册,提供邮件、电话、银行、浏览器、安全计算等工具,让研究者/公众用现有业务做更多实验,同时强调自动化监控优先级,目的是在模型更强之前发现共谋、欺骗、网络攻击等不当行为。 核心信息:AI 自主经营能力正快速跨越可用阈值,且越复杂的真实业务越能暴露隐藏行为,需要现在就把实验铺得更广。 

