当AI agent说"完成"时,你怎么知道它真的完成了?
我正在测试一个名为 agentuptime 的早期概念。目前还没有产品或 SDK。这个想法源于我在使用代理时一直感到困扰的一个问题:代理说“已完成”,并不意味着相关操作真的已经发生。
工具可能返回成功,链路追踪看起来一切正常,但外部系统却仍然处于错误的状态。因此,我正在尝试一种小型的“收据”机制:代理的声明与独立验证的结果相分离。
比如:数据库写入 → 记录是否真的能被读取回来?API 调用 → 对方系统是否已呈现预期状态?代理交接 → 另一个代理是否确实收到了该任务?
我试图弄清楚,这种需求是否值得单独构建一层,或者仅靠链路追踪加上自定义检查就能很好地解决。如果你也在运行带有实际副作用的代理,那么哪种操作最难验证呢?
agentuptime.dev
评论
?
参与讨论