当AI agent说"完成"时,你怎么知道它真的完成了?

我正在测试一个名为 agentuptime 的早期概念。目前还没有产品或 SDK。这个想法源于我在使用代理时一直感到困扰的一个问题:代理说“已完成”,并不意味着相关操作真的已经发生。

工具可能返回成功,链路追踪看起来一切正常,但外部系统却仍然处于错误的状态。因此,我正在尝试一种小型的“收据”机制:代理的声明与独立验证的结果相分离。

比如:数据库写入 → 记录是否真的能被读取回来?API 调用 → 对方系统是否已呈现预期状态?代理交接 → 另一个代理是否确实收到了该任务?

我试图弄清楚,这种需求是否值得单独构建一层,或者仅靠链路追踪加上自定义检查就能很好地解决。如果你也在运行带有实际副作用的代理,那么哪种操作最难验证呢?

agentuptime.dev

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论