如何系统评测 Agent Skills:从触发用例到自动化评分的完整指南

改了一版 Skill,究竟是真变好了,还是只在几次试跑中看起来更顺?这份 OpenAI 实操指南用六个步骤搭出完整评测闭环:定义成功、人工试跑、设计正反用例、检查 JSONL 轨迹,再用结构化 rubric 审查质量。文中保留全部代码,并提供可直接生成测试 Prompt 与检查清单的交互工具。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论