用 DSPy 评估并优化 Datasette Agent 的 SQL 提示词

研究:利用 DSPy 评估并优化 Datasette Agent 的 SQL 系统提示

今天早上的一场 AIE 大会演讲中,提到了 dspy。 这让我想起,自己一直想看看它是否能帮助我改进Datasette Agent 所使用的系统提示——于是我在 Claude Code for Web 中,使用 Claude Fable 5 发出了一项异步研究任务:

首先,安装最新版本的 Datasette Alpha 和 datasette-agent,以及 dspy;然后,弄清楚如何利用 dspy 来评估并优化 Datasette Agent 用于执行只读 SQL 查询、以回答用户关于数据问题的功能所使用的主系统提示。

Fable 选择使用 GPT 4.1 mini 和 nano 进行测试,并发现了若干颇具潜力的改进方向。我尤其喜欢其中这一条:

模式列表仅列出了表名;“如果已经掌握了相关信息,则不要调用 describe_table”这一建议导致了列名猜测(例如 page_count、o.order_id、first_name),并在基准测试的跟踪记录中形成了错误重试循环。 要么在提示的模式列表中包含列名,要么对这一建议加以缓和。

标签:ai, datasette, generative-ai, llms, evals, dspy, datasette-agent, claude-mythos

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论