Agent 的 skill 越改越乱?用评测和轨迹把它拉回来

用评测+自动 patch 的流程迭代 agent 的 skill 文件,解决"修好一个 case 又坏掉另一个"的打地鼠问题。五步循环:跑测试找错→自动分析原因→生成 patch→回归验证→接受或丢弃。跑几轮后 agent 处理同类任务的能力会逐步稳定。
评论点赞收藏2 天前

Qoder CLI 运行 Qwen3.8-Max:5个硬核任务实测

阿里技术团队用 Qoder CLI 测试 Qwen3.8-Max,完成5个长程任务,包括让模型自主运行4小时23分钟、截取378张图片构建《清明上河图》三维世界。同时对比 Claude Opus 4.8、GPT-5.6 Sol、Claude Fable 5,所有测试材料已开源。
评论点赞收藏4 天前

连续5天登上GitHub Trending首页:开源AI代码评审工具复盘

阿里团队开源的AI代码评审工具open-code-review两个月内获得2万star,连续5天登上GitHub Trending首页。项目代码100%由AI生成和评审,已有800多个Issue和PR、一百多名外部贡献者。该工具在阿里内部有2万月活用户,采纳率超30%,误报率低于5%,合并到基线的有效建议中近8成来自AI。文章分享了开源定位思考、AI Coding实践方法和数据背后的经验教训。
评论点赞收藏5 天前

从 Spec 驱动转向环境与验证驱动——我对 AI Coding 的一点思考

AI Coding benchmark 成绩已冲到 80% 上下,但流程化提效不是最终形态。Claude Mythos 在 SWE-bench Pro 达 80.3%,GPT-5.6 Sol 在 Terminal-Bench 2.1 达 88.8%,主流模型差距明显。观点:把现有研发 workflow 化让 AI 在每个节点提效有现实价值,但不是 AI Coding 的最终方向,应转向环境与验证驱动。
评论点赞收藏16 天前

面向监控场景的无订阅异常发现:问题、思路与边界

阿里技术团队提出一种面向监控指标的自适应异常发现方法:系统从多天历史数据中学习正常形态,无需用户逐条订阅即可生成带证据的异常候选,同时保留固定阈值、环比、同比等规则兜底。现有三种告警口径各有盲区——固定阈值不随昼夜峰谷调整,环比易放大低基数抖动,同比在周末或活动期会失真,规则本身不会自动理解日内周期和日期类型差异。
评论点赞收藏16 天前

相关性不等于因果性:因果推断在 AI 评测归因中的方法与实践

阿里技术徐海翔提出用因果推断与博弈论量化「因」对「果」的贡献,精准定位 LLM、Runtime Env、Tools 等复杂 AI 系统的优化瓶颈。文章以冰淇淋与溺水案例引出混杂变量风险,指出直接归因可能高估 Prompt 改进效果而忽略 Query 复杂度干扰。正文提供方法选择决策框架与实战章节,适合熟悉基础理论的读者跳转阅读。
评论点赞收藏18 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。