改变世界前先认识世界:本体论决策结构化实践

大淘宝商家财务团队用 3 个月实践 Agent 工作全托管:不预设 workflow 也不打包 Skill,而是把业务知识建模为四层 Ontology 图谱(业务/系统/交付/治理),把专家判断固化为可执行的 decision_function。 Agent 遵循"先取证、再决策、后行动"闭环,动态生成工作流,覆盖 120+ 项需求开发、工单处理、数据订正任务。核心观点:模型和编排工具会迭代,但结构化业务知识才是决定 Agent 能否稳定产出的关键壁垒;团队采用"每天学一个小决策"的碎片化知识积累模式,让知识库产生复利。
评论点赞收藏12 天前

AI 自迭代的小游戏 Agent:2周上线6款小游戏,3天迭代12款小游戏

大淘宝团队介绍了一套覆盖小游戏全生命周期的自迭代 Agent 系统,用多 Agent 串联选型、策划、美术、音频、开发、关卡生成、发布、AB 实验和数据归因,人只负责定义北极星指标、行动边界并审核关键方案,AI 负责策略、开发和数据驱动。 架构上基于 LangGraph 与 Claude Agent SDK 做上下文流转和决策闭环。实践结果:两周内上线 6 款小游戏,最快 2 天跑完全流程;运营侧 12 款游戏迭代正向率超 95%。 对 Agent 串联提效、AI 工程化落地和互动服务方向有参考价值。
评论点赞收藏17 天前

循环工程:把 Agent 放进工程循环

文章提出 “Loop engineering”:工程师不再逐轮写 prompt,而是设计一个自动化循环——读取状态、判断任务、调用 agent、验证结果、记录并决定是否停止。 拆解六大组件:唤醒机制、隔离并行 worktrees、沉淀知识的 skills、接入外部工具的插件、读写分离的子 agent、持久化记忆层。作者强调它不是全自动甩锅,而是靠明确输入输出、权限分层和成本控制维持可靠;工程师从操作者变成循环设计者与最终责任人,用可控自动化加深对系统的理解。
评论点赞收藏19 天前

让 Agent 可评、可控、可迭代:面向业务效果的评测体系与场景实践

来自大淘宝技术团队的内部实践文章,聚焦策略效果类 Agent 的评测难题:反馈信号稀缺、离线与线上效果脱节、评估维度多。作者提出"五层评测对象 + 四步质量归因 + 三阶段上线治理"的方法论,并介绍 Auto Rubrics 方法——用三层架构构建可解释的业务效果 Judge 体系,规避位置偏差和选择过拟合等系统性陷阱。 整体偏方法论阐述,有具体工程细节(帕累托最优策略、实验桶对照桶、ROI/GMV 对齐),但行文仍是机构技术号的任务式输出,缺少个人踩坑或争议点,信息增量中等,适合关注 Agent 评测落地和电商策略系统的读者。
评论点赞收藏22 天前

Agent 优化之 GEPA:一种提示词自进化优化方案

大淘宝技术团队基于 GEPA(Genetic-Pareto, Reflective Prompt Evolution)算法设计了一套 Prompt 自进化系统,目标是把 LLM Judge / Agent 的提示词调优从人工试错转为数据驱动的自动化闭环。 系统流程为“推理→评分→反思→选择”:让 LLM 自动分析 badcase,把错误归因到 Prompt 的具体规则,生成候选变体,再用帕累托前沿在多目标之间择优,避免单点改动导致指标对抗性退化。 架构与任务无关,支持二分类、多分类、评分等场景,并通过零配置自动推断数据集与参数;优化过程可解释,最终目标是让 Prompt 与人工标注及线上业务效果更好地对齐。 文章目前只展示了背景与系统设计思路,后续应包含算法细节、实验对比与工程落地经验。
评论点赞收藏24 天前

淘天自研 S266 编码器拿下 MSU 世界视频编码大赛 6 项冠军

淘天音视频团队自主研发的 S266 系列编码器在 MSU 2025 FullHD 赛道世界视频编码大赛中累计获得 6 项冠军及 1 项季军。比赛由莫斯科国立大学主办,本届 27 款主流编码器参赛,评测在统一测试视频序列和码率约束下按 1 FPS / 5 FPS / 30 FPS 三档盲测,分别对应离线转码到实时直播场景。 文章主要介绍赛事权威性、评测方法以及淘天 S266 的结果,并附完整比赛结果链接,属于大厂技术团队的一手成绩通稿。
评论点赞收藏26 天前

让 Agent 像人一样记忆:本地长期记忆系统 HL-Mem 的设计与取舍

大淘宝技术开源了 HL-Mem,一套让 Agent 具备本地长期记忆能力的系统,采用 SQLite 单文件部署。系统将记忆分为不可变事件和可更新事实两条通道,支持时间维度的记忆修正与遗忘。 异步 Worker 处理去重、冲突消解和生命周期管理,默认零外部依赖。
评论点赞收藏29 天前

Agent长程任务断点续传:从框架Checkpoint到跨进程恢复的完整实践

大淘宝直播技术团队分享了Agent长程任务中断恢复的工程实践。方案采用框架层Checkpoint加任务调度两层架构,在不改Spring AI Alibaba源码的前提下,通过扩展InterruptableAction和Hook机制实现进程内状态保存恢复,结合MQ摘流和任务表协调跨进程恢复,覆盖人机协作、多Agent协同和系统重启等场景。
评论点赞收藏31 天前

淘宝百亿补贴数据分析助手 Agent 实战

天猫技术团队发布了 bybt-data-analysis-assistant,一个将自然语言转为完整数据分析流程的智能体。系统采用多 Agent 协同架构,通过 NL2MDL2SQL 路径生成 SQL,支持波动归因、血缘溯源、Python 分析等能力,底层结合 WrenAI 语义层和 Hologres 加速查询。
评论点赞收藏36 天前

AI驱动研发体系的实践与思考

大淘宝技术团队从AI辅助编程转向AI驱动研发体系,提出"本地优先:Agent + 文件夹 + Git"理念,将业务知识、源代码、项目规则组织在同一工作空间。 业务AI研发的真正瓶颈是上下文而非模型能力,项目无需完美知识库即可启动,迭代过程本身就是知识飞轮。技术人员未来将更接近FDE角色,需深入理解业务并对端到端交付结果负责。
评论点赞收藏38 天前

信任需要基础设施:如何让AI可靠取数

大淘宝技术直播团队提出AI取数基建方案,用"代号层"统一业务语义消除歧义,配合确定性SQL引擎和Skill机制限制AI自由发挥,解决数仓复杂场景下AI幻觉问题。
评论点赞收藏43 天前

场景营销AI Coding:构建Agent自主执行闭环

大淘宝技术团队发布AI Coding系列第三篇,介绍Specflow Agent和Tarot Pixel两个工具如何协作构建Agent自主执行闭环。Specflow Agent负责分析PRD、设计稿和代码库,将复杂需求整理为Coding Agent可执行的任务;Tarot Pixel将设计稿转化为Coding Agent可查询、截图、比对和修正的视觉上下文。 系统通过结构化Task作为持久化目标锚点,定义Job为最小执行单元并强制要求结构化结果与证据,建立执行账本实现状态外部化,最终达成输入需求即可交付可发布代码的端到端研发闭环。
评论点赞收藏45 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。