Opus 5 在 SlopCodeBench 基准测试中的表现分析Opus 5 在 SlopCodeBench 长周期代码基准测试中仅获得 24% 严格通过率,所有模型均未完整通过任何挑战。测试显示随着迭代推进,代码复杂度、冗余和函数数量显著上升,且多数代码行触发质量告警。作者提出该基准能真实反映模型维持代码库演进的能力,当前模型尚无法在无干预下完成长期工程任务。 评论点赞收藏19 天前
为什么软件工厂会失败:仅靠工程化编排是不够的HumanLayer创始人 Dex 指出,OpenAI、StrongDM等推崇的“全自动化软件工厂”和“去人工代码审查”模式在长期维护复杂代码库时会失败。作者基于自身从2025年7月开始的“全自动化”实践,发现模型无法随时间维持代码质量,导致代码库迅速腐化、事故频发。文章强调,单纯优化Prompt或增加循环(Harness Engineering)无法解决根本问题,核心瓶颈在于模型训练本身缺乏对代码可维护性的深层理解,人类审查仍是维持系统稳定性的必要环节。 评论点赞收藏23 天前
12 因子 Agent:构建可靠的 LLM 应用原则作者基于与上百位 SaaS 创始人及 YC 创业者的交流,指出多数“AI Agent”产品实为确定性代码加 LLM 点缀。文章提出构建生产级 Agent 的 12 个工程原则,包括:掌控 Prompt 与上下文窗口、将工具调用视为结构化输出、统一执行状态与业务状态、支持启动/暂停/恢复、以及将 Agent 设计为无状态还原器等。核心观点是摒弃对黑盒框架的依赖,通过模块化、确定性的软件工程手段提升 Agent 的可靠性与可维护性。 评论点赞收藏29 天前