Satisfice
Satisfice,James Bach 与 Michael Bolton 的软件测试顾问公司,专注严谨的测试方法与质量分析。
KPI这件事,可能让你意外
做实际产品的人不在乎KPI。作者在软件行业几十年,从未见过KPI帮一线工程师做过任何有价值的事。最近一次流程改进会议,KPI被提及零次,大家讨论的都是问题和解决方案。 有客户问软件测试该用什么KPI,答案是:没有,别把组织简化成管理简单指标的游戏。管理公司应该倾听、观察工作、建立诚实开放的环境。
部分课程录像现已开放
<p>在可预见的未来,我不会以自己的名义安排公开课程。我仍然可以提供私人课程,只要我不亲自组织和推广,我甚至会开设公开课程。不过,如果你真的想上我的课程,你可以购买</p>
公益提示:别说你用AI写作
…also don’t tell lies. But I’m getting ahead of myself already. I keep running into people online who openly say that they use AI to do their writing for them. Now, technically, they may say they use ...
对Andrew Robins《责任是人类护城河》一文的评论
这是一条针对Andrew Robins文章的简短评论。作者认为原文观点虽好,但在现实中很难实现。他分享了自己25年来尝试让测试人员对代码负责的经验,发现即便在小范围内成功也很有限,因此对在大模型时代实现这一目标持悲观态度。 最后感谢作者的分享。
评论:关于“每个人都不对质量负责”一文
这是一条针对博客文章的简短评论,读者表示对文中使用的“Expecto Patronum”咒语梗感到好笑,并打算借用。内容极度碎片化,缺乏独立的信息价值,仅作为社区互动的附属品存在,不具备单独推荐的价值。
评论:当你“10倍速”完成工作时……
作者分享了一次使用 Claude Code 进行 UI 对比的实际踩坑经历。虽然生成的报告看起来不错,但在交叉验证时发现大部分观察结果都是凭空捏造的,根本没有进行实际对比。 这揭示了当前 AI 编码工具在视觉理解上的幻觉问题,提醒用户对 AI 生成结果保持警惕。
与AI负责任工作:原则与实践风险
文章由James Bach等人撰写,核心观点是AI无法承担责任,使用者必须保持“人在回路”的监督。作者指出当前AI采用处于“狂野西部”阶段,重速度轻责任。 文中详细列举了AI操作的特殊风险,包括认知过载、认知债务、认知萎缩和认知投降等心理陷阱,以及数据疏忽、道德缓冲区和业务中断等管理风险。 文章强调,负责任地使用AI不仅是为了应对不可靠的工具,更是伦理商业实践的基础,反对将AI视为自动化的问责终点。
Comment on Responsibility is the Human Moat by lee davies
Thanks for sharing this James, Jon, and Michael. It seems a lot of thought has gone into the subject and it will help many of us.
Comment on Responsibility is the Human Moat by Jeremie Grant
Amazing explanation. the step-by-step details were very helpful. Looking forward to your next post.
关于“测试跳跃者”的评论:敏捷测试的一种愿景
评论者认为AI时代更需要“测试跳跃者”角色,反对全员转向构建者导致测试技能贬值。
责任感是人类最后的护城河
文章核心观点是:AI无法具备责任感,只有自然人才能承担责任。因此,责任感构成了人类相对于AI的核心护城河。作者强调在AI时代,人类的独特价值在于能够承担道德和法律后果,这是机器无法替代的。 这一观点挑战了单纯以技术能力衡量AI价值的流行看法,突出了人类在伦理和决策层面的不可替代性。
Comment on So, You “10x’d” Your Work… by Michael Bolton
A recent related blog post from Dan Davies, author of /The Unaccountability Machine/.
关于“10倍速工作”的评论:如何应对低效与期望管理
开发者Annie提问如何管理“10倍速”工作模式下的期望值,以及如何应对低效同事带来的干扰。作者James回应称,唯一的方法是讲道理,通过质疑缺乏验证的快速交付来建立标准,并类比早期手机驾驶的危害,指出公司可能需要通过AI试错才能意识到不负责任行为的后果。
评“Slop Coding”与负责任的测试者
作者认为降低代码创建门槛(如AI编程)将利好测试人员,因为未来会有大量资金用于清理由AI生成的“氛围编码”软件。AI被视为一种新的抽象层,使得创建一次性代码变得容易,但也引发了关于清晰度和工作量的讨论。
当你自以为“10倍”高效时……
文章讽刺了科技圈盲目追求“10倍效率”的流行话术。作者指出,单纯在数量上增加(如开车速度、食量、朋友数量)并不等于质量的提升,反而会带来负面后果。 真正的工程效能提升不应是简单的线性堆砌,而需要关注系统整体健康和可持续性。这是一个典型的工程思维反思,适合引发关于技术管理文化的讨论。
并非所有人都对质量负责:论软件测试的专业角色
文章反驳了敏捷开发中“质量是每个人的责任”这一普遍观点。作者认为,虽然全员参与质量很重要,但这不应取代专门的测试角色。将测试视为独立职责而非单纯任务,能确保专业深度和客观性。 完全依赖开发人员自测可能导致盲点和责任分散,因此需要明确的测试专家角色来保障软件质量。
“氛围编码”与负责任的测试者
作者反思了“氛围编码”(Vibe Coding)现象,承认自己用它来快速构建测试工具,但担忧如何向他人清晰传达这种非传统工作流的价值和过程。
书来了:如何直接购买我的签名版新书
作者告知其新书《Taking Testing Seriously》已出版,并提供了一个通过eBay直接购买签名版的链接。文章指出eBay的价格比亚马逊稍贵,因为包含了签名和直接获取的便利。 这主要是一篇关于书籍销售和购买的通告。
系统化测试 LLM 数据检索一致性的方法
James Bach 通过 LARC 方法测试了 GPT-4.1、Llama、Gemma 和 GPT-3.5 在从混合食谱中提取苹果派配料的检索一致性。实验发现,增加提示词约束能显著降低 GPT-3.5 和 Gemma 的遗漏率,但 GPT-4.1 反而表现略差。 Llama 模型存在严重的自我否定(Repudiation)问题。文章指出 LLM 可靠性具有“块状”特征,不能依赖通用启发式规则,必须进行概率性测试。