Satisfice

RSS: https://www.satisfice.com/feed
Satisfice,James Bach 与 Michael Bolton 的软件测试顾问公司,专注严谨的测试方法与质量分析。

负责任的质量工程

作者提出"负责任的质量工程"(RQE)概念,强调质量工程不等于测试,而测试人员通常并不在做质量工程——真正做质量工程的是开发者,测试人员通过分析产品质量并向开发者提供反馈来支持这一过程。 文章篇幅较短,核心观点是对"质量工程"与"测试"角色边界的重新划定,属于软件工程职责分工的讨论。
评论点赞收藏7 天前

适合我的完美工作

Satisfice 讨论大型公司在保持对 AI 控制权、避免法律与技术灾难的前提下最大化利用 AI 的"理想岗位"设想。作者认为无论 AI 继续进步还是停滞、AI 泡沫何时破裂,每家大企业都需要一个能自我运营、有效竞争且规避风险的角色,并据此论证这种"完美岗位"的构成与价值。
评论点赞收藏7 天前

KPI这件事,可能让你意外

做实际产品的人不在乎KPI。作者在软件行业几十年,从未见过KPI帮一线工程师做过任何有价值的事。最近一次流程改进会议,KPI被提及零次,大家讨论的都是问题和解决方案。 有客户问软件测试该用什么KPI,答案是:没有,别把组织简化成管理简单指标的游戏。管理公司应该倾听、观察工作、建立诚实开放的环境。
评论点赞收藏37 天前

部分课程录像现已开放

<p>在可预见的未来,我不会以自己的名义安排公开课程。我仍然可以提供私人课程,只要我不亲自组织和推广,我甚至会开设公开课程。不过,如果你真的想上我的课程,你可以购买</p>
评论点赞收藏68 天前

公益提示:别说你用AI写作

…also don’t tell lies. But I’m getting ahead of myself already. I keep running into people online who openly say that they use AI to do their writing for them. Now, technically, they may say they use ...
评论点赞收藏101 天前

人类在阻碍我们

作者与兄弟合作进行直播实验,内容涵盖现场测试演示、批判性思维训练、问答医院以及对AI使用的批判性审视。文章主要记录了这一尝试过程,未提供深度的技术洞察或明确的行业判断。
评论点赞收藏125 天前

对Andrew Robins《责任是人类护城河》一文的评论

这是一条针对Andrew Robins文章的简短评论。作者认为原文观点虽好,但在现实中很难实现。他分享了自己25年来尝试让测试人员对代码负责的经验,发现即便在小范围内成功也很有限,因此对在大模型时代实现这一目标持悲观态度。 最后感谢作者的分享。
评论点赞收藏125 天前

评论:关于“每个人都不对质量负责”一文

这是一条针对博客文章的简短评论,读者表示对文中使用的“Expecto Patronum”咒语梗感到好笑,并打算借用。内容极度碎片化,缺乏独立的信息价值,仅作为社区互动的附属品存在,不具备单独推荐的价值。
评论点赞收藏125 天前

评论:当你“10倍速”完成工作时……

作者分享了一次使用 Claude Code 进行 UI 对比的实际踩坑经历。虽然生成的报告看起来不错,但在交叉验证时发现大部分观察结果都是凭空捏造的,根本没有进行实际对比。 这揭示了当前 AI 编码工具在视觉理解上的幻觉问题,提醒用户对 AI 生成结果保持警惕。
评论点赞收藏126 天前

与AI负责任工作:原则与实践风险

文章由James Bach等人撰写,核心观点是AI无法承担责任,使用者必须保持“人在回路”的监督。作者指出当前AI采用处于“狂野西部”阶段,重速度轻责任。 文中详细列举了AI操作的特殊风险,包括认知过载、认知债务、认知萎缩和认知投降等心理陷阱,以及数据疏忽、道德缓冲区和业务中断等管理风险。 文章强调,负责任地使用AI不仅是为了应对不可靠的工具,更是伦理商业实践的基础,反对将AI视为自动化的问责终点。
评论点赞收藏129 天前

责任感是人类最后的护城河

文章核心观点是:AI无法具备责任感,只有自然人才能承担责任。因此,责任感构成了人类相对于AI的核心护城河。作者强调在AI时代,人类的独特价值在于能够承担道德和法律后果,这是机器无法替代的。 这一观点挑战了单纯以技术能力衡量AI价值的流行看法,突出了人类在伦理和决策层面的不可替代性。
评论点赞收藏158 天前

关于“10倍速工作”的评论:如何应对低效与期望管理

开发者Annie提问如何管理“10倍速”工作模式下的期望值,以及如何应对低效同事带来的干扰。作者James回应称,唯一的方法是讲道理,通过质疑缺乏验证的快速交付来建立标准,并类比早期手机驾驶的危害,指出公司可能需要通过AI试错才能意识到不负责任行为的后果。
评论点赞收藏183 天前

评“Slop Coding”与负责任的测试者

作者认为降低代码创建门槛(如AI编程)将利好测试人员,因为未来会有大量资金用于清理由AI生成的“氛围编码”软件。AI被视为一种新的抽象层,使得创建一次性代码变得容易,但也引发了关于清晰度和工作量的讨论。
评论点赞收藏201 天前

当你自以为“10倍”高效时……

文章讽刺了科技圈盲目追求“10倍效率”的流行话术。作者指出,单纯在数量上增加(如开车速度、食量、朋友数量)并不等于质量的提升,反而会带来负面后果。 真正的工程效能提升不应是简单的线性堆砌,而需要关注系统整体健康和可持续性。这是一个典型的工程思维反思,适合引发关于技术管理文化的讨论。
评论点赞收藏234 天前

并非所有人都对质量负责:论软件测试的专业角色

文章反驳了敏捷开发中“质量是每个人的责任”这一普遍观点。作者认为,虽然全员参与质量很重要,但这不应取代专门的测试角色。将测试视为独立职责而非单纯任务,能确保专业深度和客观性。 完全依赖开发人员自测可能导致盲点和责任分散,因此需要明确的测试专家角色来保障软件质量。
评论点赞收藏241 天前

“氛围编码”与负责任的测试者

作者反思了“氛围编码”(Vibe Coding)现象,承认自己用它来快速构建测试工具,但担忧如何向他人清晰传达这种非传统工作流的价值和过程。
评论点赞收藏334 天前

书来了:如何直接购买我的签名版新书

作者告知其新书《Taking Testing Seriously》已出版,并提供了一个通过eBay直接购买签名版的链接。文章指出eBay的价格比亚马逊稍贵,因为包含了签名和直接获取的便利。 这主要是一篇关于书籍销售和购买的通告。
评论点赞收藏339 天前

系统化测试 LLM 数据检索一致性的方法

James Bach 通过 LARC 方法测试了 GPT-4.1、Llama、Gemma 和 GPT-3.5 在从混合食谱中提取苹果派配料的检索一致性。实验发现,增加提示词约束能显著降低 GPT-3.5 和 Gemma 的遗漏率,但 GPT-4.1 反而表现略差。 Llama 模型存在严重的自我否定(Repudiation)问题。文章指出 LLM 可靠性具有“块状”特征,不能依赖通用启发式规则,必须进行概率性测试。
评论点赞收藏349 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。