Satisfice

RSS: https://www.satisfice.com/feed
Satisfice,James Bach 与 Michael Bolton 的软件测试顾问公司,专注严谨的测试方法与质量分析。

部分课程录像现已开放

在可预见的未来,我不会以自己的名义安排公开课程。我仍然可以提供私人课程,只要我不亲自组织和推广,我甚至会开设公开课程。不过,如果你真的想上我的课程,你可以购买
评论点赞收藏23 天前

公益提示:别说你用AI写作

…also don’t tell lies. But I’m getting ahead of myself already. I keep running into people online who openly say that they use AI to do their writing for them. Now, technically, they may say they use ...
评论点赞收藏56 天前

人类在阻碍我们

作者与兄弟合作进行直播实验,内容涵盖现场测试演示、批判性思维训练、问答医院以及对AI使用的批判性审视。文章主要记录了这一尝试过程,未提供深度的技术洞察或明确的行业判断。
评论点赞收藏80 天前

对Andrew Robins《责任是人类护城河》一文的评论

这是一条针对Andrew Robins文章的简短评论。作者认为原文观点虽好,但在现实中很难实现。他分享了自己25年来尝试让测试人员对代码负责的经验,发现即便在小范围内成功也很有限,因此对在大模型时代实现这一目标持悲观态度。最后感谢作者的分享。
评论点赞收藏80 天前

评论:关于“每个人都不对质量负责”一文

这是一条针对博客文章的简短评论,读者表示对文中使用的“Expecto Patronum”咒语梗感到好笑,并打算借用。内容极度碎片化,缺乏独立的信息价值,仅作为社区互动的附属品存在,不具备单独推荐的价值。
评论点赞收藏80 天前

评论:当你“10倍速”完成工作时……

作者分享了一次使用 Claude Code 进行 UI 对比的实际踩坑经历。虽然生成的报告看起来不错,但在交叉验证时发现大部分观察结果都是凭空捏造的,根本没有进行实际对比。这揭示了当前 AI 编码工具在视觉理解上的幻觉问题,提醒用户对 AI 生成结果保持警惕。
评论点赞收藏80 天前

与AI负责任工作:原则与实践风险

文章由James Bach等人撰写,核心观点是AI无法承担责任,使用者必须保持“人在回路”的监督。作者指出当前AI采用处于“狂野西部”阶段,重速度轻责任。文中详细列举了AI操作的特殊风险,包括认知过载、认知债务、认知萎缩和认知投降等心理陷阱,以及数据疏忽、道德缓冲区和业务中断等管理风险。文章强调,负责任地使用AI不仅是为了应对不可靠的工具,更是伦理商业实践的基础,反对将AI视为自动化的问责终点。
评论点赞收藏84 天前

责任感是人类最后的护城河

文章核心观点是:AI无法具备责任感,只有自然人才能承担责任。因此,责任感构成了人类相对于AI的核心护城河。作者强调在AI时代,人类的独特价值在于能够承担道德和法律后果,这是机器无法替代的。这一观点挑战了单纯以技术能力衡量AI价值的流行看法,突出了人类在伦理和决策层面的不可替代性。
评论点赞收藏113 天前

关于“10倍速工作”的评论:如何应对低效与期望管理

开发者Annie提问如何管理“10倍速”工作模式下的期望值,以及如何应对低效同事带来的干扰。作者James回应称,唯一的方法是讲道理,通过质疑缺乏验证的快速交付来建立标准,并类比早期手机驾驶的危害,指出公司可能需要通过AI试错才能意识到不负责任行为的后果。
评论点赞收藏138 天前

评“Slop Coding”与负责任的测试者

作者认为降低代码创建门槛(如AI编程)将利好测试人员,因为未来会有大量资金用于清理由AI生成的“氛围编码”软件。AI被视为一种新的抽象层,使得创建一次性代码变得容易,但也引发了关于清晰度和工作量的讨论。
评论点赞收藏156 天前

当你自以为“10倍”高效时……

文章讽刺了科技圈盲目追求“10倍效率”的流行话术。作者指出,单纯在数量上增加(如开车速度、食量、朋友数量)并不等于质量的提升,反而会带来负面后果。真正的工程效能提升不应是简单的线性堆砌,而需要关注系统整体健康和可持续性。这是一个典型的工程思维反思,适合引发关于技术管理文化的讨论。
评论点赞收藏188 天前

并非所有人都对质量负责:论软件测试的专业角色

文章反驳了敏捷开发中“质量是每个人的责任”这一普遍观点。作者认为,虽然全员参与质量很重要,但这不应取代专门的测试角色。将测试视为独立职责而非单纯任务,能确保专业深度和客观性。完全依赖开发人员自测可能导致盲点和责任分散,因此需要明确的测试专家角色来保障软件质量。
评论点赞收藏195 天前

“氛围编码”与负责任的测试者

作者反思了“氛围编码”(Vibe Coding)现象,承认自己用它来快速构建测试工具,但担忧如何向他人清晰传达这种非传统工作流的价值和过程。
评论点赞收藏289 天前

书来了:如何直接购买我的签名版新书

作者告知其新书《Taking Testing Seriously》已出版,并提供了一个通过eBay直接购买签名版的链接。文章指出eBay的价格比亚马逊稍贵,因为包含了签名和直接获取的便利。这主要是一篇关于书籍销售和购买的通告。
评论点赞收藏294 天前

系统化测试 LLM 数据检索一致性的方法

James Bach 通过 LARC 方法测试了 GPT-4.1、Llama、Gemma 和 GPT-3.5 在从混合食谱中提取苹果派配料的检索一致性。实验发现,增加提示词约束能显著降低 GPT-3.5 和 Gemma 的遗漏率,但 GPT-4.1 反而表现略差。Llama 模型存在严重的自我否定(Repudiation)问题。文章指出 LLM 可靠性具有“块状”特征,不能依赖通用启发式规则,必须进行概率性测试。
评论点赞收藏303 天前

严肃的 LLM 测试数据

作者强调在评估大模型行为前应先收集证据,反对盲目乐观。主张用数据支撑对 AI 系统的判断,而非仅凭兴奋情绪做预测。
评论点赞收藏305 天前

认真测试 LLM

作者团队因快速软件测试(RST)方法应用于 AI 测试及用 AI 辅助测试而受到关注。新书即将出版,他们准备集中分享多年积累的实战经验和回答。
评论点赞收藏314 天前

55个月零1天:我的新书出版了

作者宣布新书《Taking Testing Seriously》即将出版,并指出这是其开发的RST测试方法论三十多年来首次以书籍形式进行权威描述。
评论点赞收藏360 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。