Hamel Husain Blog

RSS: https://hamel.dev/index.xml
Hamel Husain 的 AI 工程笔记,关于应用 AI、机器学习与数据科学的实践。

“难以评估”是产品设计缺陷的信号

AI评估难往往不是技术问题,而是产品设计缺陷。作者通过数据代理、教案生成和医疗报告三个案例指出,若产品未提供可验证的中间过程(如代码、溯源链接、差异对比),用户无法信任且评估缺乏信号。设计应优先支持“渐进式披露”和“可核查工件”,这能同时提升用户体验与自动化评估效率。
评论点赞收藏42 天前

数据科学家的复仇

作者反驳数据科学家职业过时的观点,指出LLM时代的核心工作并未消失,而是转化为实验设计、指标构建和数据验证。文章通过五个常见评估陷阱(如通用指标、未验证的LLM裁判、糟糕的实验设计等),强调数据科学家在探索性分析、模型评估和生产监控中的不可替代性,主张回归数据本质。
评论点赞收藏140 天前

面向编程Agent的评估技能库:基于50+企业实战经验的工程实践

作者发布了一套用于AI产品评估的Coding Agent技能库。基于服务50多家公司的经验,文章指出仅靠MCP服务器接入评估平台不够,Agent还需要知道如何处理评估结果。文章介绍了eval-audit等具体技能,用于解决幻觉分类、合成数据生成、LLM-as-Judge校准等实际工程痛点,强调评估基础设施比模型本身更重要。
评论点赞收藏165 天前

我为何弃用 nbdev:AI 时代下的工具权衡与反思

nbdev 核心维护者 Hamel Husain 撰文分享弃用 nbdev 的心路历程。他指出 AI 编程工具改变了技术权衡:nbdev 的 literate programming 工作流与主流 AI 训练数据冲突,导致协作效率降低。作者认为文档质量取决于人而非工具,且 AI 能更好地处理分离的文档。目前他转向 Cursor、Amp 等更通用的工具,并指出 TypeScript 等强类型语言因 AI 生成代码更可靠而崛起。文章强调在 AI 时代,遵循主流生态和降低协作摩擦比追求极客式的独特工具更重要。
评论点赞收藏210 天前

LLM 评估全指南:从错误分析到工程落地

本文是一份关于大语言模型评估(LLM Evals)的深度FAQ,基于作者培训700多名工程师和PM的经验。文章强调以错误分析(Error Analysis)为核心,反对盲目使用通用指标或外包标注。主要观点包括:推荐二元(Pass/Fail)评估而非Likert量表;主张在发现实际错误后再编写评估器,而非评估驱动开发;建议构建自定义标注工具而非依赖现成平台;详细讲解了合成数据生成、RAG评估、Agent工作流调试及CI/CD中的评估应用。内容极具工程实战价值,适合AI产品经理和工程师。
评论点赞收藏213 天前

AI模型评估(Evals)核心知识点闪卡

作者Hamel Husain整理的AI评估(Evals)系列知识闪卡,涵盖错误分析、何时编写评估、避免通用指标、LLM作为裁判的信任问题、合成数据及部署评估等核心概念,旨在辅助其Maven课程的学习。
评论点赞收藏253 天前

如何选择正确的AI评估工具

作者通过组织LangSmith、Braintrust和Arize Phoenix三家主流评估工具的实战对比,从工作流体验、人工介入支持、透明度控制及生态集成四个维度进行了深入评估。文章提供了具体的优缺点分析和工程视角的建议,帮助技术团队根据实际技术栈和团队成熟度选择合适的AI评估工具。
评论点赞收藏319 天前

别再喊 RAG 已死

Hamel Husain 指出 RAG 并未死亡,未来的关键在于改进检索质量而非单纯扩大上下文窗口。
评论点赞收藏401 天前

快速提升AI产品的实战指南

作者基于30多家公司的咨询经验,指出AI团队常陷入“工具优先”误区。文章提出六大核心原则:1. 重视错误分析而非通用指标;2. 构建自定义数据查看器以降低分析摩擦;3. 赋能领域专家直接编写提示词;4. 利用合成数据在零用户阶段启动评估;5. 通过二元判断和详细批评维持评估系统的信任;6. 以实验而非功能来规划AI路线图。文章强调测量、迭代和学习是AI产品成功的关键。
评论点赞收藏510 天前

LLM数据策展:工具评测与自建建议

作者基于构建LLM微调数据的经验,对比了Prodigy、Argilla等商业工具与Gradio、Streamlit等通用框架,最终推荐Shiny for Python。文章强调手动检查数据和自建工具对理解问题和避免厂商限制的重要性,提供了具体的工程实践建议。
评论点赞收藏611 天前

通过技术写作建立受众:策略与误区

作者结合个人在AI领域的写作与咨询经验,总结了通过技术写作建立受众的六大策略:基于他人作品深度互动、保持高频持续输出、刻意练习文案写作(如降低阅读门槛)、利用语音转文字和AI构建内容流水线、挖掘独特视角解决行业痛点,以及优化社媒展示与分发。文章强调真实性、一致性和系统化工作流的重要性,并提供了具体工具和案例。
评论点赞收藏624 天前

使用LLM作为裁判进行评估:完整指南

作者基于帮助30多家公司的实战经验,提出构建LLM评估器的“批判性影子”流程。核心观点是反对复杂的量化打分,主张由领域专家进行二元通过/失败判断并撰写详细评语,以此训练LLM评估器。文章提供了从数据构建、专家介入到迭代优化的完整步骤和案例。
评论点赞收藏656 天前

Starlette应用的并发处理指南(以FastAPI/FastHTML为例)

本文详细探讨了在基于Starlette框架(如FastAPI、FastHTML)的应用中处理并发任务的多种方案。作者通过代码示例对比了使用SQL数据库作为队列、线程池、异步处理(Asyncio)以及进程等多种并发模型,并特别针对调用LLM API时的非阻塞需求进行了性能测试和最佳实践分享,包括如何限制并发任务数量以及在FastHTML中实现后台异步任务。
评论点赞收藏673 天前

Dokku:我最喜欢的个人Serverless平台

作者分享使用Dokku在廉价VPS上搭建类Heroku私有PaaS平台的实战经验,涵盖Docker应用部署、静态站点托管及GitHub Actions自动化流程,强调低成本与易用性。
评论点赞收藏719 天前

由从业者主导的 LLM 公开课程

Hamel Husain 发布了一个由25多位行业专家主导的免费 LLM 公开课程,涵盖评估、RAG、微调等实战主题。内容源自其付费课程,面向有经验的工程师和数据科学家,提供超过40小时的讲座、笔记和资源,旨在帮助构建 AI 产品。
评论点赞收藏748 天前

利用对抗验证调试AI模型

介绍使用对抗验证检测AI模型数据漂移的实用方法。通过构建二分类器区分训练数据与生产/评估数据,若分类器AUC显著高于随机水平,则表明存在数据漂移。作者提供了开源工具ft_drift及具体代码示例,帮助工程师快速定位因提示词或数据格式变更导致的模型行为异常。
评论点赞收藏856 天前

你的AI产品需要评估体系

作者基于构建CodeSearchNet及咨询经验,指出AI产品失败多因缺乏评估体系。文章通过Rechat案例,详细拆解了LLM评估的三级体系:Level 1单元测试(快速断言)、Level 2人机评估(Trace分析与模型对齐)、Level 3 A/B测试。强调评估系统能解锁微调数据合成与高效调试,是构建AI产品迭代飞轮的核心。
评论点赞收藏870 天前

微调还有价值吗?实战案例与误区解析

作者Hamell Husain结合Honeycomb和ReChat等实际案例,反驳了微调已无价值的观点。文章指出微调在掌握特定领域语法、风格和规则方面优于RAG,并强调建立评估系统是微调的前提。
评论点赞收藏872 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。