Eugene Yan

RSS: https://eugeneyan.com/rss/
Eugene Yan 的博客,关于推荐系统、LLM 与 AI 系统设计的实践。

原型开发如何帮你获得团队支持

数据科学家Eugene Yan分享通过构建原型(Prototype)而非仅靠文档来说服利益相关者的实战经验。文章指出原型能降低理解门槛、验证技术可行性并促进反馈,但也强调需配合“一页纸”说明项目价值。作者以计算机视觉项目为例,讲述从被拒到通过Demo获得资源支持的过程,并分享了使用FastAPI、Streamlit等工具快速搭建原型的技巧及踩坑教训。
评论点赞收藏20 天前

构建网络安全评估体系的模式

探讨构建网络安全评估体系的模式,包括沙箱目标、影响任务难度的输入、工具以及评分器设计。 为评估 AI 模型在网络安全领域的表现提供了具体的工程实践框架和组件拆解。
评论点赞收藏56 天前

利用大模型保障源代码安全

介绍如何利用大语言模型辅助源代码安全,涵盖构建威胁模型、发现漏洞、验证、分类和修补等步骤。 针对 LLM 在代码安全领域的具体应用流程进行了梳理,适合关注 AI 安全工程的开发者参考。
评论点赞收藏81 天前

如何与AI协作并实现能力复利

作者分享了与AI协作的系统化工作流,包括将上下文作为基础设施、将个人偏好配置化、建立验证闭环以实现自主性、通过委托扩大工作规模,以及通过复盘不断迭代配置。文章提供了具体的工程实践,如使用、Skills机制和并行会话管理,旨在让AI协作产生复利效应。
评论点赞收藏90 天前

那些有效与无效的LLM特定任务评估

作者分享在分类、摘要、翻译等任务中实用的LLM评估方法,指出通用评估往往无效,推荐使用NLI模型评估事实一致性、奖励模型评估相关性,并强调人工评估和阈值校准的重要性。
评论点赞收藏107 天前

2025 年度回顾

作者回顾 2025 年在健康、职业、旅行和反思方面的个人进展与经历。
评论点赞收藏245 天前

产品评估的三步法

介绍如何通过标注数据、对齐LLM评估器和运行评估框架来简化产品评估流程。
评论点赞收藏266 天前

主流 Python 库中被忽视的高级用法与设计细节

作者通过分析 Requests、Scikit-learn、PyTorch 等主流库源码,总结了 Python 中几个容易被忽视的高级用法和设计模式,包括在基类中使用 super 实现协作式多重继承、Mixin 的最佳实践、相对导入的重要性、 的封装作用以及 的隐式路径配置技巧。文章还探讨了各大库的设计哲学,如一致性、组合优先和性能与易用性的权衡。
评论点赞收藏408 天前

长上下文问答系统评估指南:从指标定义到LLM-as-Judge实践

本文深入探讨了长文档问答系统(Long-Context Q&A)的评估方法论。作者Eugene Yan详细拆解了评估的核心维度:忠实度(Faithfulness)与有用性(Helpfulness),并指出了传统指标(如BLEU/ROUGE)在开放域问答中的局限性。文章重点介绍了如何构建高质量的评估数据集,包括利用LLM辅助生成多样化问题(事实、推理、无信息等),以及如何通过人工标注校准LLM-as-Judge评估器。此外,还详细阐述了基于原子声明(Atomic Claims)的细粒度忠实度评估方法,旨在解决长上下文中的幻觉和检索失败问题。这是一篇面向AI工程师和PM的实战指南,提供了从理论框架到落地执行的具体建议。
评论点赞收藏415 天前

利用 MCP、Q 和 tmux 构建每日新闻的智能体工作流

作者分享利用 Amazon Q CLI 和 MCP 协议构建多智能体工作流的实战经验,通过 tmux 协调主从 Agent 自动抓取并总结 Hacker News 等六大信源,生成每日新闻简报。文章提供了完整的架构设计、代码实现及 GitHub 仓库链接,适合对 Agentic Workflow 和 MCP 落地感兴趣的开发者参考。
评论点赞收藏456 天前

LLM 裁判救不了产品,修复你的流程才行

文章指出LLM-as-Judge等自动化工具无法替代产品评估的核心,强调应将评估视为科学实验过程。作者提出“评估驱动开发(EDD)”理念,主张通过观察、假设、实验和数据分析的迭代循环来改进AI产品,并强调即使使用自动化评估器,仍需人工监督和高质量标注来维持反馈闭环。
评论点赞收藏469 天前

写作FAQ:我是如何开始、为何写作以及为谁写作

数据科学家Eugene Yan分享其写作心法:从早期被导师建议提升沟通能力开始,通过写作强化学习、分享知识并建立个人品牌。文章涵盖选题策略、克服完美主义、平衡工作与写作等实用建议,强调写作对技术人员的职业价值。
评论点赞收藏498 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。