原型开发如何帮你获得团队支持数据科学家Eugene Yan分享通过构建原型(Prototype)而非仅靠文档来说服利益相关者的实战经验。文章指出原型能降低理解门槛、验证技术可行性并促进反馈,但也强调需配合“一页纸”说明项目价值。作者以计算机视觉项目为例,讲述从被拒到通过Demo获得资源支持的过程,并分享了使用FastAPI、Streamlit等工具快速搭建原型的技巧及踩坑教训。 评论点赞收藏20 天前
构建网络安全评估体系的模式探讨构建网络安全评估体系的模式,包括沙箱目标、影响任务难度的输入、工具以及评分器设计。 为评估 AI 模型在网络安全领域的表现提供了具体的工程实践框架和组件拆解。 评论点赞收藏56 天前
利用大模型保障源代码安全介绍如何利用大语言模型辅助源代码安全,涵盖构建威胁模型、发现漏洞、验证、分类和修补等步骤。 针对 LLM 在代码安全领域的具体应用流程进行了梳理,适合关注 AI 安全工程的开发者参考。 评论点赞收藏81 天前
如何与AI协作并实现能力复利作者分享了与AI协作的系统化工作流,包括将上下文作为基础设施、将个人偏好配置化、建立验证闭环以实现自主性、通过委托扩大工作规模,以及通过复盘不断迭代配置。文章提供了具体的工程实践,如使用、Skills机制和并行会话管理,旨在让AI协作产生复利效应。 评论点赞收藏90 天前
那些有效与无效的LLM特定任务评估作者分享在分类、摘要、翻译等任务中实用的LLM评估方法,指出通用评估往往无效,推荐使用NLI模型评估事实一致性、奖励模型评估相关性,并强调人工评估和阈值校准的重要性。 评论点赞收藏107 天前
Evaluating the Effectiveness of LLM-Evaluators (a.k.a. LLM-as-Judge)Use cases, techniques, alignment, finetuning, and critiques against LLM-evaluators. 评论点赞收藏265 天前
如何利用语义ID训练支持可控推荐的LLM与推荐系统混合模型作者通过实验将语义ID引入LLM,训练出能理解商品并支持自然语言交互推荐的混合模型。文章详细展示了从数据清洗、RQ-VAE编码到模型微调的全过程,探讨了LLM在推荐系统中的可解释性和可控性优势。 评论点赞收藏329 天前
主流 Python 库中被忽视的高级用法与设计细节作者通过分析 Requests、Scikit-learn、PyTorch 等主流库源码,总结了 Python 中几个容易被忽视的高级用法和设计模式,包括在基类中使用 super 实现协作式多重继承、Mixin 的最佳实践、相对导入的重要性、 的封装作用以及 的隐式路径配置技巧。文章还探讨了各大库的设计哲学,如一致性、组合优先和性能与易用性的权衡。 评论点赞收藏408 天前
长上下文问答系统评估指南:从指标定义到LLM-as-Judge实践本文深入探讨了长文档问答系统(Long-Context Q&A)的评估方法论。作者Eugene Yan详细拆解了评估的核心维度:忠实度(Faithfulness)与有用性(Helpfulness),并指出了传统指标(如BLEU/ROUGE)在开放域问答中的局限性。文章重点介绍了如何构建高质量的评估数据集,包括利用LLM辅助生成多样化问题(事实、推理、无信息等),以及如何通过人工标注校准LLM-as-Judge评估器。此外,还详细阐述了基于原子声明(Atomic Claims)的细粒度忠实度评估方法,旨在解决长上下文中的幻觉和检索失败问题。这是一篇面向AI工程师和PM的实战指南,提供了从理论框架到落地执行的具体建议。 评论点赞收藏415 天前
AI Engineer 2025:用LLM技术改进推荐系统与搜索Eugene Yan在AI Engineer 2025演讲中分享推荐系统与搜索如何借助语义ID、数据增强和统一基础模型与LLM融合。 评论点赞收藏438 天前
利用 MCP、Q 和 tmux 构建每日新闻的智能体工作流作者分享利用 Amazon Q CLI 和 MCP 协议构建多智能体工作流的实战经验,通过 tmux 协调主从 Agent 自动抓取并总结 Hacker News 等六大信源,生成每日新闻简报。文章提供了完整的架构设计、代码实现及 GitHub 仓库链接,适合对 Agentic Workflow 和 MCP 落地感兴趣的开发者参考。 评论点赞收藏456 天前
利用 MCP、Q 和 tmux 构建每日新闻回顾的新闻智能体分享使用 Amazon Q CLI、Anthropic MCP 和 tmux 自动化简单智能体工作流的学习与实践过程。 评论点赞收藏469 天前
LLM 裁判救不了产品,修复你的流程才行文章指出LLM-as-Judge等自动化工具无法替代产品评估的核心,强调应将评估视为科学实验过程。作者提出“评估驱动开发(EDD)”理念,主张通过观察、假设、实验和数据分析的迭代循环来改进AI产品,并强调即使使用自动化评估器,仍需人工监督和高质量标注来维持反馈闭环。 评论点赞收藏469 天前
LLM 作为裁判救不了产品——修复你的流程才是关键主张通过科学方法、评估驱动开发(Eval-Driven Development)和监控 AI 输出来优化产品流程,而非单纯依赖 LLM 裁判。 评论点赞收藏483 天前
写作FAQ:我是如何开始、为何写作以及为谁写作数据科学家Eugene Yan分享其写作心法:从早期被导师建议提升沟通能力开始,通过写作强化学习、分享知识并建立个人品牌。文章涵盖选题策略、克服完美主义、平衡工作与写作等实用建议,强调写作对技术人员的职业价值。 评论点赞收藏498 天前