ByteByteGo Newsletter

RSS: https://blog.bytebytego.com/feed
ByteByteGo 是一个关于系统设计和软件架构的技术博客。

DoorDash 如何为 AI 代理构建工具箱

DoorDash 工程团队构建了一个共享 Agent Gateway,用于控制 AI 代理在真实系统中调用工具:网关承担权限校验、凭据管理、工具可见性控制、请求转发和审计日志等职责。 文章指出 MCP 简化了工具暴露,但企业级落地还需处理身份认证、用户授权链接、工具目录发现和执行等环节。内容基于公开资料整理,属于架构科普型解读,对理解 AI agent 基础设施有帮助,但缺少一手实现细节或新观点。
评论点赞收藏21 小时前

LLM 为什么会撒谎?

<h2></h2><p>您的代理返回了一些异常结果。是提示词出了问题,还是工具调用超时,亦或是您的代码无法解析响应?如果没有追踪日志,您只能凭猜测。</p><p>在本次实操工作坊中,Sentry 的 Serge 将使用 Sentry 代理追踪功能对三个代理进行监控:一家电商店铺的聊天机器人、一个自定义 Slack 代理,以及一个用于审查拉取请求的 GitHub Action。<br><br>您将了解如何捕获错误的工具调用和意外输出,以及如何跟踪每个代理的令牌消耗与性能表现。</p><p></p><hr><p>一位顾客向某公司的全新 AI 支持助手询问,15 天前购买的订阅是否符合退款条件。假设该助手立即回复称,公司提供 30 天的退款期限,详细说明了取消流程,并承诺款项将在五个工作日内到账。<br><br>整个回答听起来既专业又自信,内容完整。</p><p>但问题在于:</p><p>实际上,该公司仅允许在 14 天内申请退款,且并未承诺 5 天内完成处理。该助手实际上是将一些看似合理的政策片段拼凑起来,凭空捏造了一个虚假的承诺。<br><br>换句话说,它撒了谎。顾客因此期待了一项公司从未提供的服务。</p><p>尽管这个例子可能显得虚构,但它揭示了基于大语言模型构建的应用程序所面临的最重要问题之一:虽然大语言模型能够生成高质量的语言,却可能完全误解其背后的事实信息。</p><p>在本文中,我们将探讨大语言模型产生“幻觉”的原因,以及提升其回答可靠性的相关技术。具体包括:</p><ul><li>大语言模型中的“幻觉”究竟指什…</li></ul>
评论点赞收藏1 天前

AI 智能体可以思考了。现在它们可以支付了。

<h2></h2><p>AI SRE 已经到来。如果你的遥测、警报和访问控制还没准备好,预计会出现遗漏事件、警报疲劳以及无果的 AI 驱动调查。这本 Datadog 电子书涵盖了如何为 AI SRE 未来准备你的堆叠,包括实用的自我评估清单和 Datadog 自身实施的真实示例。</p><p>你将学会如何:</p><ul><li>评估你的遥测覆盖是否能为AI SRE提供足够信号以有效调查</li><li>设计出AI智能体能够对其采取行动的警报和监控系统,而不仅仅是表面上对人类</li><li>建立访问控制和数据质量基础,使AI驱动的调查值得信赖</li></ul><p></p><hr><p>30年来,每一家在线企业都是基于一个简单的假设建立的:你的客户是真人。人类浏览网站。人类输入信用卡号。人类点击购买。<br><br>人工智能代理开始改变这一假设。如果ChatGPT将成为你的客户,互联网可能需要一个新的协议。</p><p>这就是背后的问题<strong>机器支付协议(MPP)。</strong>为了更好地理解这一转变,我参加了在Stripe总部举办的MPP活动,并与以及Stripe,以及来自Tempo。</p><p>在这次深入探讨中,我们将探讨:</p><ul><li>当今支付流程的问题</li><li>什么是MPP</li><li>MPP的运作方式</li><li>代理支付的两个用例</li><li>你的下一个客户可能是代理人</li></ul><h2>当今支付流程的问题</h2><p>从互联网诞生之初,它就基于一个基本假设:它主要由人类使用。然而,这一假设已不再成立。</p><p>根据Cloudflare最近的一份报告,自动化系统目前生成了…</p>
评论点赞收藏2 天前

EP227:使用 Jev 的 9 个最佳场景

ByteByteGo 在邮件简报中推荐 TypeSafe AI 的 System 1 模型 Jev,称它比前沿 LLM 快 100 倍、更便宜,适用于以前因成本/速度被忽略的场景。 文中列出 9 类用法:模型路由、guardrails、agent 工具调用权限分类、邮件分诊、reranking、LLM 评估、批量打标、实时决策与置信度判断。 开头为赞助商 webinar 推广,整体是 Newsletter 例行推荐与场景枚举,缺少深入技术论证或个人一手经验,对中文技术读者有一定参考价值但互动驱动一般。
评论点赞收藏4 天前

报名最后呼吁:用 AI 重建 YouTube

ByteByteGo 宣传其在线课程《Rebuild YouTube with AI》,由前 YouTube 工程师主讲,9月26日开课,报名24小时内截止。课程涵盖从 React 前端、Postgres 后端、认证、视频上传,到多模态嵌入实现语义搜索和关联视频,再到 Playwright 测试和 Vercel 部署。 内容属于付费课程推广,列出课程大纲并交叉推荐多门其他 AI 工程课程,信息增量低,无技术深度或可讨论观点。
评论点赞收藏5 天前

数据的一生:从创建到删除

文章以 Web 应用为例,讨论同一条数据在系统中可能同时存在于数据库、缓存、搜索索引、分析流水线和备份等多处,每个副本有自己的用途、更新节奏和生命周期。 围绕数据从创建到删除的完整生命周期,串起数据库设计、性能、报表、存储成本、恢复与隐私等决策。开头偏概念科普,信息增量有限,更像系统综述式导读。
评论点赞收藏6 天前

如何定制一个模型来学会新技巧

文章先以一段赞助内容推广 12 月 9 日的 Agentic Data Summit,随后进入正文:介绍当提示词和上下文不足以让大模型稳定满足特定输出风格、分类规则或细节要求时,需要通过微调补齐差距。 重点讲解 LoRA 和 QLoRA 等低资源适配技术,说明它们如何减少训练所需资源、缩小模型改动范围并降低显存占用,从而让现有模型更容易按业务预期定制。 整体属于系统性入门讲解,结构清晰但缺乏一手工程数据或独到观点,信息增量中等,适合作为技术概念入门读物。
评论点赞收藏7 天前

OpenAI 如何构建 GPT-Live:全双工语音模型的架构与工程实践

ByteByteGo 邀请 OpenAI GPT Voice 团队工程师(含 WebRTC 创造者 Justin Uberti)拆解 GPT-Live-1 的端到端实现。文章从语音系统三代演进讲起:级联 pipeline(语音→文本→语音)、回合制端到端模型,到全双工(full-duplex)模型。 GPT-Live-1 的核心突破是让模型在说话的同时持续监听,实时决策"该保持沉默、该插话还是该开口",大幅减少用户刚停顿思考就被打断的常见挫败感。 底层结合新一代语音模型架构与低延迟 serving 系统,并将"思考"与"说话"解耦(delegating thinking from talking),让模型可以边组织内容边输出语音。 文章附带工程细节:全双工调度策略、低延迟推理服务设计等,适合想理解语音 AI 工程落地的读者。
评论点赞收藏8 天前

如何在低配硬件上跑大模型?

ByteByteGo 面向开发者讲解如何在低配设备上跑大模型。核心结论:下载模型不等于能跑,真正瓶颈是内存占用、计算量和延迟。文章系统梳理六种常见压缩/优化路线——量化(给权重更小表示)、逐层 offload(用到再搬权重)、MoE 只激活部分专家、蒸馏(大模型教小模型)、剪枝(删低贡献部分)、投机解码(先猜多 token 再校验)。 适合把 LLM 部署到本地/边缘场景的工程师,属于偏科普整理型内容,信息有用但原创观点和踩坑深度有限。
评论点赞收藏9 天前

EP226:每个软件工程师都该知道的 API 概念

ByteByteGo 播客第226期,围绕 API 设计基础展开:HTTP 方法/状态码/请求响应格式等细节,REST/GraphQL/gRPC/Webhooks/WebSockets 选型,命名、分页、版本、错误处理、向后兼容,以及 API 密钥、OAuth、JWT、权限等安全要点。 属于系统设计的常规复习性内容,信息正确但缺少新事实与争议入口。
评论点赞收藏11 天前

大规模迁移:在万米高空更换应用引擎

文章用一个线上购物平台数据库被替换的场景切入,讨论生产环境大规模迁移的核心难题:系统不能停机、数据复制可能耗时数天、多个依赖组件需要逐步切换且中间态必须可用。 重点是迁移策略而非某个具体工具或事故复盘,适合想了解数据库/架构迁移思路的工程师。内容偏概念梳理,缺少一手踩坑细节和具体数据,但主题有实用价值。
评论点赞收藏13 天前

LLM 如何在大海捞针式检索中精准命中目标

ByteByteGo 长文讲解 LLM 检索问题:以一个员工在机场航班取消后问 AI 助手"能否报销酒店"为例,说明当公司有成千上万份差旅、费用、保险、福利和地区政策文档时,LLM 必须在语义不同、版本不同、地域不同的文档里找出仍然有效且真正相关的那段证据,才能给出有用答案。 文章接着会覆盖:文档如何被切分成可检索段落、embedding 如何让 LLM 理解不同措辞背后的相同含义、相似度"够近才算匹配"的阈值问题,以及为什么暴力搜索所有段落往往不是最优。 定位偏科普/入门教程,信息正确但缺少个人一手经验、强争议或明确技术判断,适合作为 RAG/检索基础知识的系统补强阅读。
评论点赞收藏14 天前

报名最后期限:Claude Code 实战训练营

<p>我们即将重新推出<strong>“使用 Claude Code 构建”</strong>课程——这是一门为期两天的高强度、基于学习小组的课程,由 John Kim 主讲。他曾为 Meta 的数百名工程师提供培训,帮助他们将 Claude Code 应用于实际生产工作流中。</p><p>课程将于9月16日正式启动,<strong>报名将在24小时内截止</strong>。如果你一直在思考如何提升自己和团队使用 Claude Code 的能力,现在就是最佳时机。</p><p></p><p>你将学到以下内容:</p><ul><li>使 Claude Code 能够真正服务于实际项目的智能体循环、上下文工程以及记忆层设计</li><li>如何利用 Claude Code Skills、MCP 和钩子构建系统,为 Claude 提供自我修正所需的工具与反馈机制</li><li>借助 Git 工作树、子代理和代理团队实现并行开发</li><li>完成一个综合项目,在自己的技术栈上交付一个真实可用的产品</li></ul><p>课程包含直播课、作业和答疑时间,因此你有充足的机会提问并解决遇到的难题。</p><p>如果你想从 Claude Code 的基础概念学起,直至掌握包括大型代码库在内的高级生产工作流,这将是一个绝佳的进阶途径。</p><p></p>
评论点赞收藏15 天前

大模型真的只有金鱼记忆吗?

ByteByteGo 解释:LLM 本身没有跨会话的持久记忆,所谓"记得"其实是外层应用把历史消息、摘要、检索结果、用户画像拼进上下文再喂给模型。 文章强调模型与应用的分界,提示开发者记忆能力需要工程层实现。内容正确但偏入门科普,信息增量有限。
评论点赞收藏15 天前

用大模型当裁判:如何判断你的 LLM 是否健康

ByteByteGo 的赞助推广文章,核心是 LLM 评估方法:LLM 不像普通函数,同样输入会产生不同措辞的输出,因此需要"LLM-as-a-Judge"等多种手段组合评估。 文章介绍评估流程的组成(确定性测试、黄金数据集、自动检查、模型互评、人工审查、生产监控),重点强调上线前做离线验证的重要性。 内容偏入门科普,框架完整但深度有限,结尾有明确的赞助商导流("Get the guide"),实质信息增量不高。
评论点赞收藏16 天前

为什么 Git Revert 会引发冲突?

git revert 会在覆盖的文件与后续提交产生冲突时触发冲突,因为新提交撤销了旧改动,但那段代码已被别人改过。解决方式是手动编辑冲突文件、暂存后再继续 revert。 Revert 不重写历史,而是生成一个新提交来抵消旧变更。
评论点赞收藏18 天前

ByteByteGo 直播训练营上线:学 Claude Code、AI 系统与评测

<p>大多数在线课程的完成率都很低(约4%)。而直播班的完成率约为40%,大约是前者的10倍。只有直播课程才是人们真正会学完的课程。</p><p>因此,我们推出了 ByteByteGo 直播课程。课程安排如下:</p><p></p><ul><li>使用 Claude Code 构建应用(John Kim,Meta 高级 Staff 工程师,<strong>将于几天后开课</strong>)</li><li>构建生产级 AI 系统(Tanya Roosta,AMD 总监,加州大学伯克利分校博士)</li><li>AI 工程基础(Ali Aminian,谷歌,畅销书作者)</li><li>AI 评估实战(Manjeet Singh,Salesforce 高级总监)</li><li>AI 成本优化(Jeremy Hintz,Meta 工程负责人)</li><li>用 AI 重构 YouTube(Mikhail Sychev,谷歌 Staff 软件工程师)</li><li>信任优先的 AI 开发(Kent Beck,测试驱动开发 TDD 的创始人)</li></ul><p>一份会员资格即可参与我们在未来 12 个月内开设的所有直播课程,包括期间新增的课程。</p><p></p>
评论点赞收藏19 天前

应用网络基础入门指南

电商应用调用订单API的背后,经历了DNS解析、TCP建连、TLS握手、负载均衡等完整的网络链路。这篇文章系统梳理了应用层网络的基础概念和通信流程。
评论点赞收藏20 天前

智能模型路由如何把 LLM 成本降低 10 倍

用智能路由把简单请求分给便宜小模型、复杂请求分给强模型,LLM 调用成本最高能降 10 倍,且响应质量几乎不下降。成本能否真正降下来取决于应用收到的请求类型分布、模型间价差和路由系统本身的表现。
评论点赞收藏21 天前

为可靠性而生:美国运通如何大规模处理支付

<h2></h2><p>认证往往是应用中测试最少的部分。实时环境需要网络访问和真实凭证,而模拟环境则忽略了破坏生产的故障。</p><p>@workos/仿真在本地运行 WorkOS API,用于开发和自动化测试。种子用户、组织、RBAC 角色和单点登录连接,然后测试完整的 AuthKit 登录流程、签名的 webhook、令牌刷新和错误处理,且不涉及生产环境。<br><br>响应和事件形状来自 WorkOS OpenAPI 规范,所以你的测试运行的是应用在生产环境中使用的相同表面。本地运行,或在 CI 中运行,使用npm、Homebrew、Docker 或独立二进制文件。</p><p></p><hr><p>客户在进行信用卡支付时,期望几乎能立即获得批准或拒绝。这一单一要求决定了支付的构建方式,因为整个支付处理必须在这短时间内完成。</p><p>我们最近与美国运通的一位杰出工程师,了解他们的平台如何处理这些问题。</p><p>为了理解事情的运作方式,让我们想象一下当一笔交易到达美国运通时会发生什么。交易会被路由到几个独立的处理单元之一,并通过一系列微服务链条传递。<br><br>然而,在过程中,其中一项服务开始失效,结账终端的客户仍在等待。</p><p>仅仅在故障单元内重试事务就存在明显风险。此外,将事务迁移到另一台服务器更是难题。这是因为第二个单元需要知道第一笔交易的传输距离。<br><br>共享这些知识会产生依赖关系,可能使两个独立单元变成脆弱的系统。</p><p>美国运通工程团队负责处理此…</p>
评论点赞收藏22 天前

MCP vs RAG vs AI Agent:三者核心区别速览

<h2></h2><p>让 CX 机器人上线只是第一步。真正的挑战在于,当真实用户开始使用它之后。</p><p>我们的新指南将探讨 Lyft、沃达丰和拉塔姆航空等企业的团队如何在生产环境中运行 CX 机器人。内容涵盖他们如何评估回复质量、监控故障,并利用实际对话持续优化系统。</p><p>您将学会:</p><ul><li>如何避免提示词质量拖累开发进度</li><li>从一开始就为机器人构建可观测性</li><li>在故障波及更多用户之前及时发现并应对</li><li>将客户对话转化为对支持、产品和运营都有价值的信号</li><li>选择能够在真实 CX 工作流中稳定运行的架构</li></ul><p></p><hr><p>本周系统设计速览:</p><ul><li>《JVM 的工作原理》(YouTube 视频)</li><li>MCP 对比 RAG 对比 AI 代理</li><li>你应该掌握的 9 种分布式系统模式</li><li>虚拟化与容器化</li><li>HTTP 与 HTTPS</li></ul><hr><h2>JVM 的工作原理</h2><hr><h2>MCP 对比 RAG 对比 AI 代理</h2><p>MCP 是一种开放标准协议,用于将 AI 模型与外部工具和数据源连接起来。这些外部资源可以是 API、数据库,也可以是 Gmail、Slack 或 GitHub 等应用。<br><br>因此,无需为每个应用单独编写或实现集成,MCP 提供了一种标准化的接入方式。</p><p>RAG 模式下,模型会在收到查询时实时检索最新信息。这使得模型不必凭空生成答案,而是从文档、PDF 和数据库等外部数据源获取最新资料,从而给出最贴近当下情况的回应。</p><p>AI 代理则是一种能够自主执行任务并作出决策的 AI 系统。与仅…</p>
评论点赞收藏25 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。