Netflix 技术博客

RSS: https://netflixtechblog.com/feed
Netflix 工程技术博客,分享工程实践、产品文化与架构经验。

Netflix 用 gRPC 查询实时分布式图:亚百毫秒延迟的设计抉择

Netflix 构建了实时分布式图(RDG),在数十亿节点和边的规模下将查询延迟控制在 100ms 以内。采用广度优先遍历替代深度优先,用 16-24 个线程通过异步组合处理数千并发请求。缓存策略按数据变化频率分层,稳定数据缓存命中率达 70-80%。外部元数据按需获取,服务不可用时降级返回图数据本身。
评论点赞收藏6 天前

Netflix如何构建实时分布式图(第三部分):查询层设计

Netflix工程师分享实时分布式图查询层设计,采用广度优先遍历和异步执行实现sub-100ms延迟。系统支持两种查询模式:浅而宽的账户设备查询和深而窄的观看历史追踪。通过邻接列表、流式读取和选择性缓存,处理数十亿节点和边的查询。
评论点赞收藏7 天前

Netflix 如何构建实时分布式图(三):用 gRPC 查询图

Netflix 技术博客第三篇,介绍实时分布式图(RDG)的查询层设计。核心决策:用广度优先而非深度优先遍历,避免分布式环境下多次网络调用累积延迟;采用异步非阻塞架构,16-24 个线程处理数千并发请求;按数据变更频率分层缓存,稳定属性用 EVCache 带 TTL,频繁变化的边数据不缓存。查询延迟目标 sub-100ms,支撑账号-设备-内容等多跳遍历场景。
评论点赞收藏8 天前

Netflix 设备能力建模:用数据驱动功能投放决策

由 阿尔蒂·拉达 、理查德·迪亚兹-酷 、里希卡·伊德纳尼 、文卡特什·塞尔维拉杰 提供 Netflix 拥有丰富且不断演进的各类功能与内容,从 4K 流媒体和沉浸式音效,到直播流媒体和云游戏,覆盖了多元化的设备生态系统。然而,并非所有设备都是一样的。硬件限制,例如可用内存、CPU 核心数、显示能力或平台支持等因素,意味着某些功能在特定的设备型号上可能无法得到支持。为了确保用户获得最佳的使用体验,...
评论点赞收藏15 天前

Netflix 推出 GenRec:基于大语言模型的推荐系统新范式

作者:英莉,阿尔君·拉奥,施拉达·塞加尔 简介 推荐是Netflix体验的核心。我们当前的生产模型依赖于数千个手工打造的功能,覆盖用户、物品和交互,以及专门的序列建模、特征交互和多任务目标架构。该技术栈经过多年发展,支持多样化的内容类型(电影、剧集、游戏、直播、播客)和产品表面,但其复杂性使得引入新用例成本高昂:添加内容类型或表面可能需要大量特征工程、架构变更、基础设施工作和实验。 与此同时,...
评论点赞收藏16 天前

规模化构建服务拓扑图:架构、挑战与经验教训

Netflix 分享构建实时服务依赖拓扑图的工程实战。针对大规模流量,采用流式处理而非批处理,利用背压机制防止数据丢失。核心创新在于三阶段分布式聚合管道:解决网络中间件(如负载均衡器)导致的链路断裂问题,通过重哈希将相关流量汇聚到同一节点解析。文章详细记录了生产环境中的痛点,如Kafka消费延迟、热点节点导致的GC停顿和内存溢出,以及通过动态一致性哈希实现自动负载均衡的经验。适合对分布式系统架构、可观测性基础设施和大规模数据处理感兴趣的工程师。
评论点赞收藏25 天前

规模化构建服务拓扑:架构、挑战与经验教训

由帕尔特·贾因、拉凯什·苏库马尔、赵英武、伦佐·桑切斯-席尔瓦和内森·费舍尔撰写:深入探讨在Netflix规模下构建实时服务依赖关系图所面临的工程挑战:从流媒体架构与分布式聚合管道,到时间旅行查询,以及使这一方案得以成功运行的方法论。引言 在我们的第一篇帖子中,我们介绍了这一问题:Netflix 的工程师需要一种统一的、实时的服务依赖关系视图,以便更快地进行故障排除、了解影响范围,并…
评论点赞收藏33 天前

GenPage:Netflix 如何实现端到端的生成式主页构建

作者:王乐群、潘江伟和利纳斯·巴尔特鲁纳斯 图1:自回归式主页生成。GenPage 会逐行或逐个实体地构建 Netflix 主页,每一行都基于页面上已有的内容以及用户的上下文来决定。 简介 Netflix 主页是用户打开应用时首先看到的内容,也是他们发现并享受内容的主要途径。其几乎每一个部分都经过个性化定制,包括哪些行会显示、哪些实体会出现在这些行中,以及所有内容的呈现方式……
评论点赞收藏47 天前

迈向更可控的 AI 视频编辑:Netflix 的早期探索

Netflix 技术团队分享在 AI 视频编辑领域的早期研究成果,旨在提升生成视频的可控性。 文章介绍了如何利用 AI 技术优化预告片、短视频等宣传素材的制作流程,解决创意落地中的控制难题。
评论点赞收藏54 天前

Netflix 如何利用 Kueue 简化批处理计算

Netflix 将自研的计算调度逻辑替换为云原生作业队列系统 Kueue,以推进基础设施向 Kubernetes 原生转型。 这一举措简化了 Titus 平台的批处理工作负载管理,减少了维护自定义代码的复杂度。
评论点赞收藏54 天前

数据守护鸟:Netflix 如何验证目录元数据

Netflix 介绍其自动化数据守护系统,利用生产流量验证目录元数据转换,能在10分钟内检测问题并阻止坏数据触达用户。 该系统旨在保护流媒体可靠性,防止因数据状态损坏而影响数百万观众,体现了大规模数据处理中的工程实践。
评论点赞收藏57 天前

数据项目管理:在 Netflix 规模下管理数据资产

Netflix 工程师介绍如何管理海量数据资产。面对数百万张表和数万个工作负载,团队需要解决权限管理和执行调度问题。 文章分享了他们在数据平台治理方面的实践经验与工具演进,旨在应对大规模数据环境下的复杂性挑战。
评论点赞收藏57 天前

Netflix Cassandra 数据迁移技术的演进之路

Netflix 技术团队介绍了其统一的数据迁移管理平台 Data Bridge,旨在整合过去各工程组分散开发的定制化数据连接器。 该团队通过抽象层构建了连接器目录,实现了批量数据移动能力的集中化管理,解决了历史遗留系统的碎片化问题。
评论点赞收藏57 天前

像 Netflix 一样用“快思考与慢思考”设计个性化通知系统

由马修·伍德、伊尚·古普塔、凯文·梅库里奥、德文·布莱恩特和克莱尔·多曼撰写。在经典著作《思考,快与慢》中,丹尼尔·卡尼曼阐述了驱动人类认知的两种系统:系统1,它以自动化、快速的方式运作,几乎无需费力;系统2,则将注意力分配给更具挑战性的心理活动,需要有意识的专注。这一双过程理论不仅对理解人类行为具有深远影响,而且对于设计必须…的智能系统也具有重要意义。
评论点赞收藏57 天前

面向因果推断的人机协同智能体工作流

由温斯顿·周、阿德里安·亚历山大、拉尔斯·奥尔兹、张毅、加勒特·哈格曼和内森·卡卢斯撰写 介绍 想象一下,你请一位数据分析师来分析两个变量之间的因果关系,比如观看一部热门 Netflix 剧集对长期会员留存率的影响。这位分析师会查询你的数据、运行回归分析,并自信地给出答案。你该对他的结果有多大的信任?你能确信这位分析师已经考虑到了细微的偏差吗——还是说,他对待那些热情的粉丝时,仿佛他们只是普通用户...
评论点赞收藏57 天前

从孤岛到服务拓扑:Netflix 为何构建实时服务地图

Netflix 工程师介绍如何构建实时服务拓扑图,以解决分布式基础设施中依赖关系复杂的问题。该工具帮助工程师快速定位故障根源,缩短排错时间,保障全球用户观看体验。 文章分享了从传统监控转向动态服务地图的工程实践,强调了可视化依赖关系在大规模微服务架构中的重要性,为处理类似复杂系统运维提供了参考案例。
评论点赞收藏77 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。