Engineering at Meta

RSS: https://engineering.fb.com/feed/
Meta 工程博客。

将私有处理引入 Meta AI 眼镜

Meta 工程团队披露 AI 眼镜的 Private Processing 架构:用 TEE/CVM 把信任边界扩展到云数据中心,使 Meta 自身也无法访问用户数据;基于 2025 年在 WhatsApp 和 Meta AI 应用中的同名方案扩展而来。 工程上有五个核心要求:硬件隔离、fail-closed 保障、公开可验证性、非可定向性(anti-targeting)和加密存储。文中详述了去标识化路由(盲签令牌 + OHTTP relay)、远程证明 + TLS 握手、以及针对多区域高可靠系统的威胁模型,并指向 Private Processing 白皮书获取完整细节。 对关注隐私计算、TEE 工程落地、可穿戴 AI 架构和可信云安全的科技读者信息密度较高。
评论点赞收藏6 天前

Delta:基于链式复制的高可用强一致性存储系统

Meta 工程团队发布 Delta 对象存储系统的设计与实践。Delta 定位为低依赖、极简的高可用存储底座,只暴露 put/get/delete/list 四个操作,放弃性能与存储效率,换取可靠性与强一致性。 核心采用链式复制(chain replication),并引入 apportioned queries 让链内所有节点分担读流量,同时通过自动化修复控制面(CPS)处理主机故障与链路重建。 对比 quorum 复制,链式复制以更高写延迟换取更简单的共识与更直观的故障容忍。后续演进包括跨地域混合同步/异步复制、冷归档持续备份与恢复能力。 对架构师和存储工程师有直接的工程参考与讨论入口:何时用链式复制、读扩展的代价、故障投票阈值、重建策略等。
评论点赞收藏8 天前

Meta 开源 Rebalancer:通用高性能分配问题求解库

Meta 将内部使用九年的资源分配求解器 Rebalancer 开源,并配套 OSDI'24 论文。该库将问题定义、内存存储、求解和调试四个关注点解耦,覆盖机架放置、服务分配、任务调度和流量路由等超大规模数据中心的分配问题。 对做基础设施、调度优化或 OR 方向的工程师有直接参考价值;面向一般科技读者吸引力一般。
评论点赞收藏8 天前

Petal 内幕:打造全球首条 Petabit 级跨洋海底光缆

Meta 发布 Petal 跨洋海底光缆项目,连接法国与美国,全长约 7000 公里,预计 2029 年投用。这是首条具备 petabit(1 Pbps)容量的跨洋海底光缆,也是首次大规模部署多芯光纤(multi-core fiber)技术,在不增加等比例功耗和基础设施的情况下使单纤容量翻倍。 项目由 Meta 与 NEC、住友电工合作建造,法国登陆端由 Orange 支持。文中还回顾了自 1980 年代掺铒光纤放大器(EDFA)以来海底光缆容量演化的几次关键转变,以及 2010 年代相干光传输和色散非补偿设计带来的行业跳跃。 整体是 Meta 工程博客的官方公告式内容,信息明确但缺少个人观察或争议点。
评论点赞收藏9 天前

组织级第二大脑:构建能从专家学习的 AI

Meta 构建了一个合规领域的 AI 专家代理,将机构知识分为"知识层"和"推理层"两层架构,通过自改进循环将专家反馈编译为经过回归测试的更新,无需重新训练模型。 该系统让领域专家节省了大量回答常规问题的时间,使其专注于真正需要判断的复杂工作。核心创新在于把专家推理方式编码为可检索文本,而非依赖模型权重,使一次性修正转化为永久累积的机构记忆。
评论点赞收藏28 天前

Meta 发布 MetaRoCE:专为 AI 规模以太网设计的 RDMA 传输协议

Meta 发布 MetaRoCE,一个为 AI 训练和推理场景从零设计的 RDMA 传输协议,通过 OCP 开源。核心思路是把智能从交换机移到网卡端,支持乱序到达、多路径 spraying、丢包容忍,无需 PFC。 在 64 节点 AMD GPU 集群实测中,MetaRoCE 比 RoCEv2 吞吐更高、尾部延迟更低;1% 丢包下保持约 86% 吞吐,10% 丢包时仍持续传输而非崩溃。 协议已开放规范、参考实现和合规测试套件,AMD Pensando 已实现,其他厂商也在跟进。
评论点赞收藏36 天前

MTIA 300:Meta首款内置NIC和通信卸载引擎的训练芯片

Meta发布MTIA 300,首款专为推荐模型训练设计的自研AI芯片,将网络接口直接集成到芯片封装内,并配备16个专用消息引擎独立处理通信,计算与通信几乎完全隔离。 实测在1500亿参数推荐模型上,通信速度是同等GPU集群的3.9倍,单机架内通信带宽达940 GB/s。
评论点赞收藏36 天前

WhatsApp如何用端到端加密构建Scam Alert诈骗检测功能

WhatsApp推出设备端AI诈骗检测功能,消息内容不上云,保持端到端加密。模型小、可在手机端运行,无需服务器端组件。用户可选择开启,不会自动上报。 目前仅在Beta测试,同步公开技术细节供安全社区审查。
评论点赞收藏49 天前

Meta 如何把 LLM 规模广告推荐模型的训练效率翻倍

Meta 的 GEM 广告推荐基础模型训练效率翻倍,端到端训练效率达到 20-25% MFU,训练算力规模 12 个月内增长 4 倍。通过自定义推荐内核库(Jagged Flash Attention、GDPA、BlockAttention)和混合超低精度训练(MXFP8 attention 和 MLP)实现计算效率提升,同时采用拓扑感知 5D 并行策略(2D FSDP + Expert Parallelism 处理密集参数,Fully Sharded 2D Model Parallelism 处理稀疏参数)降低通信开销。 推荐系统与 LLM 训练在架构和数据特性上存在根本差异,需要硬件和软件的协同设计才能突破瓶颈。
评论点赞收藏57 天前

Meta Ads 分层兴趣表示:用图学习+LLM优化深度转化漏斗

Meta 工程团队发布分层兴趣表示(Hierarchical Interest Representation)研究,在广告实体(用户、广告主、商品)之上构建统一嵌入层,连接用户隐性兴趣与深度转化广告。 系统采用自研 Transformer 图学习,结合偏置感知注意力与自监督跨视图蒸馏,在数十亿级真实广告交互数据上端到端训练。多模态广告主与商品内容经 LLM 处理后补充稀疏交互信号,支持罕见和未见实体的泛化。 输出通用嵌入与 Bag-of-Meaning 兴趣 token,计划接入 GEM、Andromeda 和自适应排序模型等推荐架构。
评论点赞收藏76 天前

10 Years of Meta’s Commitment to Python

This year marks Meta’s 10th consecutive year as a sponsor of the Python Software Foundation (PSF), the charitable organization dedicated to advancing, supporting, and protecting the open-source Python...
评论点赞收藏91 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。