Meta AI

RSS: https://ai.meta.com/blog/rss/
Meta 正在为每个人构建个人超级智能,探索 Meta AI 及开源大模型。

用 AI 让儿童画作动起来

Meta AI 发布原型系统,利用计算机视觉技术自动识别并动画化儿童手绘人物。针对儿童画形态多变、透视扭曲(如“蝌蚪人”)等难点,团队通过微调 Mask R-CNN 进行目标检测,结合传统图像处理优化分割掩膜,并使用 AlphaPose 处理非标准人体姿态,最后通过 3D 动作捕捉数据驱动 2D 角色动画。该系统允许用户上传画作生成跳舞、跳跃等动态效果,旨在推动 AI 理解人类创造力及非写实图像识别研究。
评论点赞收藏23 天前

Meta AI模型助力美国能源部Genesis计划首批项目

美国能源部Genesis计划利用Meta开源的SAM 3和DINOv3模型,解决国家实验室X射线和中子科学数据处理的实时性瓶颈。在劳伦斯伯克利国家实验室的实践中,该方案将葡萄藤干旱响应的3D图像分割时间从一个月缩短至15分钟,实现了实验过程中的实时数据分析。
评论点赞收藏25 天前

Meta 发布 Muse Image:具备自主工具调用与自我修正能力的新一代图像生成模型

Meta Superintelligence Labs 发布 Muse Image 和预览 Muse Video。核心亮点是引入了 Agent 能力:模型能自主调用搜索和代码工具来修正生成结果,并具备基于强化学习涌现出的自我反思与迭代优化机制。此外,支持多参考图组合编辑及隐式水印 Content Seal。技术细节揭示了“推理+工具”在测试时计算扩展上的优势,为图像生成领域提供了新的工程范式参考。
评论点赞收藏37 天前

Meta 发布 Muse Spark 1.1:面向智能体任务的新一代多模态模型

Meta 发布 Muse Spark 1.1 多模态推理模型,升级了编程、计算机操作及智能体任务能力。提供百万 token 上下文,支持多智能体协作与脚本生成。 开发者可通过 Meta Model API 访问该模型。Replit、Cline 等合作伙伴评价其具备企业级智能编码基础能力,适合大规模自动化工作负载。
评论点赞收藏37 天前

Meta 发布非侵入式脑机接口 Brain2Qwerty v2:无需手术即可读取句子

Meta 发布了非侵入式脑机接口系统 Brain2Qwerty v2,利用 MEG 设备直接解码大脑信号生成文本。该系统在志愿者测试中实现了 61% 的词准确率,最高单人达到 78%,显著优于此前非侵入式方法的 8%。 Meta 同时开源了 v1 和 v2 的训练代码及数据集。研究认为通过增加数据量可进一步缩小与侵入式手术方法的性能差距,旨在帮助因脑损伤无法交流的患者。
评论点赞收藏46 天前

Meta发布Brain2Qwerty v2:非侵入式脑机接口实现高精度自然语句解码

Meta AI发布Brain2Qwerty v2模型,仅通过非侵入式脑磁图(MEG)即可解码自然句子,平均词错误率降至39%。该研究利用深度学习替代传统信号处理,并结合大语言模型提取语义,证明了数据规模扩展能显著缩小非侵入式与植入式脑机接口的性能差距。 这项成果标志着非侵入式脑机接口技术在准确性上取得了突破性进展,有望为失语症患者提供安全高效的沟通恢复方案,引发了关于脑机接口未来伦理与技术边界的广泛讨论。
评论点赞收藏47 天前

Alta Daily利用Meta SAM模型重塑数字衣橱体验

AI时尚应用Alta Daily利用Meta的Segment Anything Model处理用户上传的复杂衣物图片,实现背景去除和数字化衣橱功能。 创始人Jenny Wang表示,SAM模型在成本和效果上优于外部API,已处理超2000万张图片,支持全球用户智能搭配。
评论点赞收藏131 天前

Meta 开源 TRIBE v2:能预测大脑对视听反应的基础模型

Meta 开源了 TRIBE v2 模型,能根据图像和视频预测人类大脑的高分辨率 fMRI 活动。该模型基于 700 多名志愿者的数据训练,支持零样本预测。 此举旨在加速神经科学研究,让研究者无需大量人体实验即可测试假设,并开放了论文、代码及演示网站供探索。
评论点赞收藏138 天前

Meta 发布多模态基础模型 TRIBE v2,实现高精度全脑活动预测与“硅基实验”

Meta AI 发布 TRIBE v2,这是一个融合视觉、听觉和语言的多模态基础模型,能高精度预测人类大脑活动。该模型基于 720 名受试者的 1000 多小时 fMRI 数据训练,在预测新刺激和任务的大脑响应上超越了传统线性编码模型。TRIBE v2 支持“硅基实验”,能复现经典的神经语言学范式结果,并揭示了多感官整合的精细拓扑结构,为探索人脑功能组织提供了统一的 AI 框架。
评论点赞收藏141 天前

构建 Agentic AI 的基础模块

Meta 发布基于 PyTorch 的原生 Agentic AI 工具栈,包括 Helion、Monarch、Torchforge 和 ExecuTorch 等项目。旨在降低 AI 内核开发与分布式训练门槛,推动端侧 AI 及强化学习发展。
评论点赞收藏152 天前

Meta发布Canopy Height Maps v2:基于DINOv3的全球高精度森林树冠高度图

Meta与世界资源研究所合作发布Canopy Height Maps v2,利用DINOv3模型生成全球高精度森林树冠高度图。相比上一代,准确率大幅提升,旨在辅助环境监测与碳储量估算。 目前该地图已被英国、欧盟及美国多个城市用于森林管理和城市规划项目,支持生物多样性保护与气候目标达成。
评论点赞收藏156 天前

Meta 两年四代自研芯片:如何为数十亿用户扩展 AI 算力

Meta 宣布在两年内迭代四代自研 AI 芯片 MTIA,计划部署 MTIA 400、450 和 500。这些芯片针对生成式 AI 推理进行了优化,特别是提高了内存带宽和低精度计算能力。 文章详细介绍了 MTIA 的技术架构,包括模块化 Chiplet 设计、PyTorch 原生支持以及专用的通信库。Meta 强调其“高速度、推理优先”的策略,旨在以更具成本效益的方式为全球数十亿用户提供服务。
评论点赞收藏157 天前

WhatsApp私有处理技术白皮书:如何在云端AI中保护隐私

Meta发布WhatsApp私有处理技术白皮书,详解如何利用可信执行环境(TEE)在云端实现AI功能(如消息摘要)的同时保护用户隐私。 文章深入剖析了基于AMD SEV-SNP和NVIDIA GPU机密计算的架构,涵盖远程证明、匿名路由及防侧信道攻击等核心安全技术。
评论点赞收藏182 天前

Meta 发布 SAM Audio:支持多模态提示的音频分离模型

Meta 发布 SAM Audio,支持用文本、视觉和时间跨度提示,从复杂音频中分离目标声音。模型基于流匹配扩散 Transformer,在通用声音、音乐和语音分离上达到 SOTA 水平。 Meta 同时开源了评估数据集和 PE-AV 感知编码器,并引用了听力和公益组织的案例,展示其在辅助技术和无障碍领域的应用潜力。
评论点赞收藏242 天前

Meta SAM 3D: 从单张图像实现高精度物体与人体三维重建

Meta 发布 SAM 3D 模型,能从单张 2D 图片中精确重建物体和人体的 3D 网格及纹理。该模型包含针对物体和人体的两个子模型,支持遮挡处理和场景组合。 文章介绍了基于 Transformer 和 DiT 的架构设计,发布了新的评估数据集,并展示了其在电商、康复医疗和机器人领域的应用潜力。
评论点赞收藏268 天前

Omnilingual ASR:迈向 1600 种语言的自动语音识别

Meta 发布 Omnilingual ASR 模型,支持 1600 种语言的自动语音识别。该模型在 Hugging Face 提供演示,代码已开源。这一进展显著扩展了语音识别的低资源语言覆盖范围,展示了多语言模型在通用性上的巨大潜力。
评论点赞收藏278 天前

Agent 安全“二元法则”:Meta 提出的实用 AI 代理安全方案

Meta 提出 AI Agent 安全的“二元法则”,规定 Agent 在单次会话中不能同时具备处理不可信输入、访问敏感数据、执行外部操作这三项能力中的三项。 该框架旨在解决提示注入攻击风险,通过限制能力组合来阻断攻击链,为开发者提供了平衡 Agent 效用与安全的具体设计思路。
评论点赞收藏287 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。