Meta AI 发布原型系统,利用计算机视觉技术自动识别并动画化儿童手绘人物。针对儿童画形态多变、透视扭曲(如“蝌蚪人”)等难点,团队通过微调 Mask R-CNN 进行目标检测,结合传统图像处理优化分割掩膜,并使用 AlphaPose 处理非标准人体姿态,最后通过 3D 动作捕捉数据驱动 2D 角色动画。该系统允许用户上传画作生成跳舞、跳跃等动态效果,旨在推动 AI 理解人类创造力及非写实图像识别研究。
Meta 发布 Muse Spark 1.1 多模态推理模型,升级了编程、计算机操作及智能体任务能力。提供百万 token 上下文,支持多智能体协作与脚本生成。 开发者可通过 Meta Model API 访问该模型。Replit、Cline 等合作伙伴评价其具备企业级智能编码基础能力,适合大规模自动化工作负载。
Meta AI发布Brain2Qwerty v2模型,仅通过非侵入式脑磁图(MEG)即可解码自然句子,平均词错误率降至39%。该研究利用深度学习替代传统信号处理,并结合大语言模型提取语义,证明了数据规模扩展能显著缩小非侵入式与植入式脑机接口的性能差距。 这项成果标志着非侵入式脑机接口技术在准确性上取得了突破性进展,有望为失语症患者提供安全高效的沟通恢复方案,引发了关于脑机接口未来伦理与技术边界的广泛讨论。
Meta AI 发布 TRIBE v2,这是一个融合视觉、听觉和语言的多模态基础模型,能高精度预测人类大脑活动。该模型基于 720 名受试者的 1000 多小时 fMRI 数据训练,在预测新刺激和任务的大脑响应上超越了传统线性编码模型。TRIBE v2 支持“硅基实验”,能复现经典的神经语言学范式结果,并揭示了多感官整合的精细拓扑结构,为探索人脑功能组织提供了统一的 AI 框架。
Meta 发布 SAM Audio,支持用文本、视觉和时间跨度提示,从复杂音频中分离目标声音。模型基于流匹配扩散 Transformer,在通用声音、音乐和语音分离上达到 SOTA 水平。 Meta 同时开源了评估数据集和 PE-AV 感知编码器,并引用了听力和公益组织的案例,展示其在辅助技术和无障碍领域的应用潜力。