Amazon Science

RSS: https://www.amazon.science/index.rss
亚马逊以客户为中心的科学方法。获取 AI 与机器学习创新的最新动态,包括职位、论文、会议与活动等。

图中心的智能体智能

Amazon Science 与 NTT DOCOMO 合作,介绍如何用图结构(拓扑、语义本体、因果子图、GNN)+ Agent 编排来加速网络根因分析。文中回顾了几代图方法:从最初只建模物理连接,到用 knowledge graph 加语义,再到用告警关联图做层级聚合,再用 SDN/NFV 自动生成的依赖图做贝叶斯定位(宣称 95% 准确率、30 秒内),以及用因果有向无环图回答"为什么",最后 GNN 捕捉隐藏跨蜂窝依赖和时空动态。 新一代做法是把所有图类型统一在一个 Agent 层,根据故障模式动态选择工具。文章还提出三个支柱:图建模(数字孪生)、图中心分析、Agent 编排,并提到在 MWC 上用商用网络演示将根因分析从小时级压到分钟级。 文末提到有配套 runbook 文章("Beyond correlation...")。整体偏技术架构与工程方法论,适合关注 AIOps、图机器学习、电信网络运维的读者;争议点不大,但把"图 + Agent"在 NOC 场景落地讲得较系统。
评论点赞收藏10 天前

在 Trainium 上实现实时视频生成的以内核为中心的路径

<p>2018年,于尔根·施密德胡伯——这位在1990年首次提出将世界模型作为机器学习概念的人——与大卫·哈共同发表了一篇论文。他们描述了一种“预测性世界模型”,该模型能够“提取时空的有用表征”,并利用这些表征训练智能体完成驾驶等任务。<br><br>自那篇开创性论文发表以来的八年里,世界模型的能力及其在现实世界的应用取得了令人瞩目的进展。海量训练数据集的涌现,结合变分自编码器以及扩散模型和自回归Transformer架构,使当今的世界模型能够将文本、图像、音频和视频输入转化为潜在空间,并基于此构建和维护令人惊叹的沉浸式世界模型,从而预测状态变化并对动作作出响应。<br><br>这些模型在机器人技术、交通运输、气候建模、游戏开发、科学仿真和设计原型等领域发挥着至关重要的作用,并且其应用范围还在不断扩展。<br><br>随着世界模型性能与潜力的显著提升,对能够支撑它们的硬件与基础设施的需求也随之增加。Reactor公司的联合创始人兼首席技术官布莱斯·施密特琴对此深有体会。<br><br>“关键在于实时性、低延迟,以及如何以尽可能高效的方式实现规模化运行。”他指出。Reactor是一个平台,旨在帮助开发者、设计师和研究人员部署、使用并扩展实时交互式人工智能模型。<br><br>“所谓高效,既包括如何在特定芯片上调度推理过程——在我们的案例中是Trainium——也包括如何最大化地整合模型的每一次前向传播。”Reactor的全球布局更进一步凸显了效率问题的紧迫性。<br><br>“我们按…</p>
评论点赞收藏16 天前

Amazon 与斯坦福大学联合启动 AI 与科学前沿研究计划

Amazon 与斯坦福大学宣布成立"Stanford-Amazon Research Initiative",围绕 AI、能源和医疗前沿开展联合研究。目前已有超过 10 个 Amazon 团队在斯坦福资助研究项目和博士奖学金,覆盖人形机器人、后量子密码学、因果测量科学和 AI 放射学等方向。 双方将建立联合研究项目、博士奖学金和跨学科研讨会。AWS CEO Matt Garman 与斯坦福研究副教务长 David Studdert 在 9 月 16 日的校园活动上讨论了大学-产业合作。
评论点赞收藏19 天前

推进 AI 用于生物学:让模型学会设计并表征抗体

Amazon Bio Discovery 团队发表三篇论文,分别解决抗体药物开发中三个核心预测难题:结合强度排名、可开发性预测、以及端到端设计验证。 重点成果包括:(1) MochiBind——基于 ESM-2 蛋白质语言模型的抗体-抗原结合亲和力预测器,不依赖结构输入,通过 TrueSkill 贝叶斯算法将成对比较聚合为全局排名,在 AlphaBind 数据集的严格跨抗原基准上,成对准确率比最强结构基线高近 10%,CPU 推理 13 秒完成 20 万对抗体,速度提升超 100 倍;(2) 可开发性灵活预测模型;(3) 由 agent 导航结合位点选择、经实验验证的针对新型癌症靶点抗体 hit。 文章核心信息增量在于:将预测任务从"绝对亲和力"重构为"相对排序"以规避跨实验噪声,并展示了 AI 端到端驱动抗体发现的可行路径,对计算生物学和药物研发从业者有直接参考价值。
评论点赞收藏20 天前

用 Verus 开发可证明正确的 Rust 代码

Amazon 科研博客介绍开源 Rust 程序验证器 Verus:它用类 Rust 语法在源码中写前置/后置条件,自动对全输入做形式化验证,反馈可低于 1 秒,还能配合 AI 辅助生成证明。 文章指出 Rust 的内存安全不等于功能正确性,Verus 可补上这一层,并覆盖 unsafe 代码块与带自定义锁方案的并发代码,重新建立机器检查的安全保证。 Amazon 已在 Firecracker、Nitro Isolation Engine 等关键基础设施中用 Verus 证明核心原语;该工具也被证书校验库、数据格式解析器、Kubernetes 控制器等开源项目采用。 适合关注形式化验证、系统安全或 Rust 工程的读者。
评论点赞收藏27 天前

为什么机器学习研究 Agent 不会过拟合?

<p>机器学习的本质在于泛化,而非记忆。你将一堆训练样本交给学习算法,并用它们来拟合一个模型。但目标并不是在这些训练样本上表现良好——那太容易了,你完全可以把答案都背下来。真正的目标是在那些从未见过的新样本上也能有不错的表现。如果一个模型在训练数据上表现很好,但在新数据上却很差,那就说明它其实什么都没学到;你只是自欺欺人地以为它学会了。这种失败模式有一个专门的名称:过拟合。任何上过统计学或机器学习入门课的人都知道标准的应对方法:预留一部分数据,不让模型在这上面进行训练。在实践中,这部分预留数据有两个作用:验证集是在构建模型的过程中反复使用的,用来比较不同的候选方案、调整超参数并决定下一步该尝试什么;而最终测试集(或称“holdout”)则只在最后使用一次:由于训练过程从未见过它,因此在该数据上的优异表现可以作为你在真实场景中遇到的新样本之可靠代理。不过,“holdout”的条件至关重要。只有当预留的数据确实未曾被“看到”时,上述代理性质才成立。如果你不断在上面检验性能、据此调整训练流程、再检验、再迭代,只为追求更高的分数,那么这块数据就不再是“未见”的了,它已经融入了你的训练过程。如此反复多次,你就可能像在训练集上那样对其过拟合,从而失去对未见数据的可信代理。这同样适用于任何以这种方式重复使用的预留数据,包括本就设计为反复使用的验证集。 机器学习的核心谜题 真正的机器学习研究正是按照我们…</p>
评论点赞收藏27 天前

当 LLM 评审达成一致的判断,我们该相信吗?

文章讨论 LLM-as-a-judge 多评审面板中“多数同意”的陷阱:多个 judge 若共享 prompt 模板、训练谱系或模型家族,它们的投票可能高度相关,使 10 票远不等于 10 个独立证据。 作者团队(Shiva Kasiviswanathan 等)在 ICML 2026 提出用 Ising 模型做依赖感知标签聚合:把评审面板建模为网络,同时学习每个 judge 的可靠性与两两依赖关系,并区分“对相关性加权”和“类别依赖模型”两个层次,无需人类参考标签,直接从已有评估日志中无监督学习。 在相关性、毒性、摘要评估三类二元任务上,用 10 个 temperature=0 的 judge,该法相较加权/均匀多数投票基线提升 9%–14%(如相关性 0.912 vs 0.820,毒性 0.792 vs 0.694,摘要 0.806 vs 0.737)。 对已规模化使用 LLM 评审的团队,作者给出实用建议:评估整个面板而非单个 judge、把模型多样性视为统计多样性、检查一致性结构以识别共享盲点、报告不确定性时考虑相关性。 对做 RAG 评估、judge 面板或 LLM 自动打分的工程师有直接方法价值,且“相关投票≠独立证据”本身是一个会引发讨论的观点。
评论点赞收藏27 天前

ML研究agent为什么不会过拟合?

<p>机器学习的核心在于泛化,而非记忆。你将一堆训练样本交给学习算法,并用它们来拟合一个模型。但目标并不是在这些训练样本上表现良好——那太容易了,你只需把答案都记下来就行。真正的目标是在那些从未见过的新样本上也能有不错的表现。如果一个模型在训练数据上表现很好,但在新数据上却很差,那就说明它其实什么都没学到;你只是自欺欺人地以为它学会了。这种失败模式有一个专门的名称:过拟合。任何上过统计学或机器学习入门课程的人都知道标准的应对方法:预留一部分数据,不让模型在这上面训练。在实践中,这部分预留数据有两个作用:验证集是在构建模型过程中反复使用的,用来比较不同候选方案、调整超参数并决定下一步该尝试什么;而最终测试集(或称留出集)则只在最后使用一次:由于训练过程从未接触过它,因此在该数据上的优异表现才是对真实场景中新样本性能的可靠指标。“留出”这一条件至关重要。只有当预留的数据确实未曾被“看到”时,上述可靠性才成立。如果你不断在上面检验性能、据此调整训练流程、再检验、再迭代,只为追求更高的分数,那么这块数据就不再是“未见”的了,它已经融入了你的训练过程。如此反复多次,你就可能像在训练集上那样对其过拟合,从而失去它作为未见数据代理的意义。这种问题适用于所有以这种方式重复使用的预留数据,包括本就设计为反复使用的验证集。 机器学习的核心谜题 真正的机器学习研究正是按照我们刚才描述的迭代改进循环进行的。所有…</p>
评论点赞收藏31 天前

用 Verus 开发可证明正确的 Rust 代码

Amazon 正在用 Verus 对关键 Rust 代码做形式化验证,已用于 Nitro Isolation Engine 等核心基础设施。Verus 是一个开源自动程序验证器,允许开发者在 Rust 源码中直接写规格说明和证明,编译器会忽略这些注解,所以验证过的代码也能被普通 Cargo 项目使用。 相比传统测试,它能覆盖所有输入情况,包括边界条件。
评论点赞收藏41 天前

LLM裁判意见一致,就值得相信吗?

Amazon Science团队在ICML发表论文,提出用Ising模型检测LLM裁判之间的相关性,聚合准确率比加权多数投票提升9%-14%。多数投票假设裁判错误相互独立,但共享prompt模板、训练来源或模型家族的裁判会重复相同错误,导致"八票赞成"比实际更有说服力。 该方法无需人工标注,从已有评估日志中学习裁判可靠性与成对依赖关系,已在相关性分类、毒性检测和摘要评估三个任务上验证。
评论点赞收藏46 天前

SOP-Bench:评估AI代理执行真实商业流程的新基准

Amazon Science发布SOP-Bench,一个覆盖12个商业领域、含2000+任务的AI代理评估基准,已在KDD 2026发表。每个任务配备工具接口和标准答案,测试代理在真实SOP中的执行能力,而非仅靠文本生成得分。 现有基准多只测单一能力,SOP-Bench填补了真实流程中多工具协调、歧义理解和错误恢复的评估空白。
评论点赞收藏51 天前

十年数学确定性:亚马逊自动化推理组的回顾与展望

亚马逊科学团队回顾其自动化推理组(ARG)十年历程:从2016年提出用数学逻辑证明AWS系统正确性,到如今Tiros、Zelkova等工具已支撑Amazon Inspector、IAM Access Analyzer、Bedrock Guardrails等数百万客户日常使用的服务。 团队还证明了Nitro Confidentiality Engine等核心基础设施的正确性,并将Lean等证明助手与语言模型结合以扩展形式化验证规模。
评论点赞收藏61 天前

AWS Trainium Frontier竞赛:在专用AI芯片上协同设计模型与内核

AWS推出Trainium Frontier竞赛,让参赛者在Trainium2芯片上从零训练语言模型,探索硬件原生架构设计空间。竞赛分两阶段:第一阶段单芯片30分钟,以验证bits-per-byte评分;第二阶段进入Top10后使用完整服务器,增加CORE推理能力评估。 最终得分是训练效率与推理能力的50/50综合。
评论点赞收藏61 天前

Why Triso Matters

Amazon is investing in next-generation nuclear technology to meet the rising energy demands of AI infrastructure and cloud computing, and at the heart of that technology are tristructural isotropic (T...
评论点赞收藏95 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。