Agent 时代来了,3D 生成大模型接下来比什么?

9 月 3 日,GPT-6 Astra 的发布,把 3D 内容创作带到了舞台中央。

在 GPT-6 Astra 官方发布页的一个不到 3 分钟的视频里与后续解读中,Astra 已经能直接进入 Blender,从一句住宅设计需求开始搭场景,先生成极简住宅,后来又将其扩展为围绕庭院展开的家庭住宅。里面有卧室、办公室、厨房和卫生间;家具从床板、衣柜挂杆、烤箱、餐具抽屉,再到灯光模拟,一应俱全。甚至水槽表面的法线出了问题之后,Astra 还会自己返工。

为了制作 30 秒室内漫游,它还会把相机放在约 1.65 米的人眼高度,用 24—26mm 镜头安排四段运动;进入 Unreal Engine 5 之后,它又自己处理 FBX、JSON、米和厘米的单位差、坐标转换、材质映射、碰撞和第一人称控制。

当通用模型也能做 3D 了,专业 3D 生成模型的价值会发生什么变化?

当下,3D 工具的使用者,正逐渐从人 扩展 为 Agent。稳定的生成质量之外, 专业 3D 能力能否被 Agent 理解、调用,并用于后续修改——产品是否 Agent-Ready,正在成为 3D 生成下半场的新门槛。

事实上,前沿通用模型与专业模型的能力之间,并不需要被划成非此即彼的两边。前者能够理解创作目标、调用不同工具,也擅长通过代码生成规则几何体与重复性结构;以 Hyper3D 为代表的专业 3D 生成模型则擅长复杂形体、精细几何和材质的生成。两者可以在同一项任务中协作,也意味着更多人可以通过 Agent 开始创作,专业 3D 能力有机会进入更多工作流。

基于这一理念,Hyper3D 近日上线了最新的智能交互功能 Agentic Mode,将 Hyper3D Rodin 与 LLM 多模态上下文分析能力整合进同一流程,实现自主理解、优化输入,再根据任务选择最合适的建模路径。

值得关注的是,这次更新不只是让生成过程更省事,还把生成能力进一步拓展到工业设计建模——从带尺寸的产品图纸出发,生成可以继续调整的三维模型。

它不是绑定某个通用模型的专属入口,而是内置于 Hyper3D 的能力,让人和不同 Agent 都更容易使用专业 3D 能力。在这个过程中, 人依然决定创作目标、评判设计取舍,Agent 则可以承担越来越多的具体执行。

01

从创意资产到工业建模,

Agentic Mode 补上了什么?

在进行 3D 生成时,「输入」这一步其实就存在着隐形门槛。

一辆摩托车的参考资料里,可能混着整车正面、侧面、仪表盘、发动机和排气管特写;一张角色设定稿同时画着正面、背面、武器和配件;工业设计人员递过来的,则可能是一张带尺寸标注的产品图纸。

为了更接近想要的生成效果,这些资料在进入生成模型以前,人已经做了不少预处理:先清背景、挑参考图、判断哪些画面属于同一个主体,哪些图片负责整体轮廓,哪些只补充局部细节,再决定这次应该用哪条建模路线。

Agentic Mode 首先接手的,就是这部分往往被当作准备工作、却直接影响生成效果的专业判断。

借助 Agentic Mode,系统可以先从一张并不标准的素材里判断什么才是主体、哪些视觉信息需要保留,再按需增强输入,对不可见部分进行合理推演,减少人工素材预处理与反复调试。

比如这里,左半边是我随手拍下的吴越王钱镠塑像,由于拍摄时是阴天,也没有讲究太多拍照手法,导致除了人物面部不清晰之外,人物手中的弓箭也与背景交错在一起。

在输入这张单一视角的图片后,Agentic Mode 不但精准识别补充了面部细节,也没有将弓箭与树枝混为一谈。甚至转到人物背面图时,衣服的行制与纹理也均与正面图相吻合。

到了工业设计图纸、产品多视图等场景,输入理解的重要性会更加明显。一组参考资料里既有整体,也有局部;不同视角可能属于同一个物体,还可能混着尺寸标注、结构示意和材质参考。系统需要先分清这些信息各自描述了什么,才能进行后面的建模。

以这个餐车案例为例,输入并不是一张普通产品图,而是一组带有尺寸、结构分区、局部说明和多视角信息的技术示意图。对传统 3D 建模流程来说,这类输入的难点不在于「看见图片」,而在于能否真正理解这是一份面向建模的工业化信息。

这恰恰是 Agentic Mode 的突破所在。它不只是降低输入门槛,而是把生成能力从创意资产延伸到工业设计等更广阔的应用领域,承接那些更强调结构理解、规格约束和可迭代性的建模任务。对于产品概念验证、展示模型制作和工业设计前期沟通等场景,这类能力尤其具有现实价值。

理解输入之后,接下来还要判断合适的建模方式。这也是 Agentic Mode 与简单模型调用拉开差别的地方之一,Agentic Mode 会根据任务自主选择最合适的建模路径。

Agentic Mode 对 Low-poly N-GONS 模型支持可以通过自然语言驱动的参数化控制、动画预设与材质增强等后续编辑功能。这些能力与 Agentic Mode 的输入理解、建模规划相衔接,共同支持「生成、检查、再修改」的创作流程。

最让人惊喜的是下面这个机械手的生成案例,最终模型不只要把机械结构做出来,关节本身还需要能够继续调整和运动。在这一案例中,Agentic Mode 在生成 Low-poly N-GONS 模型后,继续给模型加入动画预设,用动态效果检查关节运动。

在这个案例中,我们也可以清楚看到,生成完整的耳机细节图之后,无论想更改材质、纹路还是颜色,都能通过拖拉拽的方式一键完成。

可以看出,Agentic Mode 要做的,不只是生成一个高质量的模型,而是把生成全流程中的更多专业判断交给 AI。从创意资产到工业建模,读懂设计资料、选择建模方法、生成后继续调整的单独动作被连成了一个完整过程。

02

3D 生成进入「Agent 时代」

内容资产从可生成,到可以进入真实 Agent 工作流的 Agent - Ready 状态,不是 3D 生成独有的变化。

视频生成行业已经经历了类似的演进。

前几年 SeedDance、Runway、Kling 的竞争中,大家的竞争重点都放在了可以生成几秒,画面有多清楚,人物细节与表情是否稳定,镜头运动能不能成立。

等到单次生成越来越强,竞争随即从生成转向 Agent 工作流维度。例如,Google 今年为 Flow 加入了 Agent,可以在用户控制下处理多步骤创作、生成多个方案、批量编辑并整理素材;Flow Tools 还支持用自然语言创建定制工具与工作流。专业产品开始把原来分散的操作,组织成能够持续推进的创作过程。

这个过程中,随着视频模型越来越强,专业产品开始把过去散落在人脑子里的制作方法成 Agent 能力的一部分:什么时候用哪个模型,什么地方值得重新生成,什么地方局部编辑就够,第一轮应该追速度还是质量,几十个镜头之间怎样保留人物和素材状态。而对模型来说,能够更好支持 Agent 工作流的玩家,也明显会拿到更多筹码。

回到 3D,类似的变化还要面对三维资产自身的要求。

对于视频生成来说,用户想要什么样的效果、可以选择什么样的路径,普通人就可以用一些自然语言描述清楚,但是在 3D 生成场景中,要读懂任务并不容易。需要能够理解平面图、立体图与尺寸图之间的复杂联系,并且能够将这些复杂联系变成生产路径中的环环相扣的执行。

现在,这些对小白来说难如登天,对专业人士来说过于繁琐的细节,已经全部可以借助 Agentic Mode 交给 Agent 来实现。

此外,生成内容是否可以被修改、可迭代, 能否 适应 具体 的落地场景,也是 专业 3D 生成中的关键要求。

一个视频片段生成以后,还有剪辑和后期;一个 3D 资产生成以后,也可能需要几何编辑、拓扑调整、材质处理、尺寸修改、分件、骨骼绑定和动画,再根据用途进入游戏引擎、AR、3D 打印或仿真环境。

同一辆汽车放进商品展示、赛车游戏和机器人仿真场景,对外观、部件结构和后续处理的要求,并不相同。

相比 Astra 展示出了完整的长链路推进能力,在更具体的 3D 资产生产里,专业模型还在解决另一组问题:复杂形体怎样生成,几何细节和材质怎样满足目标,生成之后,局部能不能被控制与修改?这些能力可以成为 Agent 完成任务时调用的专业工具。

相应的,通用模型和专业 3D 模型之间很难被一句「 GPT 已经会 Blender 了」抹平差距。

模型能力的上限天花板之外。即使未来通用模型把生成能力继续往前推,专业 3D 生产里仍然藏着大量 Know-How:输入应该怎么整理,哪种对象走哪种方法,什么时候保留现有资产继续修,什么时候推倒重做,需要进游戏的东西应该提前拆哪些部件,要去仿真的资产又要留下什么结构。

尤其对真实生产场景来说,这些经验还关系到成本的实际问题。当方案有了变化,是只能再生成一个看起来差不多的模型,还是可以针对已有结果继续调整,专业判断能否被 AI 承接,这些都会直接影响修改的成本和工作流的连续性。

Hyper3D 在 Agentic Mode 之前,就已经开始为 Agent 使用专业 3D 能力做准备。例如,Hyper3D Rodin 的生成能力可以通过 MCP 接入 Codex、Claude Code 和 Kimi Code CLI 等智能体。

全球越来越多的创作者正在用「GPT-6+Hyper3D MCP」进行 3D 内容创作

看上去只是多了一种调用方式,却替用户省掉了过去很繁琐的手工操作:接上 Hyper3D MCP 后,在 Codex 或 Claude Code 里做项目的 Agent,需要一个 3D 模型时,可以直接调用 Hyper3D Rodin 的生成能力、等生成完成、拿回结果,不必再打开另一个网页,重新上传素材、等待生成、下载文件,再搬回原来的工作环境。

但 MCP 只能解决部分效率问题。在 3D 内容生成中,更多的 know-how 与时间消耗,其实藏在如何解读用户输入、应当选择什么样的建模路线,以及最终的微调要如何细化。这正是 Agentic Mode 要进一步接手的部分。

从这个角度看,Hyper3D 的更新并不是一次突然转向,而是此前围绕真实生产积累的能力,开始面向新一代使用者重新迭代。

03

从 Production-Ready 到 Agent-Ready,

专业 3D 能力如何走向更多人?

把 Hyper3D 过去几年的产品更新串起来看,会发现它前半程一直在解决同一个问题:先让资产可用、可控、能进入生产管线。在这个过程中,核心 3D 生成模型 Hyper3D Rodin 不断迭代,推出自然语言编辑 3D Editing、递归分件 BANG、可控生成 3D ControlNet 等独家可控能力,构成了它对 Production-Ready 的回答。

到了 3D 生成的 Agent 时代,这条产品路线又向前走了一步:界面层通过 MCP 连接外部 Agent,输入层由 Agentic Mode 理解素材、规划建模路径,互动层则提供自然语言编辑、分件等可控能力。Hyper3D 正在把原本由专业用户逐项操作的工具,拓展成能被 Agent 持续使用的 3D 工作台。

这也带来了一个过去很难同时成立的变化:

一方面,3D 内容生成加速向工业设计、游戏资产、仿真、训练这些更复杂、对专业性要求更高的场景落地。

另一方面,使用它的人却可以越来越不专业。用户甚至不需要了解建模背后有几种模型,不需要了解 Blender 与拓扑到底是什么东西,就能生成足够专业的 3D 内容资产。

Agent 没有消灭专业内容生成的复杂性,只是把输入整理、模型选择、生成、修改和后处理之间的大量判断接了过去,成了系统能力的一部分。

于是,一些过去受制于建模成本、来不及反复验证的设计想法,有了更容易进入 3D 创作的机会。

例如,对一个工业设计团队来说,一份产品草图或带尺寸的参考资料,可以先转成可讨论的三维方案;在一个游戏中,不止 BOSS 与核心场景值得被认真制作,小兵与地图的边缘也开始被关注;在具身智能模型训练团队中,一些稀少的 Corner case 除了能用仿真数据模拟,还可以通过 3D 建模生成更逼真的效果;对一个家装设计团队来说,设计师构思好设计概念后,就能立刻完成草图与场景建模,OPC 成为可能。

对创作者来说,重要的不是从此不需要专业知识,而是更少被准备素材和反复操作拖住,能把时间留给方案本身。

技术进步叠加交互方式变革,让 3D 建模成为任何任务中都能够被随机调取的能力。率先将 Agentic 能力引入 3D 生成领域的 Hyper3D,正在让这一切成为现实,而这也才是3D 内容生成进入 Agent 时代的真正价值所在。

*头图来源: Hyper3D

本文为极客公园原创文章,转载请联系极客君微信 geekparkGO

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论