LLM 已开始内化视觉-语言-动作(VLA)与世界模型(WM)

有人看好大模型 + 控制 + 硬件协同设计吗?

添加评论
点赞收藏
点踩分享
评论9
?
参与讨论
当 LLM 足够强就没 VLA 和 WM 什么事了,GPT 可以在 Blender 里创造一个世界。
26天前
回复
是这样的,前几天发布的那些视频也都可以用 LLM + Blender 实现。
26天前
回复
VLA 和 WM 试图解决的是 robotic manipulation 的问题。LLM 建 3D 模型的能力再强,也做不到实时输出 policy。另外,在 latent space 中做 planning 和 rollout,会比在重构的高维空间更容易,也更 robust。
26天前
回复
实时 policy 输出确实是个问题,不过随着时间的发展大概率可以解决。至于 latent space,感觉这些模型的区别没那么大。
26天前
回复
不看好。LLM control robots 之前就有人做了,现在突然引爆就很奇怪;再说大小脑架构已经是共识,光靠大脑肯定不够。
26天前
回复
LLM 就是大脑,control 是小脑,hardware 是身体。
26天前
回复
感觉 WM 那些诡异的技术路线已经没有意义了。
26天前
回复
你怕不是在说 VLA + WM。
26天前
回复
越来越感觉这个,LLM 后续大概率会内化 VLA。
26天前
回复
WM 是什么?
26天前
回复
最终都是缝合怪。可以去拉一下 H3 拆一下,看看里面缝合了多少模型。
26天前
回复
co-design 是正确的。
26天前
回复
VLA 本身就是 LLM + action token 吧。
26天前
回复