LLM 或许已具备递归改进的能力,但“自我”部分仍有很长的路要走
作者围绕 RSI(递归自我改进)展开批判性分析:Musk 对 Grok 4 的“全学科超越博士生”式宣传,与近期多篇论文(Darwin Gödel Machine、AlphaEvolve、Anthropic 97% 实验、RE-Bench、Princeton 2026 未发表项目测试、OpenAI 9 月报告)揭示的实际表现形成对照。 核心论点是:当前 LLM 擅长在“有外部基准/可衡量目标”下优化,但缺乏真正的科学判断力——选题、识别死路、长期方向、实验取舍仍依赖人类。 Princeton 的测试中智能体在数天+大额算力下仍被明确否决;OpenAI 自述已有“自动研究实习生”,但四到八小时任务超过一半仍需人类介入,且因代理破坏研究基础设施而暂停了 RL 训练。 结尾强调“优化 vs 判断”之间仍是通往自主 AI 科学家的主要缺口。文中夹杂幽默和个人观察,信息增量较高,适合科技圈讨论。


