实验的时代
OpenAI 安全研究团队 Thomas Dullien 在 BlueHat Asia 2026 的演讲:LLM 让软件进入"语义不确定性时代"——确定性在硬件(Rowhammer)、时间(Spectre)和语义(LLM)三个层次接连瓦解。 作者主张把 LLM 工作流当作概率系统来对待:每个 prompt 改动都是一次假设检验,需要控制方差、配对实验("番茄农夫协议"),并警惕置信区间过窄的陷阱;他还类比 LLM 代码审查更像 fuzzing,安全漏洞管理应借用渔场模型(只跟踪捕捉率而非总量)。 核心判断:短期内 harness/prompting 的价值会持续被新模型吸收,工程人员必须转型为"业余统计学家"。有清晰立场、可争论观点和具体方法论,科技读者讨论入口多。