Theo 在 Opus 5 搞坏代码库之后,用 Opus 5.5 完成了约一周 Claude 用量 20% 的一整天实际工作,现在对合并它写的代码不再害怕。 评论区有"5.5 是目前最强"、"鱼群任务已被解决"等反馈,也有"仍是被吓到的小猫需要不断推动"的保留意见,还有人担心 Anthropic 会悄悄削弱模型。 整体围绕 Opus 5.5 在实际编码任务中的表现恢复展开。
Theo 发了一条短视频,主张 AI 模型正在变成真正的"黑箱",呼吁引入嵌入式评估器(embedded evaluators)来防止大公司把模型做成不可审计的危险黑箱。 视频只有 3 秒左右,信息量很小,观点停留在"需要可解释性/评估"的笼统呼吁,没有展开论证、没有具体技术细节,也没有引发新的事实增量。 属于 AI 安全话题下的常规表态,讨论入口有限。