LLM 对比 Jev:没有额外文本时,它们会犯怎样的错?
作者以《地球最后的男人》结尾反转为题,设计了三个变体难题,分别让 TypeSafe 的 Jev 和五个前沿大模型作答,比较它们在"有无额外文本/提示"条件下的错误率与推理风格。 核心看点是:Jev 被作者认为可视为"会犯错的系统",但通过额外文本可以显著降低失误;多个前沿模型在没有引导时更容易掉进语义陷阱。 文章提供了具体题目、各模型回答摘录和作者判断,是一篇短平快的 LLM 能力评测随笔。适合 HN 读者对"模型鲁棒性 vs 提示工程"展开讨论,但缺乏方法论深度和复现细节,互动入口有限。 










