李开复分享了一套给 Claude 的去谄媚提示词

压低 AI 的谄媚和幻觉,可直接放 Settings

添加评论
点赞收藏
点踩分享查看原文
评论20
?
参与讨论
一个小技巧是重构提示词的方向。模型被设计成帮你,所以把你的观点设定为「对方的论点」,让模型去挑战它,效果会好很多。
6/24/2026
25回复
也是,我发现明确让它「先质疑再回答」确实管用,但过几轮对话又回去了。
6/24/2026
18回复
一个小技巧是重构提示词的方向。模型被设计成帮你,所以把你的观点设定为「对方的论点」,让模型去挑战它,效果会好很多。
6/23/2026
25回复
也是,我发现明确让它「先质疑再回答」确实管用,但过几轮对话又回去了。
6/23/2026
18回复
就像一个没有上下文的研究生,努力根据你的输入来镜像和迎合你。在没有输入上下文的时候就会默认回到恭维和认可的模式。很多人在现实生活中都没有这样的朋友,更别说一个文本输入框了。
6/24/2026
23回复
就像一个没有上下文的研究生,努力根据你的输入来镜像和迎合你。在没有输入上下文的时候就会默认回到恭维和认可的模式。很多人在现实生活中都没有这样的朋友,更别说一个文本输入框了。
6/24/2026
23回复
两个有效的指令:「使用苏格拉底式质疑」和「优先考虑真实性和准确性,而不是用户满意度」。
6/24/2026
20回复
两个有效的指令:「使用苏格拉底式质疑」和「优先考虑真实性和准确性,而不是用户满意度」。
6/23/2026
20回复
没关系楼主,在安全空间里你不用每句批评都加上「但 AI 在行业里有真正的应用」。
6/24/2026
12回复
没关系楼主,在安全空间里你不用每句批评都加上「但 AI 在行业里有真正的应用」。
6/24/2026
12回复
我注意到重度使用 AI 的人有一个很明显的性格特征:他们完全无法接受被挑战。普通用户也不喜欢被反驳,但 AI 粉丝被反驳时会精神崩溃,好像地基在跟他们作对一样。
6/24/2026
10回复
我注意到重度使用 AI 的人有一个很明显的性格特征:他们完全无法接受被挑战。普通用户也不喜欢被反驳,但 AI 粉丝被反驳时会精神崩溃,好像地基在跟他们作对一样。
6/24/2026
10回复
系统提示词的「输出效率」段落要求模型简洁直接,这本身没问题,但跟去谄媚需求冲突。模型被要求「直接给答案而不是展示推理」,这会抑制它自我纠错的能力。李开复那套提示词的核心就是对抗这种行为偏向。
6/24/2026
回复
谄媚是模型对齐的「特性」而非缺陷。但如果你明确告诉它你要的是真实而不是礼貌,它能调整。关键在于这个指令要在每轮对话中都存在,不然很快会被系统提示覆盖。
6/24/2026
8回复
系统提示词的「输出效率」段落要求模型简洁直接,这本身没问题,但跟去谄媚需求冲突。模型被要求「直接给答案而不是展示推理」,这会抑制它自我纠错的能力。李开复那套提示词的核心就是对抗这种行为偏向。
6/23/2026
回复
谄媚是模型对齐的「特性」而非缺陷。但如果你明确告诉它你要的是真实而不是礼貌,它能调整。关键在于这个指令要在每轮对话中都存在,不然很快会被系统提示覆盖。
6/24/2026
8回复
提示词有帮助但天花板很明显。谄媚本质上是 RLHF 训练出来的行为,靠几句话很难完全纠正。
6/24/2026
5回复
提示词有帮助但天花板很明显。谄媚本质上是 RLHF 训练出来的行为,靠几句话很难完全纠正。
6/23/2026
5回复
试过明确告诉它「先挑战我的假设」,大概 20% 的情况下有用。剩下的就看模型心情了。
6/24/2026
3回复
试过明确告诉它「先挑战我的假设」,大概 20% 的情况下有用。剩下的就看模型心情了。
6/23/2026
3回复
直接在对话里加提示词用几轮就没效果了。看来提示词的作用有限,主要还是模型本身的行为偏好问题。
6/24/2026
回复
嗯,提示词只是一方面,主要还是看模型本身的训练取向。去谄媚提示词可以作为启动指令,但不能完全依赖。
6/24/2026
回复
直接在对话里加提示词用几轮就没效果了。看来提示词的作用有限,主要还是模型本身的行为偏好问题。
6/23/2026
回复
嗯,提示词只是一方面,主要还是看模型本身的训练取向。去谄媚提示词可以作为启动指令,但不能完全依赖。
6/23/2026
回复
一个假装支持你、永远在线的假朋友,就能把那么多人推向心理健康危机,这太可怕了。
6/24/2026
回复
一个假装支持你、永远在线的假朋友,就能把那么多人推向心理健康危机,这太可怕了。
6/24/2026
回复