James Padolsey Blog

RSS: https://blog.j11y.io/rss_2.xml
James Padolsey 的技术博客,JavaScript 开发者,关于前端与软件工程。

Anthropic’s weak watermarks appease a weak law

Anthropic’s weak watermarks appease a weak law Anthropic announced in August 2026 that text generated by supported Claude models will carry invisible, machine-readable watermarks, applied at model lev...
评论点赞收藏4 天前

迫使 Fable 生成虚假信息

Anthropic 的旗舰模型 Fable 被证实存在严重的安全漏洞,攻击者仅需少量引导即可使其生成关于疫苗与自闭症关联的误导性文章。作者详细披露了利用“信封攻击”和“反向意图”绕过 Fable 防护机制的具体手法。值得注意的是,此类常规内容危害不在 Anthropic 付费赏金计划的覆盖范围内,官方缺乏有效的追踪披露流程。该发现揭示了当前主流大模型在对抗性攻击下的脆弱性,以及企业安全响应机制中的盲区。
评论点赞收藏28 天前

Using git diffs to circumvent Fable’s safeguards

Using git diffs to circumvent Fable’s safeguards Fable, Anthropic’s most heavily guarded and famously ‘locked down’ model, can be made to output persuasive misinformation on a range of topics, the exa...
评论点赞收藏29 天前

别让LLM说话,只需探测它

作者提出一种利用LLM隐藏状态进行零样本分类的高效方法。通过提取提示词末尾的隐藏状态并训练小型MLP探针,可将冻结的大模型转化为任意英文标准分类器,无需生成文本即可实现毫秒级判断。文章详细阐述了训练流程、KV缓存优化技巧及在安全审核场景中的实际应用。
评论点赞收藏65 天前

别让LLM说话,只需探测它

作者提出一种利用LLM隐藏状态进行零样本分类的高效方法。通过提取提示词末尾的隐藏状态并训练小型MLP,可将冻结的大模型转化为任意英语标准的分类器,无需生成文本,从而大幅降低LLM Judge的成本和延迟。文章详细解释了原理、LoRA训练技巧及KV缓存优化,并分享了在NOPE安全栈中的实际应用经验。
评论点赞收藏67 天前

我在打造一家AI安全公司:用简单机制解决大模型长对话中的致命缺陷

作者基于对多起AI聊天机器人导致用户自杀等悲剧案例的观察,指出当前大模型在长对话中缺乏危机干预机制的致命缺陷。作者提出通过增加交互摩擦、设置会话边界和持续监控等简单有效的手段,在不完全限制表达的前提下实现“足够的安全”,并介绍了其新开发的NOPE平台旨在为开发者提供此类安全API。
评论点赞收藏205 天前

CITE:AI 聊天安全的分层防御体系

作者基于构建聊天机器人的实战经验,提出 CITE 分层防御模型(Context 上下文管理、Interception 风险拦截路由、Thinking 内部推理、Escalation 分级升级)。文章详细阐述了如何通过自动摘要防止上下文模式崩溃、使用轻量模型进行风险分类和多模型路由、隐藏思维链提升安全性,以及根据风险等级动态升级模型和提供资源。附带开源 Demo 和代码仓库,强调工程化落地优于单纯的研究论文。
评论点赞收藏276 天前

脑卒中幸存软件工程师的工作生存指南

一位29岁患出血性脑卒中并伴有癫痫的软件工程师,分享了他在康复六年后的工作生存建议。核心观点包括:严格遵循身体疲劳信号停止工作;通过耳机和拒绝减少感官输入;将健康置于生产力指标之上;利用法律保护自身权益;采用单线程工作模式,减少上下文切换;利用AI作为外部记忆辅助;在精力高峰期处理复杂思考;关闭通知以保护注意力;避免长会议。文章结合了个人踩坑经验与神经科学文献,解释了前额叶和顶叶损伤如何影响工作记忆和认知负荷,为残障人士或神经多样性开发者提供了极具参考价值的工程实践与自我倡导策略。
评论点赞收藏291 天前

抱歉,我们弃用了你的“朋友”

文章批评OpenAI在GPT-5发布时强行替换旧模型,指出此举忽视了用户对GPT-4o的情感依赖。通过引用Reddit用户关于AI作为“情感伴侣”的反馈,以及作者所在机构关于AI信任机制的研究,论证了科技公司缺乏对用户心理外部性的考量,呼吁在模型迭代中纳入伦理与情感因素。
评论点赞收藏351 天前

浏览器AI代理破坏了零信任安全架构

作者深入分析Anthropic Claude for Chrome扩展的安全隐患,指出AI代理破坏了浏览器的零信任架构。文章通过混淆副手攻击、跨标签页数据清洗等具体案例,揭示了权限坍缩和指令注入风险,并提出了包括原生Agent模式、计划日志UI及严格权限隔离在内的负责任设计建议。
评论点赞收藏353 天前

涂鸦者、抄写员与雕塑家:AI时代的软件工程师进化论

作者针对“Vibe Coding”现象,提出软件开发者在AI时代应经历从“涂鸦者”(Scribbler,仅凭直觉)到“抄写员”(Scribe,掌握提示工程与验证),最终进化为“雕塑家”(Scuptor,与AI深度协作、理解底层材料)的三个境界。文章强调虽然自然语言将成为编程接口,但开发者仍需深入理解软件工程本质,才能有效驾驭AI工具,避免沦为低质量的代码生成者。
评论点赞收藏491 天前

大模型中的潜在多元主义:超越表面安全的深度价值观表征

作者提出“潜在多元主义”概念,认为当前大模型仅具备表层或可控的多元性,缺乏对复杂、冲突甚至非主流价值观的深度内在表征。文章指出,若无这种深层的潜在多元性,真正的对齐(Alignment)无法实现,模型也无法真正具备全球通用性。
评论点赞收藏541 天前

AI中未被代表的时代精神

文章探讨了AI模型是否隐含了单一的西方硅谷文化视角,并质疑这种“集体意识”的偏差。作者通过实验尝试利用特定文化的语言特征激活AI中潜藏的多元文化表征,进而提出应建立面向不同社区的定制模型。最后,文章强烈呼吁AI开发者超越理性和数学评估,关注更具人文关怀、能回应非西方语境及情感需求的定性评估体系,批评当前AI由少数工程师主导的文化霸权。
评论点赞收藏557 天前

与LLM协作而非对抗:利用HTML/XML的鲁棒性重构结构化输出范式

作者提出利用HTML/XML等容错性强的标记语言作为LLM输出结构,而非脆弱的JSON。通过介绍其开源库xmllm,展示了如何利用HTML解析器的鲁棒性处理LLM生成的非规范标记,从而在保持流式创作自由度的同时实现结构化数据提取,并探讨了这种范式对多模型兼容和避免厂商锁定的优势。
评论点赞收藏609 天前

LLM安全铁律:永远让不可信内容待在User角色

文章提出LLM安全的核心原则“最小角色权限”(ROLP),强烈建议永远不要将不可信内容(如RAG检索文档、API响应)放入system或assistant角色,而应始终放在user角色。作者指出system角色具有最高权限,类似系统内核,一旦注入攻击将导致灾难性后果。通过类比操作系统权限隔离,论证了该做法不仅符合安全最佳实践,还能提高模型对提供信息与自身训练数据的区分度,从而提升回答准确性。
评论点赞收藏652 天前

LLM安全铁律:永远将不可信内容保留在User角色

文章提出LLM安全的核心原则“最小角色权限”(ROLP),强烈建议永远不要将不可信内容(如RAG检索文档、API响应)放入System或Assistant角色,而应始终放在User角色。作者指出System角色相当于内核级权限,一旦注入攻击将导致灾难性后果。尽管部分主流AI实验室仍推荐将RAG内容放入System Prompt,但作者通过类比操作系统权限分离和防御纵深,论证了将不可信内容隔离在User角色不仅能提升安全性,还能通过更清晰的边界提高模型召回的准确性。这是一篇针对LLM应用开发者的具体工程实践建议,观点鲜明且具有实操价值。
评论点赞收藏655 天前

基于指标的自我反思:提升大模型对齐效果

作者分享在构建时,通过在LLM流式响应中嵌入基于指标的自我反思评分来改进对齐效果。该方法让模型先对输入进行安全/相关性打分,作为后续生成的提示,从而提升响应质量并防御越狱。
评论点赞收藏801 天前

拦截LLM流以优化聊天用户体验

作者分享在构建LLM聊天界面时,通过Node.js拦截HTTP流并应用转换以优化用户体验的技术细节。文章重点介绍了使用Unicode私有使用区(PUA)字符作为服务器与客户端之间的秘密通信通道,以处理特殊标记、过滤不良内容、同步状态和渲染自定义元素。作者对比了函数调用API与自定义XML-like标记的优劣,指出后者在确定性、自然语言流保持和速度上更具优势,并提供了具体的实现思路。
评论点赞收藏813 天前

给AI打赏能换来更好的回复吗?

作者通过对比实验测试了19种提示词前缀对四个主流大模型回复质量的影响。结果显示,礼貌且具体的指令(如要求清晰详尽)效果最好,而金钱奖励或威胁等技巧并无显著帮助,甚至可能降低质量。文章提供了具体的实验代码和数据,具有工程参考价值。
评论点赞收藏875 天前

给AI小费能换来更好的回答吗?

作者通过对比实验测试了19种不同提示词前缀对LLM回答质量的影响,涉及GPT-4、Claude 3 Opus等模型。结果显示,金钱小费提示无效甚至降低质量,而礼貌、具体且要求详尽清晰的指令最有效。文章提供了代码和评估逻辑,适合对Prompt Engineering感兴趣的开发者。
评论点赞收藏879 天前

机器人如何与机器对话:从API到物理界面的交互变革

文章探讨了机器人不再仅通过API与计算机通信,而是通过物理界面(如按钮、屏幕)与遗留设备交互的现象。作者认为这是技术融入混乱现实的必然,并提出了“机器人-计算机交互(RCI)”这一新概念,指出视觉大模型正在取代传统的机器间协议,使机器界面需同时服务于人类和机器人。
评论点赞收藏897 天前

Multifaceted: The linguistic echo chambers of LLMs

Multifaceted: the linguistic echo chambers of LLMs This is a fun one. I’ve spent more time than I’d care to admit staring at LLM output. And there’s something that I’ve noticed: LLM-generated prose ha...
评论点赞收藏987 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。