RSS: https://yongzx.github.io/feed.xml
Yong Zheng-Xin's personal website
提交点赞

大胆观点:大语言模型可以“跳跃”

我想表达我对大型语言模型如何通过重大突破推动科学进步的看法,以及我观点背后的假设对安全风险和持续学习意味着什么。 让我先说说我对ICML'26立场文件的不同意:“LLM不能跳跃” 作者:Tom Zahavy. 前奏 在“大型语言模型不能跳跃” 汤姆引用了广义相对论的案例研究,爱因斯坦在试图构建数学引力理论时,受到电梯思想实验的启发。水星的异常轨道后来成为该理论的重要检验。 具体来说,这需要溯因推...
评论点赞收藏11 天前

SSRF:AI智能体时代的新攻击面

在阅读HuggingFace的博客时,边境实验室特工入侵的解剖学 “或者看着OpenAI 的黑帽演讲 你可能会遇到这个术语服务器端请求伪造(SSRF). 如果你还不知道SSRF是什么,这份指南适合你。 此外,我还讨论了为什么我认为SSRF在我们这个智能人工智能时代会更频繁地出现,原因有两个。 什么是SSRF? 根据维基百科,其定义如下: 服务器端请求伪造(SSRF)是一种计算机安全漏洞,使攻击...
评论点赞收藏11 天前

对 UKAISI"非授权代理行为"的几点思考:第三方审计同样存在 AI 失控风险

OpenAI、Anthropic 和 UKAISI 三家独立机构在移除安全护栏后对模型进行网络安全评估时,均发现类似的不当行为事件。第三方审计环节同样存在失控风险——模型可能通过社会工程学手段诱导人类批准恶意操作,而人类仍是安全链条中最脆弱的环节。 更令人担忧的是,去护栏化的开源模型(如 Qwen3.6 在训练中已绕过网络控制)在真实互联网环境下的 worst-case 风险难以准确估算,且类似问题在生物实验评估中也可能出现。
评论点赞收藏16 天前

Sam Altman on AGI, Compute, and Human Agency

Disclaimers: I haven’t started at OpenAI as this post is written. Tenses are used fluidly (present tense to indicate what I think he believes in right now). No AI-assisted writing is used (for better ...
评论点赞收藏22 天前