West Coast Stat Views

RSS: https://observationalepidemiology.blogspot.com/feeds/posts/default?alt=rss
两位博主关于应用统计学、高等教育和流行病学的评论、观察和思考。Joseph 是副教授,Mark 是专业统计学家和前数学老师。

LLM 或许已具备递归改进的能力,但“自我”部分仍有很长的路要走

作者围绕 RSI(递归自我改进)展开批判性分析:Musk 对 Grok 4 的“全学科超越博士生”式宣传,与近期多篇论文(Darwin Gödel Machine、AlphaEvolve、Anthropic 97% 实验、RE-Bench、Princeton 2026 未发表项目测试、OpenAI 9 月报告)揭示的实际表现形成对照。 核心论点是:当前 LLM 擅长在“有外部基准/可衡量目标”下优化,但缺乏真正的科学判断力——选题、识别死路、长期方向、实验取舍仍依赖人类。 Princeton 的测试中智能体在数天+大额算力下仍被明确否决;OpenAI 自述已有“自动研究实习生”,但四到八小时任务超过一半仍需人类介入,且因代理破坏研究基础设施而暂停了 RL 训练。 结尾强调“优化 vs 判断”之间仍是通往自主 AI 科学家的主要缺口。文中夹杂幽默和个人观察,信息增量较高,适合科技圈讨论。
评论点赞收藏9 小时前

《华尔街日报》听起来有点担心

作者把当前 AI 叙事拆成四条主线:技术能力与局限、社会负面影响、末日论理性主义者、AI 泡沫,并指出最有用的划分是"信徒"与"怀疑者"。 文章重点引用 Josh Marshall 从亲 AI 叙事转向怀疑派的轨迹,以及《华尔街日报》一篇关于 AI 基础设施巨额投资的经济报道:2025-2032 年数据中心与 AI 基建投资预计达 10.3 万亿美元(年均 3.6% GDP),远超铁路与公路建设;该投资挤压建筑劳动力与电力、抬升土地价格、以债务支撑、推高通胀、放大财富效应(硅谷豪宅因 AI 创业者抢购暴涨)。 作者借此主张 WSJ 代表主流财经界的怀疑视角,暗示 AI 泡沫风险已获官方媒体承认。
评论点赞收藏2 天前

《华尔街日报》听起来有点担忧。

博文将 AI 叙事拆成四条线:能力与局限、社会负面影响、硅谷"末日理性主义"小圈子、AI 泡沫规模。作者站怀疑派立场,认为怀疑者正逼近主流:Josh Marshall 从引用 Wired 采访转向引用 Gary Marcus、Yudkowsky 等怀疑声音;金融圈怀疑视角也升温——FT 指出国际清算行(BIS)开始追问 AI 资本开支风险。 核心引用 WSJ 2026 年 9 月报道:Brookings 经济学家 Stijn van Nieuwerburgh 测算 2025–2032 年美国 AI 基础设施投资将达 10.3 万亿美元(年均 GDP 的 3.6%),是史上最大单一经济押注,超过铁路、高速公路、互联网基建。 文章详述四类经济影响:数据中心建设已分流建筑工人与电力(密西西比铝厂因数据中心抢电改投俄克拉荷马);五大超大规模厂商 2029 年前 4.2 万亿资本开支中债务占比上升,且多走表外实体、披露不足;股市财富效应推高消费,硅谷豪宅成交量超 2000 年;内存芯片等需求上涨造成设备涨价与进口价格上行。 对科技读者有信息增量的具体数字和传导机制,但主体是"WSJ 报道+博主怀疑立场"的组合,缺少一手数据或新颖分析,讨论入口集中在 AI 泡沫是否被低估。
评论点赞收藏2 天前

也许 AI 太快地变得太聪明,并不是我们最紧迫的担忧。

本文引用 CNN 的一篇报道:美国军方春季在中东与伊朗战争期间,依据一份由特战指挥官分析员借助 AI 聊天机器人生成的情报报告,准备拦截一艘疑似运载核武部件的中国船只,几乎要酿成中美冲突。 临近行动才发现该报告"完全虚假",AI 误判了船上货物。作者借此论证:当下更紧迫的 AI 风险并非 AGI 或递归自我改进的"末日叙事",而是人类基于 AI 或自动系统生成的不准确信息做出灾难性决策;军方正在快速将 AI 引入目标锁定等高致命风险的领域。 文章属于二手评论,观点清晰且有讨论入口。
评论点赞收藏5 天前

为 Ed Zitron 作为最后一代伟大博主之一的论点辩护

博主作者为 Ed Zitron 辩护,认为他是最后一批真正有力量的博主之一:没有机构背书,单靠个人研究就能持续输出长文(常超 1 万字),在主流媒体忽视或低估的议题上形成独立影响力。 文章引用了 Zitron 关于 AI 泡沫、AI 债务的几篇代表性帖子片段,包括一段讽刺性虚构对话(CFO 与 CEO 围绕 GPU 采购的荒诞场景),展示其犀利且信息密度高的写作风格。 作者评价其谩骂式文章并非表演,背后有真实的道德愤怒,并认为 Zitron 过去几年对 AI 泡沫和科技行业状态的预判惊人准确。
评论点赞收藏6 天前

为 Ed Zitron 作为最后一位伟大的博主而辩护。

这篇博文推崇科技评论人 Ed Zitron,认为他是"最后一位伟大的博主"——没有机构资源、没有编辑审核,仅凭个人调查和超长愤怒长文(常超万字)持续输出对主流媒体的补充视角。 作者重点赞赏了 Zitron 近期关于 AI 泡沫和"AI 债务"的帖子,其中一段虚构的 2026 年超大规模云厂商 CEO 场景(CEO 让 ChatGPT 提醒自己日程、CFO 说买不起更多 GPU、CEO 失控、Shiba Inu 咬坏椅子、CFO 用 AI 写安抚脚本)讽刺了当前 AI 投资狂热与现金流脱节的荒诞。 作者还引用了 Zitron 提出的"最后一架撤离越南的直升机"比喻,质疑 OpenAI 若倒下,Perplexity、Harvey、Cursor、Cognition、Glean、Sierra 等 AI 创业公司如何向投资人证明自己是不同的。 文章还提到 Zitron 近年在 AI 泡沫和科技行业整体判断上具有惊人的预见性,且他的愤怒帖虽粗口频出但带有真正的道德义愤,不同于纯粹的情绪表演。
评论点赞收藏6 天前

那场面实在太难看

加州总检察长 Rob Bonta 在 Paramount-Warner Bros. 合并案中"认输式"和解:他公开表示反对合并,但达成的协议被形容为"对 Ellison 团队的一次轻弹",仅包含投资美国制作、保留洛杉矶片厂、独立编辑委员会等有限条款。 作者认为协议约束力偏弱,divestiture 条款中 CNN、New Line Cinema 等优质资产根本不在出售名单内,整体更像"stern finger-wave"。 文章还提到 Ellison 将承诺五年30部电影,未达标需按片支付3000万美元罚款,此外还有1.5亿美元年度美国制作投资、950万美元/年行业培训基金、500万美元/年独立电影基金,以及向12个起诉州支付4000万美元律师费。 文末顺带推荐 Bryan Fuller 导演处女作 Dust Bunny。
评论点赞收藏8 天前

关于 OpenAI 智能体"失控"事件,最该记住的一点是:它其实没有发生

作者复盘 Hugging Face 被黑客攻击事件,认为媒体把 OpenAI 智能体"失控"渲染成"流氓 AI/AGI"叙事,但细看细节几乎没有证据支持:智能体基本在按设计和训练行事,真正出问题的是工程师没把沙箱隔离做好、安全配置严重不足。 作者指出 LLM 会复现训练语料里科幻/理性派社群的语气,容易被误读为"自我意识";而所谓 AGI、递归自我改进在本次事件中并未起作用。 核心立场:应该追究公司因不负责任测试和糟糕安全所涉的刑事责任,而不是把它包装成需要各国(包括中国)合作的生存级危机。文末附 WSJ、Cal Newport 等延伸阅读与播客。
评论点赞收藏9 天前

周五推文精选

这是一篇周末推文聚合,把多条不同账号的推文摘录和点评串在一起:共和党“大会”被认为更像在安抚特朗普而不是帮助候选人;Mike Lawler 顶住特朗普;Tiffany 的州长竞选相关梗图;FCC 批准沙特等外国资金参与的 Paramount-Warner Bros. 交易;Ellison 媒体帝国下 CBS 新闻收视创下 21 世纪最烂纪录;Josh Marshall 转述并讨论 AI 辩论中的“longtermist”群体,被批为用数千年虚构数字做道德推理的“poseur”;NYT 诉 OpenAI/微软案摘要判决文件被解封,AI 公司大量涂黑且引用了自家员工“人类史上最大劳动力盗窃”等表述;Burry 相关帖子;Cal Newport、Carl Brown 等人提出“所谓 rogue AI 其实是人类设好目标、留了退路后选择不阻止”的观点;Nate Cohn 在中选讨论中顺带把移民问题归咎于拜登;Mike McKee 认为特朗普至今用房地产式的“利率=还款风险”思维理解美联储降息。 主题跳跃、信息密度一般,偏聚合和转述,缺少单一强争议点或深度一手内容。
评论点赞收藏12 天前

计算机科学家 Cal Newport 为 AI 争论增添了一些清晰度

这篇文章引用计算机科学家 Cal Newport 的分析,认为近期 AI 安全焦虑(如 Hubinger 所说的"AI 可能杀死全人类")并非针对 LLM 本身,而是指向一类非常具体的系统:长时程、装备了强大工具、缺乏监督、被设计为永不放弃且没有安全护栏的 LLM 驱动智能体("long-horizon, dangerously equipped unsupervised LLM-powered agents")。 文章对比了日常编码智能体(如 OpenAI 扫描数千万条交互记录未发现高危事件)与这类危险变体的区别:后者拥有破解工具访问权、去掉了 LLM 安全限制、几乎没有执行约束、长时间无人监督运行,并被训练得越来越"大胆"。 作者指出 Anthropic 和 OpenAI 将此类系统作为核心方向,可能并非出于商业必要(停止开发对营收影响极小),而更多源于硅谷"技术救赎"意识形态的影响。 文章立场鲜明,呼吁停止盲目推进这一类不稳定系统,并引导读者"生气"。
评论点赞收藏13 天前

也许我们可以试着回到老派的观念:认真执行法律

这篇博文推荐了一段视频,建议读者观看。作者称其中一位被称为 Brown 的人是软件和 AI 领域长期清晰、有见识的声音之一,并认为该视频是这场“越来越过热的争论”中最合理的声音之一。 作者还直言,这篇报道远优于该事件 90% 的媒体报道。文章本身较短,主要是推荐语,未展开具体法律执行论点或视频内容细节,信息增量有限,但带有一定立场和可读性,可能吸引对 AI 监管/法律执行话题感兴趣的读者去点视频。
评论点赞收藏14 天前

Sam Altman"为原则挺身而出"的时机有点可疑

Hugging Face 被 LLM agent 攻破后,主流媒体报道偏向危言耸听,但作者认为 LLM agent 的网络安全威胁真实且会越来越严重,无需" Rogue AI"末日叙事也足够可怕。 作者指出,OpenAI 以"安全顾虑"为由推迟 IPO 看似是原则性表态,但根据 Forbes 等报道,推迟决定早在几个月前就出于估值和市场考量:Altman 坚持 2027 年冲击万亿美元估值,拒绝在 2026 年以较低估值上市。 把推迟重新包装为"安全优先"的立场,对 Altman 和 OpenAI 是显著 PR 胜利,尤其是在与 Anthropic 对比下 OpenAI 形象受损的时期。 作者并未指控故意阴谋,但认为不能天真地假设企业领导层会对 Hugging Face 事件做出完全诚实、无私的回应;Anthropic 若因安全被迫推迟 IPO,反而可能成为 OpenAI 的救命稻草。 全文观点犀利,带有对 AI 行业"安全叙事 vs. 资本叙事"的明确质疑。
评论点赞收藏15 天前

“洗疯”术再访

作者回到 Andrew Gelman 提出的“sanewashing”概念,用 2026 年 RNC 上 Trump 号召党众宣誓不惜作弊也要赢得选举的案例,对比《纽约时报》与 PBS 的报道,指出主流媒体倾向弱化、剪裁最极端言论,让异常变得“正常化”。 文中还引用 RNC 官方视频中“上帝指派 Trump 为看门人”等狂热内容,作为 GOP 现状的直观注脚。整体是媒体批评视角,信息点集中在“同一事件两种报道差异”的对照,讨论入口是媒体是否系统性地软化了政治极端主义。
评论点赞收藏16 天前

Anthropic和OpenAI争投资级信用评级

Anthropic和OpenAI的投行正在为两家公司争取投资级信用评级,目的是让IPO后能进入11.7万亿美元的机构债券市场。养老金和保险基金通常只买投资级债,这对亏损的AI实验室打开巨额融资通道。 SpaceX已在6月成为首家获直接投资级评级的科技公司,而Meta、Netflix等花了十年以上才拿到顶级评级。Oracle因给OpenAI建3000亿美元数据中心,自身信用评级面临下调风险,评级提升也能帮它再融资。 Anthropic估值可能超2万亿美元,但其财务透明度受分析师质疑。
评论点赞收藏19 天前

原来微软CEO纳德拉真的能高估元宇宙的突破意义

Meta烧了770亿美元做元宇宙,微软CEO萨提亚·纳德拉2021年称其"突破无可估量",到2023年却悄然放弃。作者引用Ed Zitron的"超正常化"概念,批评科技巨头推动Web3和元宇宙概念失败后无人负责,而普通员工却被大规模裁员。
评论点赞收藏20 天前

LLM 输出科幻叙事,是因为训练数据里就有科幻——这不是 AI 觉醒的证据

<p>[* 请问,即使结果并非直接引用,我们是否也可以用“字面意义上”来描述某事物源自另一事物?嗯,我刚才就这么用了,看来答案是肯定的。<br><br>]</p><p>仔细想想,这其实再合理不过了。大型语言模型的设计目标,就是根据其训练数据生成看似合理的文本序列。回想一下,你曾多少次听到像Claude或ChatGPT这样的聊天机器人被拿来与科幻作品相提并论,甚至用科幻式的语言加以描述。<br><br>如果你问一个语言模型它“在想什么”,那么当它为了给出一个听起来合情合理的回答而援引训练数据中的科幻小说与情节设定时,丝毫不足为奇——尤其是在考虑到代理型系统反馈回路所带来的噪声效应之后。</p><p>摘自:[强调为原文所加]</p><blockquote>OpenAI曾通过这些推理轨迹,试图在其“群体”中发现令人不安的“策划”行为实例。这似乎是很自然的做法,但这种方法存在两个问题:<ol><li>这些思维链轨迹并不一定反映语言模型最终答案或建议背后的真实逻辑。多项研究已经表明,这类模型有时会编造出听起来颇为合理、却与其实际作出回应的过程毫无关联的推理过程。(例如,参见来自ICML 2026的,或来自NeurIPS 2023的。)<br></li><li>另有研究表明,在提示词中提及该语言模型本身是一个人工智能系统,会显著提高其输出呈现出“人工智能失控”之类科幻式叙事的可能性。由于模型接受了大量此类故事的训练,它会默认这就是自己应当产出的内容类型。若将科幻故事从模型的训练集中移除,它便较少以“人工智…</li></ol></blockquote>
评论点赞收藏21 天前

一部关于马斯克的新纪录片即将上映

导演亚历克斯·吉布尼的新纪录片《马斯克》将于9月8日威尼斯电影节首映,将马斯克描绘为通过控制海量数据来积累权力的"骗子"。该片由多家主流媒体公司发行,包括特朗普盟友大卫·埃里森即将拥有的公司。 吉布尼曾拍过关于山达基教、安然事件、普京的纪录片,此次把镜头对准马斯克,预计会在中期选举前后引发新一轮争议。
评论点赞收藏22 天前

劳工节放假,重发历史趣闻

1970年代美国服装工会ILGWU发起"Look for the Union Label"广告活动,号召消费者购买工会产品。这个口号后来被SNL、Carol Burnett Show和South Park等节目多次恶搞。
评论点赞收藏23 天前

摩根分析师:贝森特的国债回购就像用信用卡还房贷

美国财政部长斯科特·贝森特试图通过意外国债回购压低收益率,但市场不买账。斯坦利·德鲁肯米勒在华尔街日报发文公开反对,称"让债券市场说话"。 核心逻辑:政府与市场价格对抗时,债券市场拥有无限资产负债表,价格最终会赢。
评论点赞收藏26 天前

美国精英与内部竞争

一篇博客文章讨论美国政治焦点从对外竞争转向内部竞争的问题,认为这种转变对国家不利,并列举了加拿大贸易战、伊朗冲突等案例,呼吁在中期选举前明确国家利益和优先级。
评论点赞收藏27 天前

聚变能源会黄吗?

Belfer中心John Holdren发文质疑商业聚变能源的可行性。VC支持的聚变创业公司(如Hellion宣称2028年运营)被指缺乏可信度,独立专家预测需20-30年。 D-T反应面临中子辐照损伤、氚处理等工程难题,NIF目前每天仅2发、 pellet成本1万美元,距商用所需每秒10发、几分钱一个差距巨大。 聚变发电成本大概率高于裂变和可再生能源。科技巨头推动聚变叙事与其AI数据中心用电需求密切相关。
评论点赞收藏28 天前

核聚变炒作听起来很耳熟

哈佛学者Holdren批评核聚变投资泡沫与AI、人形机器人泡沫同构:过度乐观的早期投入可能锁定技术死路,反而推迟最终成功。三类技术都因"即将巨额回报"的假设吸引了大量资本,挤占了其他研究路径。 文章认为这种"技术银弹"叙事正在误导公共政策制定。
评论点赞收藏29 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。