Artifipedia Blog

RSS: https://artifipedia.com/blog/rss.xml
深度理解 AI 概念的博客,每个概念从不同层级进行讲解。

你的 Agent 返回了 200 OK,却做了错误的事

普通软件会在出现问题时向你发出警告。而人工智能系统则会给出格式正确、自信十足且错误答案,并标记为“成功”状态。正因具备这一特性,人工智能的可观察性才成为一门独立的学科,而非像以往那样仅仅针对新基础设施展开研究。
评论点赞收藏6 天前

72秒还是30分钟,都是临床试验

Territory 11研究分析了AI辅助诊断的随机对照试验,证据质量扎实,但不同研究的效应量差异高达25倍。这揭示了AI医疗应用效果的不一致性,对评估AI临床价值有重要参考意义。
评论点赞收藏14 天前

那个被抹掉的12%:MASAI AI乳腺筛查试验的头号发现如何丢了它的限定词

MASAI试验是迄今证据最强的AI乳腺筛查部署,10.6万瑞典女性参与,AI辅助将阅片工作量减少44.3%、癌症检出率提升29%且假阳性不增加。但被广泛引用的"间隔癌减少12%"P值为0.41,差异完全在 chance 范围内,试验仅证明非劣效而非优效。文章追踪了这个统计限定词如何从论文摘要出发,经过厂商新闻稿、大学宣传、媒体报道,逐步被稀释直至消失——每一步都"没有造假",但合起来把"不更差"变成了"更好"。这揭示了一个独立于证据质量的问题:传播失真。
评论点赞收藏14 天前

九个案例显示,模型几乎从来不是瓶颈

Territory 10总结了九个企业AI部署案例,发现组织约束是唯一的瓶颈,证据几乎都由企业委托生成,且缺乏独立的验证研究。技术本身不是问题,落地障碍在组织层面。
评论点赞收藏14 天前

欧盟推迟了没有标准的部分

EU AI Act今日生效三项机制:Article 50透明度义务、GPAI处罚权和市场监管权。Digital Omnibus将高风险系统义务延期至2027年12月和2028年8月。延期与否的分界线在于是否需要协调技术标准——需要标准的义务延期,不需要标准的义务照常生效。10^25 FLOPs的系统性风险阈值今天开始可处罚。
评论点赞收藏14 天前

Phase I improved. Phase II did not.

AI-designed drugs clear safety trials at well above industry rates. At the stage that tests whether a drug works, the sources contradict each other, and the more careful ones report no advantage at al...
评论点赞收藏15 天前

The pilot failed and the staff deployed it anyway

Enterprise AI is measured by what organisations sanctioned. A separate literature measures what their employees actually use, and the two describe the same companies without ever being set against eac...
评论点赞收藏15 天前

Refactoring fell from 25% to 3.8%

Survey evidence says AI improves code quality. Repository telemetry says the opposite. They are measuring different things, and the gap between them is where the productivity went.
评论点赞收藏15 天前

把医生加进模型,结果毫无变化

随机试验发现,医生用LLM诊断比传统资源更好,但模型单独使用与模型加医生效果相同。AI在医疗诊断中已能达到与医生辅助相当的水平,挑战了"人机协作必优于纯AI"的假设。
评论点赞收藏15 天前

One trial, a waitlist control, and a letter

The best evidence for AI mental health support is a single randomised trial of a purpose-built clinical tool. Its own journal published three methodological objections, and almost nobody uses the thin...
评论点赞收藏16 天前

The lock-in is the prompts, not the API

Switching costs used to require board approval to incur. AI switching costs accumulate through ordinary engineering decisions nobody escalates, and the asset that creates them is the same one that pro...
评论点赞收藏16 天前

The framework that exists produced 1.6%

The FDA has two AI tracks. One is final, has authorised over 1,350 devices, and is the regime under which almost none of them cite a trial. The other missed its own deadline five weeks ago.
评论点赞收藏16 天前

62.1万台工业机器人装机,人形机器人几乎零部署

2025年工业机器人装机量创纪录达62.1万台,全球在役466万台;同期人形机器人在真实场景中几乎没有部署。成功的关键不是机器人变聪明了,而是工作环境被改造得适合机器人——这和人形机器人的通用性主张是两回事。 判断边界是否被突破需要四个可验证指标:持续商业运营的部署数量、单台机器无需重新配置完成不同任务的能力、是否披露了环境改造、以及每小时人工干预率。目前这四个指标都没有公开数据。
评论点赞收藏17 天前

九个案例,没有一个被更准确的模型修复

Territory 6项目关闭,九起记录在案的AI错误案例中,三起根本没有使用AI,且没有任何一案例通过提升模型准确性得到解决。 Territory 6是一个追踪AI系统造成实际伤害的案例库,现已关闭。九起案例中,三起根本与AI无关,其余六起的问题也不是模型精度不足导致的——换更准确的模型并不能修复。这指向一个反直觉的结论:AI伤害的根源往往不在算法本身,而在部署方式、流程设计或人为决策环节。
评论点赞收藏17 天前

Waymo的2.2亿英里:在边界内有效,边界外未知

Waymo截至2026年3月累计2.206亿英里纯载人里程,对比调整基准减少90%严重伤害事故、81%任何伤害事故、92%行人伤害事故,同行评审确认统计显著。调整基准按Waymo实际行驶街道加权,结论仅适用于其划定边界内。三组关键数据未公布:每百英里远程协助频率、域排除详情、各条件里程分布。加州监管文件显示近半数里程为空驶。
评论点赞收藏17 天前

Robodebt:悄悄输掉,避免公开败诉

澳大利亚Robodebt计划被皇家委员会裁定为非法、粗暴且残酷,但政府部门多年未上诉,导致没有任何具有约束力的先例确立。 Robodebt是澳大利亚政府向低收入者错误追讨福利金的计划,皇家委员会认定其违法且残忍。然而,尽管法院系统多年来持续作出反对裁决,政府部门始终选择不上诉,使得每个案件都以个案方式解决,从未形成具有普遍约束力的法律先例。这是一种制度性的"悄悄输掉"策略——避免公开败诉带来的政治后果,同时也不让错误被正式纠正。
评论点赞收藏18 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。