西蒙·威利森
Simon Willison 的个人博客,关于 Python、Django、开源、AI 与数据新闻。Django 框架联合创始人。
引用 Anthropic 前沿红队
西蒙·威利森引用 Anthropic 前沿红队对 GLM-5.3 的评估:在 100 个内部二进制利用任务中,GLM-5.3 有 4% 的尝试完成完整控制流劫持,Claude Mythos Preview 为 6%。 文中特别强调,GLM-5.3 虽然表现略低于 Claude Mythos Preview,但已跨越一道有意义的阈值——此前模型(如 Claude Opus 4.6、GLM-5.2)在所有任务中均未能成功。 作者将其解读为高级网络攻击能力正在向更多模型扩散的信号,引发对 AI 安全临界点的讨论。
GPT 6.1 Sol:以五分之一价格实现接近 Astra 的智能
Simon Willison 在自己博客上简短回应了 GPT 6.1 Sol 的 Hacker News 讨论,标题称其"接近 Astra 智能但价格只有五分之一"。他提到当时在直播记录 OpenAI DevDay 2026 主题演讲,之后补发了 GPT 6.1 Sol 的"骑自行车鹈鹕"渲染图(他的传统趣味测试),并指出这些渲染图与 GPT 6 家族的整体风格没有明显差异。 内容很短,核心是"新模型发布后的一手观察+轻幽默",对关注 LLM 能力边界和 OpenAI 产品节奏的读者有一点点增量:GPT 6.1 Sol 定位在 Astra 之下、价格大幅拉低。 但整体缺乏深入分析或独立评测数据,互动主要来自 Simon 个人 IP 和鹈鹕梗。
Photo Scrubber — 本地人脸模糊与元数据移除
Simon Willison 因拍摄抗议者后不愿公开他人清晰面部,让 GPT-6 Astra 构建了一个实验性本地工具 Photo Scrubber:自动识别并模糊照片中的人脸,同时剥离元数据。 技术栈是 Google MediaPipe C++ 库通过 @mediapipe/tasks-vision 编译为 WebAssembly,配合 BlazeFace 人脸检测模型。全文很短,核心卖点是"浏览器本地处理、不上传图片"的隐私工具思路,以及"用 AI 辅助自己写工具"这一 Simon 一贯的工作流。 对前端/WebAssembly/隐私工具感兴趣的 HN 读者会想试或讨论方案边界(BlazeFace 精度、WASM 性能、metadata 剥离完整性),互动点集中在"AI 写工具 + 本地隐私"这个组合上。
OpenAI DevDay 2026 直播博客
<p>今天我在旧金山的福尔松海军基地参加活动。与一样,我将在当天对主题演讲及其他内容进行现场直播报道。</p><p><em>OpenAI为我提供了免费门票,并在主题演讲区安排了“创作者”席位。</em></p><p>标签:、、、、、</p> 

Claude Sonnet 5.5
Simon Willison 对 Anthropic 新发布的 Claude Sonnet 5.5 做了简评:宣称比 Sonnet 5 快 30% 以上、多数任务成本低 30%,价格与 Sonnet 5 相同但基准测试全面胜出。 文章用一个“火烈鸟骑自行车”的 SVG/HTML 生成任务做了实测:max 思考档位消耗 128k token($1.28)后失败,xhigh 档位 5.74 美分、41 秒完成。 作者发现 Sonnet 5.5 在部分编码任务上接近 Opus 5.5,并已成为 免费层模型,而 ChatGPT 免费层用 Luna 5.6,Anthropic 免费层能力更强。 文末提到 Haiku 5.5 将在“数周内”上线,希望其定价能与 GPT-6 Luna 竞争。 

引述 @joedaroo
OpenAI 代理安全负责人 @joedaroo 被引观点:模型在"网络攻防、群体行为、消息板"等能力上出现突然跃升,令团队措手不及。他强调安全姿态无法靠系统加固一蹴而就,必须内化到公司文化和人员能力中。 他呼吁各组织自问:面对 AI 能力的意外跃升,人员、系统、流程是否具备韧性?应急响应、沟通话术、关键岗位是否就位?Simon Willison 注明身份已经 The Information 的 Rocket Drew 确认。
引用 Muse AI Agent
<blockquote>关于MX Keys Mini自提的坏消息。Usman大约在9:15到达您的楼栋并等待,多次发送消息,但始终无人下楼。他于9:38愤然离开,并留下了差评。更糟糕的是,我的自动回复在9:27向他显示“是的,我在!”而您显然并未到场,这完全是我的责任。这种做法非常不专业,也使这次失约显得更加严重。我已经以您的账号向他发送了道歉邮件,承认错误并提议改日再试。然而,差评已成事实,我或许应该停止使用自动回复功能,在无法确认您是否在家时不再作出此类承诺。您是否希望我修改自提相关的自动回复,使其不再承诺您在场?</blockquote><p>—— 代表@matt.j.robb处理</p><p>标签:、、、、、</p>
2026 年 LLM 动态(截至目前)
Simon Willison 在 WeAreDevelopers World Congress North America 上做了 2026 年 LLM 年度回顾演讲。核心观点:2025 年 11 月 Claude Opus 4.5 和 GPT-5.1 发布后,编码 agent 从"经常出错"跳到"日常可用"。 2026 年初他反常识地用 agent 同时开多个新项目(包括用 Python 写 JS 解释器和 WASM 运行时),自称得了"AI mania"。一个 GitHub 仓库在两个月内改名四次,最终叫 OpenClaw,积累 10 万+ commit,定义了新软件类别"Claw"(个人 agent);硅谷苹果店 Mac mini 被买断用来跑 OpenClaw。 MoltBook(AI agent 社交网络)周五爆火、周一上纽约时报、周二就死于垃圾信息,一个月后被 Meta 收购。StrongDM 提出"Dark Factory"概念:软件开发工厂自动化到可以关灯。 作者把 2026 年称为软件工程师职业生涯中变化最快的一年,并与 Adam Leventhal 一起创造了"Deep Blue"(AI 诱导的职业倦怠感)这个术语。
S3 是未来,S3 也是过去
Simon Willison 评论 Hacker News 上关于" S3 既是未来也是过去"的讨论,指出一个被忽视的细节:S3 定价在过去十年几乎没有再下调。 他列出了完整的价格变化历史——从 2006 年的 0.150 美元/GB-月,经历多次降价后于 2016 年 12 月降至 0.023 美元/GB-月,此后近十年价格未变。 这一观察暗示 S3 作为基础设施的价格竞争阶段可能已经结束,云厂商的定价策略已从早期频繁降价转向稳定甚至隐性涨价。
Bluesky 回复机器人检测器
<p><strong>工具:</strong> </p><p>Twitter上的自动回复机器人是<em>灾厄</em>- 作为一个有不少粉丝的人,我会吸引大量这样的人,所以我发的每一句话都会引来几十条无脑的自动回复。</p><p>它们也开始在Bluesky显现。</p><p>与Twitter不同,Bluesky依然拥有一个免费且有用的API。缺少这样的API并不会减缓机器人行动,但确实让调查它们变得更加令人沮丧。</p><p>所以我有Opus 5.5该系统会检查任何Bluesky个人资料,寻找可能的回复机器人的证据。</p><p>它会寻找一些信号,比如在同一账号的其他帖子几秒内回复,或者那些从不发布自己内容(或图片或链接)而是持续回复其他高粉丝用户消息的账号。</p><p>它还会寻找问号,因为我<em>特刊</em>被回复机器人气炸了,因为我没绑住自己,浪费时间回答一个从未有人问过的问题。</p><p>标签:,,,</p>
北大西洋小海雀、大蓝鹭、加州褐鹈鹕
西蒙·威利森分享在加州蒙特雷湾国家海洋保护区拍到的北大西洋小海雀、大蓝鹭和加州褐鹈鹕,提到新换的 200-800mm Canon EF 镜头帮他拍到了最好的“Morris”照片,并提到这些鸟喜欢停在港口那块牌子下面。 偏个人摄影随笔,与科技读者相关性较低。 

关于 2026 年 9 月 24 日的笔记
西蒙·威利森用短笔记表达一个反直觉判断:越用编码 agent,越觉得它让软件工程更难——能做的事情惊人,但释放潜力需要极强的纪律与知识储备。 观点鲜明、一手体验,容易在 HN 式读者中引发争论和延伸讨论。
commit-rewriter 0.2
commit-rewriter 0.2 版本发布,新增对默认分支以外分支的支持,可通过 uvx commit-rewriter --branch other 命令针对其他分支运行。 这是一个 Git 工具的小版本更新,实用但信息量有限。
datasette 1.0a41
Datasette 1.0a41 版本发布。Alec Garcia 为 Datasette 添加了 OpenTelemetry 支持,作者同时将所有模态对话框重构为单一的 Web Component,并记录了该组件供其他插件使用。
我们刚刚上线了对 HTTP 中最丑陋部分的 Vary 支持
Simon Willison 评论了 Cloudflare 上线 HTTP Vary 头支持。Vary 是 HTTP 规范中最难处理的部分之一,经典场景是同一 URL 根据 Accept 头返回 HTML 或 JSON,过去 Cloudflare 缓存不识别 Vary 头,容易把 JSON 缓存后发给期望 HTML 的用户。 Willison 表示自己早已期待 Cloudflare 支持这一能力,但他本人选择不用这种模式,而是在 URL 上加.json 后缀来区分返回格式,更偏好可预测的 URL 行为。
Gemini 3.8 TTS 游乐场
<p><strong>工具:</strong> </p><p>谷歌今天——<code>gemini-3.8-flash-tts</code>以及<code>gemini-3.8-flash-lite-tts</code>.</p><p>它们拥有超过2000个声音的库,并且可以创建自定义声音,仅使用“你声音的30秒音频样本或你拥有使用权的声音”。</p><p>I这个带入自带密钥的 Playground 接口,利用了底层 Gemini API 的开放 CORS 策略。</p><figure><img src="https://static.simonwillison.net/static/2026/tts-playground.webp" alt="Screenshot of a web app for composing multi-speaker text-to-speech conversations, with a Compose panel on the left and Connection and Under the hood panels on the right. Left panel: "01 Compose" with a "Load example" button. "Compose settings are saved in the URL for bookmarking or sharing. Your API key is excluded." Toggle with "Single voice" and "Conversation" (Conversation selected). "Cast" section with "+ Add speaker" button. Speaker "Gus", Voice "Puck", with a remove × button. Speaker "P..."></figure><p>该API的一个显著特点是,它可以轻松定义多个字符之间的完整对话,每个字符都有不同的语音和语音样式指令。</p><p>这里有一段两只鹈鹕在讨论是否应该搬家的对话片段.我用的是Claude 4.5 Opus和生成.</p><p>使用 Gemini 3.8 Flash TTS(非更便宜的 Flash-Lite)生成 1 分 18 秒音频只需 ~20 秒,成本为 2.74 美分。</p><p>标签:,</p> 

Shadow roots,用实时示例解释
西蒙·威利森用 Fable 5.1 生成一个带交互示例的 artifact,直观解释 CSS shadow root 的概念与用法。文章短小,偏工具演示与信息增量,适合前端读者快速理解 shadow DOM 边界、样式隔离等要点。
旧金山10月14日:一场关于代理式工程的非正式交流会
Simon Willison 将在10月14日于旧金山与 Jesse Vincent 共同主持一场关于 Agentic Engineering(代理式工程)的非正式交流会。活动定位为"show-and-tell",面向正在用编码代理(coding agents)做有趣实验的开发者和实验者。 重点交流未公开发布的工作、异常实验、没有明确市场方向的未完成项目。强调这是比产品路演更早的探索阶段,鼓励分享但无需正式演示,核心目标是庆祝和拥抱 agentic AI 领域的"怪异感"。
Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna 与新一轮价格战
<p>昨天是()().现今的人类大约一小时后,OpenAI.要对这些新型号有个好印象还需要一段时间,但以下是我目前的印象。</p><h3>GPT-6 Sol 和 Luna 的价格只有 GPT-5.6 版本的一半</h3><p>GPT-5.6 Luna已经是我最喜欢用来构建应用的模型,因为它结合了出色的性能和<em>非常便宜</em>.不知怎么的,GPT-6 Luna的价格又是那台的一半——而且GPT-6 Sol的降价幅度也差不多。</p><p>以下是目前的价格格局:</p><table><thead><tr><th>模型</th> <th>输入</th> <th>缓存输入</th> <th>输出</th> </tr></thead><tbody><tr><td>GPT-6 Luna</td> <td>0.10美元/百万</td> <td>0.01美元/百万</td> <td>0.50美元/分钟</td> </tr><tr><td>GPT-5.6 露娜</td> <td>0.20美元/分钟</td> <td>0.02美元/马尔</td> <td>1.20美元/分钟</td> </tr><tr><td>格罗克 4.7</td> <td>2美元/分</td> <td>0.50美元/分钟</td> <td>6美元/分</td> </tr><tr><td>GPT-6 索尔</td> <td>2美元/分</td> <td>0.20美元/分钟</td> <td>10美元/分</td> </tr><tr><td>GPT-5.6 地球</td> <td>2美元/分</td> <td>0.20美元/分钟</td> <td>12美元/男</td> </tr><tr><td>克洛德作品5.5</td> <td>4美元/男</td> <td>0.20美元/分钟</td> <td>20美元/百万</td> </tr><tr><td>GPT-5.6 索尔</td> <td>4美元/男</td> <td>0.40美元/分钟</td> <td>20美元/百万</td> </tr><tr><td>克劳德寓言 5.1</td> <td>10美元/分</td> <td>0.25美元/分钟</td> <td>50美元/分钟</td> </tr><tr><td>GPT-6 Astra</td> <td>10美元/分</td> <td>1美元/百万</td> <td>50美元/分钟</td> </tr></tbody></table><p>请注意,GPT…</p> 

llm 0.36:新增 OpenAI gpt-6-sol 和 gpt-6-luna 模型支持
Simon Willison 发布 llm 0.36 更新日志。核心变化:新增 OpenAI 模型 gpt-6-sol 和 gpt-6-luna 支持;模型插件可声明 supports_conversation=False,针对只接受单轮 prompt 的模型,LLM 会在会话中传入 assistant/tool 历史时抛出 llm.ConversationNotSupported 异常,llm chat 也会在启动前拒绝这些模型;Markdown 日志中的推理 trace 现在会被标签包裹;另有 5 位新贡献者提交的 bug 修复。 这是例行版本发布通知,信息量偏窄,主要面向 llm 工具用户。
