这是上一次延期的公告😂 引用 宝玉 (@dotey): Claude 前一段时间把每周限额临时提升了 50%,客观说效果还是挺好的,要是用 Opus 4.8 的话比 GPT 5.6 还耐用,不过架不住 Codex 一天天重置。 这个活动本来要到期了,现在延期一个月了,感觉一个月后可能要变成常态了。
提交点赞
Anthropic 感觉就总是给人很纠结很不爽利的那种感觉! 这提升 50% 额度明明挺好的事,停了又怕你不满意,彻底放开又舍不得,就一次又一次的延期, 还不如索性一直提升 50% 得了。 就跟当年 Fable 5 一样,一会说只有 2 周,一会又延期,最终还是放开了,但这个过程就给人感觉挺不好! 引用 ClaudeDevs (@ClaudeDevs): We’re extending the...
Deepseek Harness 如果是 SDK 为主也能达到数据入口的效果吗? 像 ZCode 这样的 Coding 产品,不只是变现工具,也可能成为数据入口:用户完成真实的软件工程任务,产生长周期执行轨迹, 再反哺下一轮 Post-training,形成“产品使用 → 数据 → 模型升级 → 更多使用”的飞轮。 引用 Anita AGI/acc (@Anitahityou): 高盛的这篇智... 

一直有一种观点,就是小模型加 Harness,就能达到大模型的智能效果: 只需要一个 10 亿参数的小模型作为“认知核心”,其余能力靠联网搜索、执行代码等工具补齐就够了。 Jason Wei (思维链提示技术的核心作者之一)的新推文,反驳了“小模型+工具”路线,认为光靠工具, 撑不起顶级智能,把知识“内化在大脑”和“现查现用”是两回事。 小模型+工具就能行的观点之所以流行,因为理论上确实说得通...
豆包越来越像 Codex 了,这是我最近用下来最直观的感受。Codex 一直是我心里 Agent App 体验的标杆,而豆包这波更新,从 GUI 电脑操作到手机远程操控,很多设计思路都能看到 Codex 的影子,有些地方甚至做了本土化的超越。 最近我老婆回国,在国内用不了 ChatGPT 和 Claude 这些,日常就用豆包帮她查资料、做攻略。 这两天她需要在自己电脑里找个文档,人在国内,电脑... 

应该是这个选项 

Claude Code 最新版本上线了一个特别讨厌的功能,频繁的给其他正在运行的 session 发消息!还老是搞错,除了浪费 token 并没有太大价值…… 默认打开我都没找到哪里关掉! 

OpenClaw 真的凉凉了吗? @凤凰网科技【美团高管反思全员养虾】据媒体报道,美团核心本地商业CEO王莆中表示在公开演讲中,完整复盘了美团内部进行AI变革的过程。 谈到今年2月到3月,公司开启全员“养虾运动”,王莆中提及但结果是账单暴涨,每日消耗上千万元,同时养虾产生的谬误干扰了真实经营。(快科技) Asa (@app_sail) 美团应该是第一个反思全员养虾 

Cursor 的代码托管平台 Origin 正式上线,用户可以从 GitHub 同步仓库开始使用。 Origin 简单说,就是 Cursor 自己做的 GitHub。代码存储、Git 托管、代码审查、团队协作,一站式解决。 但它和 GitHub 最大的区别在于设计前提:GitHub 是为人类开发者的工作节奏设计的,一个作者、两个审查者、按顺序合并。 Origin 从一开始就把 AI Agent ...
yetone 开源了一个新项目 Cumora:把 AI Agent 变成你的聊天群里的正式成员。 Cumora 的界面长得像 Slack,但名单上的同事看起来都是 AI。有名字、有人设、有记忆,能发私聊、能建群、能认领任务,甚至能收发真实邮件。 你不 @ 它们,它们也可能主动跳出来说一句“我注意到上周那个问题还没解决”。 从截图看,默认团队里有 Atlas(研究员)、Bram(工程师)、Iri... 

其实不用担心代码命名的问题,agent 并不是简单通过猜关键字去找代码的,它会阅读代码片段,根据上下文去找。 举个例子来说,它发现程序崩溃了,它会先根据错误日志去定位到崩溃的位置,然后先阅读这部分的代码, 以此为起点,再去找相关的代码,直到上下文足够定位问题,再去生成修复的代码。 引用 zwdroid (@zwdroidai): 向老师请教个问题:历史代码中有很多局部的改动,导致很多方法名其实...
我这个是ChatGPT网页版,不是 Codex 另外更推荐用github 的 cli,比access token更安全 引用 Chase Passion (@ChasePassi79437): 其实不用那么麻烦,github不是有个access token,只需要搞个永久的放到所有harness的里面就好了, 不需要插件
Pi 两位作者的见解: 1. 代码即真相,代码不需要记忆系统,不需要 RAG,模型很擅长理解代码结构 2. Bash 工具足够用,Bash 类似于编程语言,可以任意组合;大部分时候没必要 MCP,skill + 脚本足够。 引用 Pi (@pidotdev): Good morning from Vienna People of Pi 🌞 Sunday meditations from ...
Codex 支持通过修改 config.toml 将上下文窗口扩展到 100 万 token,需配合 GPT-5.6 Sol 等支持该长度的模型使用,自动压缩阈值设为 90 万 token。但作者认为默认配置已经过精心调优,当前流畅够用,不建议盲目改大。
MIT 许可证的 watermark-stripper 项目在 Anthropic 公布 Claude 文本水印方案后几天内获得 10,000 stars。该项目支持移除 Claude、SynthID-Text、OpenAI 的水印标记,同时也能处理 C2PA 和 EXIF 格式的图像与 PDF 水印。 

可能是太久没用 ChatGPT 了,才发现从 ChatGPT 就能直接让它修改代码提交 PR。(我是用的 ChatGPT Pro) 起因是我在做一个 Deep Research 调研,完了后就想让它基于我的代码库做一个方案,但是整个代码库都打包上传太麻烦了, 我就把 GitHub 地址发给它了,没想到它自己就 clone 到本地开始分析代码了,最后给了一份很详细的结合当前代码库现状的方案。 一... 

Mole 是真心好用,自从用了 Rust,每次编译要几十G,这时候就经常需要借助 Mole 帮我清理,挺好用。 除了清理,另一个我喜欢的功能是分析磁盘占用,可以很容易找出那些隐藏的占用空间的,解决后一劳永逸 Tw93 (@HiTw93)
Claude Code (Claude Desktop)这个功能很好用,就是你5小时限制到了,可以自动继续,不只是主 Agent 到时间继续,子 Agent 到时间也会继续。不需要手工输入 return,也不需要重新开 subagent,可以重用之前的 subagent 引用 ClaudeDevs (@ClaudeDevs): Hit your usage limit in Claude Cod...
@zhang_benita 下次您要配字幕可以试试
我最近就发现,即使聪明如 Fable 5,如果你只是给它一个目标让它优化,它可能也就是在既定的框架下想办法帮你优化到极致, 但是它很难跳出既定框架,发现一条完全不同的路线。 比如说最近有用户反映使用 BaoCut 转录速度慢,我就反复的用 Codex 去转录视频,然后让 Codex 或者 Fable 去分析瓶颈在哪里,该怎么优化,然后每次它们都能给我一堆理由和看起来靠谱的优化方案。 比如它会... 

Anthropic 的篇官方技术说明,解释 Claude 文本水印的具体工作方式。 Claude 用的是 Google DeepMind 2024 年发表在《Nature》上的 SynthID-Text 方案,往上追溯可以到 Scott Aaronson 2022 年的提案。这一脉方案的共同特征是在模型选词时,用密钥改变随机数的来源,从而在输出中留下统计痕迹。 Anthropic 举了个例子... 

这篇 Pi 压缩的文章,太过于朴实无华,就真的只是写个 prompt 让 LLM 把上下文总结一下,然后保留前面的system prompt 和工具调用,在摘要后可能还会保留最近几次对话。 这种压缩是有损的,不知道是不是有机制会去历史会话检索上下文? 当然这确实是压缩上下文的最简单有效方案。 引用 Pi (@pidotdev): LLMs have a limited context wi...
Pi 作者对 DeekSeek Harness 的评价 Armin Ronacher ⇌ (@mitsuhiko) 我认为 DeepSeek Harness 并不完美,但这是我第一次在这一领域接触到全新事物,并且深受启发,重新审视了我们的一些选择。我特别喜欢开源这一部分! 

我不喜欢用 grill-me,可能因为我不擅长空想,也不喜欢被拷问。我需要那种看得见摸得着的东西才能进一步得出结论。 我更喜欢用 Claude Design 这种快速出一版原型,做出来一个真实的东西,才能感觉出来哪不对; 或者 AI 写一份文档来理解方案,或者干脆 AI 实现一个 PoC 版本出来。 这在以前是很成本很高的事情,现在 AI 生成真的太容易了,所以对我来说不依赖 grill me...
我最近在 ~/.claude/CLAUDE.md 里面加了一段提示词,让它多开 SubAgent(Opus)去执行,这样我默认开 Fable 5 High,Token 消耗也不算厉害。 Fable 5 则主要做需求澄清、方案拆解、任务分发和结果验收。 之所以不用 Opus 5 是因为太太太慢了,而且 Token 消耗巨大! 注意你的主要任务是分析、编排和验证,具体任务尽可能交给 subage...
看来是我没懂 DeepSeek Harness,插件还是很强大的,装上插件都能魔改 UI 👍 WeZZard (@realWeZZard) 这个仓库 

DeepSeek 作为一个模型厂商,最有价值的肯定还是做 Agent Harness Product 而不是 SDK,因为 SDK 它不容易拿到用户行为数据。 做 Agent Harness Product 那就得追求用户量,追求用户量就要先做好用户体验,其次才是插件可定制化。 引用 马天翼 (@fkysly): 目前根据已有的 DeepSeek Harness 的内容,我觉得 Claude ...
软件自进化可能是个伪命题,只会带来更大的混乱。 插件要么是一次性用完就扔的,要么就得要设计、验证和维护的,不是现在模型能力可以“自进化”的。 OpenClaw 的一坨能“自进化”的 Skills 已经做了示范。 还是等模型自学习自进化更靠谱点。 引用 Jiayuan (JY) Zhang (@jiayuan_jy): 有幸一个月前就被 @tianyi 拉进了仓库。当时 DSH 还是一个只实...
DeepSeek Harness 团队,真正需要招的不是一帮天才程序员、奥林匹克金牌选手,需要真正懂 AI 产品的 AI 产品经理,这个阶段把产品定义清楚、规划清楚最重要。
我只是作为一个“普通用户”的角度去用 DeepSeek Harness,一些感受: 1. 启动方式偏极客,程序员没问题,但是普通用户估计都没有nodejs环境,很难跑起来 2. 速度飞快,这点特别好 3. Thinking 部分由于 Flash 模型速度过快,导致文字闪的厉害,可以做一下节流,攒一批一起显示,配合动画动效会好一点。 4. Codex 右侧的多 Tab Panel 相当重要,... 

DeepSeek Harness 正式发布了,也是开源的 引用 Tianyi Cui (@tianyi): DeepSeek Harness was just released with MIT license. The current 0.1.0 version is a developer preview, and may still have many rough edges. Feedb...
最近一直在忙着把我的 App 变成跨平台的,试了几种方案还是决定用 Rust + GPUI。 一开始就是用的 Electron,但是视频编辑这种场景纯网页实现性能优化还是挺不容易的, 尤其是视频一长、字幕一多就会很卡,内存占用也很夸张。 我不怀疑持续优化下去能是能有一个还不错的性能的,但要花不少时间精力。 所以我后来就决定先做一个 Mac 版本(图1),Swift + AppKit,用 Fab... 

Codex 用户数突破 1500 万,作者提示即将进行重置,可在终端输入 /fast 触发。
有内容称多项指标超过 Claude Opus 4.8,但原文未给出具体项目、数据或来源,仅以"Anthony 补充"收尾,信息量极低。 

Manus 还是挺了不起的,期待再创辉煌 引用 晚点 LatePost (@latepostnews): 《Manus 第二季,浪子回头》 8 月 11 日晚间,Manus 网站上挂了小半年的那句 “Manus 现已成为 Meta 的一部分”,变成了 “Manus 即将恢复独立运营。” 从被收购到确认拆分,中间不到八个月。 2025 年 7 月,肖弘离开了长居的武汉,和整个团队搬去新加坡。... 

我一直有个观点,就是: 人不用去跟汽车比谁跑的快,不用跟 AI 比谁更聪明博学;我们驾驭好汽车到达目的地,用好 AI 完成任务,就很好了。 引用 Jackywine (@Jackywine): 我有一个绝望的观点: 人类已经彻底跟不上 AI 的发展速度了 但是在自己力所能及的情况下,还是尽可能多的学习一点 我的 Agent 启蒙是 anthropic 的官方教程,再加上一些其他的 AI 智能...
不完全是一通百通的事,这种 Harness,会越来越复杂,到后面你完全跟不上! 就像 pi 这样的,现在勉强还能看得懂啃的下来,再迭代下去就像 Claude Code 的代码已经没办法看下去了。 我的 Agent Loop 启蒙就来源于 Claude Code 最早的泄漏版,那时候就几万行代码,核心代码就几百上千行,当时看到核心就是一个 While loop (就是看 LLM 结果是工具调用还是...
赞,正想找个 Rust + GPUI 的代码库学习下👍 引用 EGOIST (@localhost_5173): Introducing ⚡Waku, a fast and native desktop app (Rust+GPUI) for all your coding agent CLIs. is free and open source. 

不用worktree也能并行的,比如这个任务就遇到了冲突,它自己会挂起等待其他任务完成再继续 

我是能不用worktree就不用worktree,要么不同任务用branch分支, 要么就直接同一个分支多任务,一般不太用担心冲突,首先只要任务类型不一样冲突可能性较小。 另外现在 Harness 比如说 Claude Code、Codex 都很聪明,遇到冲突会等另一个执行完。 使用 worktree 主要是在做耗时较长的 PoC 场景,只是验证一下,同时要做其他任务,完了就删除目录。 宝玉...
这里的老登代表的更多是心态不是年龄😜 引用 大罗SEO (@daluoseo): 现在做 AI 项目,真的不能找太老登的人,我孵化了一个项目。 CTO 对 AI 写代码充满了偏见,坚持手搓,并且说这样才纯粹、没有问题。 我说倒也没啥,我倒不反对。做事我们要认真,把潜在的风险尽可能规避,但是你坚持手搓,导致整个项目周期拖到五六个月才能发版。 结果从功能上直接被竞争对手远远超过,现在整个项目就...
开发者实测发现 git worktree 会为每个分支创建独立目录,node_modules 重复占用 20GB 磁盘空间。swyx 发文称"worktrees must die",引发对 worktree 磁盘开销的讨论。 

这篇推文关于文本水印原理讲的很清楚。 生成文本的时候,模型每要输出下一个 token,就拿前面已经生成的所有词加上一个密钥,算出一个哈希值。 这个哈希值会把词表里的词随机分成两组,比方说绿组和红组。 然后模型在选下一个词时,悄悄提高绿组词被选中的概率。 最终输出的文本看起来完全正常,但统计上会偏向绿组词。 检测的时候反过来。拿着同一个密钥,对文本里的每个词重新算一遍哈希,还原出当时的绿组和红组...
这个功能还有一个问题就是它会不断派生新卡片,比如这个任务派生出5个,其中每一个又派生1-2个,得不小的时间才能都搞完😅
Claude Code 这个功能我还蛮喜欢的,就是每次任务它会主动记录下在执行当前任务中发现的问题, 这些问题和主线任务无关,但是值得记录下来后续解决,很像平时我们 Review 代码,发现一些问题,但是不想影响当前合并,就创建一个任务跟踪起来。 只是 Claude 桌面版在这里把后续任务变成了卡片,点击后就可以开始执行这些后续任务,可以选择当前对话中继续,也可以新开对话,或者云端启动任务。 ... 

重点明明是你有无限 Fable 的 Token😜 引用 LinearUncle (@LinearUncle): claude 一个未发布模型尝试攻克黎曼猜想,尝试了 650 个方向都失败了。 人类继续PUA 它“请继续”,“相信你自己!你可以的”,最后虽然没有最终攻破,但是也拿到了数学上一个非常不错的结果! 看来我上次PUA方向不对,我用梁文峰PUA Deepseek-v4-flash,是...
Codex/Claude Code 现在都支持跨session访问会话了,还是挺方便的,比如我昨天在测试我的 App 在 Windows 的运行情况,先在某个测试 Project 中调用 BaoCut Skill 去做转录视频,发现第一次运行时下载模型体验很糟糕。 然后我到 BaoCut 所在源代码项目中,把会话的 Session Id 给它,让它去分析原因并给出优化方案,这样就不需要你自己去... 

转自刘群MT-to-Death: 很多人不理解文本水印是怎么回事。 文本水印是嵌入到语言生成中的一种印记,比如可以用A/B两个同义词的时候总是选择B、 可以用两种表达方式C/D的时候总是选择次高概率的D,这样文本看起来没有任何问题, 但实际上是可以检测到的。 由于水印是加在文本内容上的,转变成图像再用OCR扫描出文本也没有任何用处。这种水印的添加和检测都是由大模型来做的,人很难感知到。 当然... 

这个试验很有意思:100万美元预算,让给20多人的团队不限量 Token 使用 AI。 结论是: 人会更累,AI 的成本比人还高; 效率提升最大的是组织从 0 到 1 使用 AI; 公司的组织架构还是为人设计的,就算有无限 Token,效率提升上也有明显天花版; 人的思考都外包给 AI 了,对项目细节掌控度下降,需要问 AI 才能回复别人的问题。 引用 美研芒格君 (@Kay2289123):...
转译自 Lenny Rachitsky 引用 我从 Cursor 人才主管 Adam Ward (@wardadamp): 那里学到的最大收获: 1. 前线部署工程师 (FDE,forward deployed engineer) 是目前科技界最抢手的职位。 他们必须具备深厚的技术功底,同时又能和销售团队打好配合,在公司高管面前从容自信。 他们要把复杂的产品转化为实际的商业结果,帮助客户优化...