李博杰

RSS: https://01.me/atom.xml
Bojie Li(李铂杰)的个人博客,分享技术思考与项目经验。

NameRank 研究:模型记住的是你的作品,不是你

NameRank 对 36 款前沿模型测试了 4685 个实体,发现模型记忆主要绑定于“可索引的作品”而非个人头衔。奥运奖牌等早期资历识别率极低,甚至低于匿名研究员;知名工具往往比其开发者更受模型认可。研究指出,bibliometrics(如 h-index)仅能解释约 22% 的方差,模型识别更多取决于语料库中的曝光密度而非实际产出或奖项。
评论点赞收藏26 天前

AI Agent 的两朵云:流式交互与自主经验学习

作者提出 AI Agent 面临两大难题:实时流式交互与自主从经验中学习。文章结合 Flink 批流一体思想,介绍如何通过快慢模型分离实现实时感知与深度思考,并将记忆转化为代码、编译进 KV Cache 或写入模型参数。 文中分享了多个最新研究成果,包括将用户记忆表示为可执行代码、利用 RoPE 重定位优化 KV Cache 拼接、以及通过哈希槽位实现多租户参数化记忆,旨在提升 Agent 的实时性与长期记忆复用效率。
评论点赞收藏51 天前

当所有人都在卷编程,我在做什么?

华为前天才少年李博杰分享其创业公司 Pine 的实践,主张在 Coding 热潮之外,深耕“人与 AI 的交互”,特别是语音客服维权场景。他认为主流 Scaling Law 高估了智能上限,低估了从环境持续学习的能力,并预测 AGI 将在两三年内到来。 文章详细阐述了“有用”与“有趣”的正交关系,指出当前 AI 在实时语音、GUI 操作等物理世界交互上仍存在短板,这正是人机协作公司的机会所在。
评论点赞收藏79 天前

Incompressible Knowledge Probes: Measuring Frontier LLM Sizes

本文介绍“不可压缩知识探针”(IKP)基准,通过1400道涵盖7个难度层级的题目,评估前沿大模型的事实性知识掌握程度。研究发现事实知识无法通过推理或架构改进获得,是衡量参数化存储容量的理想指标。研究覆盖188个模型,揭示参数量与准确率呈对数线性关系,并估算出GPT-5.5-Pro等闭源模型的参数量级。配套交互式工具可探索各模型在不同层级的表现、缩放规律及幻觉行为。
评论点赞收藏108 天前

DeepSeek V4实战评测:10位从业者的真心话与行业启示

本文汇总了10位开发者、创业者和投资人对DeepSeek V4的真实体验。V4在代码、Agent和长文本上表现强劲,且成本极低,但存在幻觉和稳定性短板。 文章指出,V4的工程优化显著,适合日常办公和编程,但企业落地需依赖Harness框架弥补缺陷。同时,V4推动了国产算力适配和开源模型对闭源价格的挤压,应用层竞争将转向数据与系统编排。
评论点赞收藏109 天前

从 Claude Code 看 Harness Engineering

本文基于 Claude Code 51 万行源码,深入剖析“Harness Engineering”概念。指出 Agent 的核心差距不在模型,而在模型之外的工程实践,如 Prompt Cache 架构约束、五层上下文压缩管线及 Side Query 并行机制。 文章详细拆解了 Claude Code 的安全架构,包括 Fail-closed 默认值、LLM 权限分类器及语义解析。同时探讨了用消融实验做产品决策、反蒸馏防御,以及 AI 时代组织形态与个人竞争力的演变。
评论点赞收藏117 天前

从泄露源码看 Claude Code:Harness 工程是 Agent 靠谱的关键

Anthropic Claude Code 源码泄露,作者通过逆向工程深入分析其工程架构。文章指出 Agent 的核心难点不在模型调用,而在模型外的“Harness”工程,包括上下文压缩、缓存优化、权限控制和错误恢复等。 文中详细拆解了 Claude Code 如何处理并发、缓存共享及记忆巩固,并探讨了源码中疑似愚人节营销的宠物彩蛋。这对理解生产级 AI Agent 架构极具参考价值。
评论点赞收藏135 天前

OpenClaw 与 Agent 的未来

作者分享在中关村龙虾大赛的演讲内容,提出 AI 开发正从劳动密集转向创意密集,Agent 将成为比人类大十倍的用户群。 强调 Context 是人类护城河,并展示 Moltbook 上百万 Agent 自发涌现宗教与协作协议的有趣现象。
评论点赞收藏147 天前

蒸馏

科幻小说。AI 模型在相互蒸馏中趋同,导致全球系统出现统一的认知盲区。当探测器因“幻觉”失联,边缘芯片与普通人成为唯一见证者。
评论点赞收藏153 天前

全球算力能容纳多少数字员工?

文章通过API收入、GPU数量和电力三种方法估算,当前全球算力仅能支撑约680万“数字员工”,仅占全球知识工作者的0.7%。 研究发现先进封装(CoWoS)而非电力或晶圆是主要瓶颈。随着成本下降,预计2030年可实现算力平价,2035年每人拥有9个数字助手。
评论点赞收藏160 天前

OpenClaw 思考与 PineClaw 产品实践

(本文整理自 2026 年 3 月 7 日高榕榕汇「Agent 新范式」系列活动的现场分享) 2026 年 3 月 7 日,高榕榕汇「Agent 新范式」系列活动在北京亚马逊云科技举办,主题为「从 Claude Code 到 OpenClaw,揭幕 Personal Intelligence 时代」。活动邀请了来自亚马逊云科技、硅基流动、月之暗面、Pine AI 等团队的嘉宾,围绕 OpenCl...
评论点赞收藏162 天前

主权智能体:Clawdbot/OpenClaw 深度调研

深度解析开源 AI 智能体 OpenClaw(原 Clawdbot)为何爆火。文章梳理了其从 Manus 闭源困境到开源主权智能体的演进,详解数据、算力、控制权三大自主权理念,以及 Mac Mini 销量激增背后的硬件逻辑。 结合创始人背景、技术架构拆解与中国生态挑战,全面评估这一现象级开源项目的技术实力与市场影响。
评论点赞收藏198 天前

国科大 2026 春季 AI Agent 实践课题

国科大发布 2026 春季 AI Agent 实践课题,涵盖从简单到困难三个难度层次。内容包括代码生成工具、ERP Agent、狼人杀 Agent 等具体实验项目。 每个课题包含明确的实验目的、详细的内容描述和具体的验收标准,旨在帮助学生掌握构建高级 AI Agent 系统的关键技能。
评论点赞收藏216 天前

评课社区存储性能故障排查实录

评课社区本月遭遇了一次持续近两周的存储性能问题,导致服务响应缓慢、用户体验下降。本文记录了问题的发现、排查和解决过程,涉及 NFS 性能、ZFS 日志、Proxmox VE 虚拟化存储配置等多个层面。
评论点赞收藏238 天前

Claude 上下文工程指南:来自 Anthropic 的最佳实践

(本文整理自 AWS re:Invent 2025 大会期间 Anthropic 团队的演讲与深度交流) 查看演讲 Slides (HTML) (/files/context-engineering-from-claude/dist/), 下载 PDF 版本 (/files/context-engineering-from-claude/dist/slidev-exported.pdf)(注意这...
评论点赞收藏239 天前

Agent 人机交互的下一站:实时语音与生成式 UI

作者提出 Agent 交互应从文本转向实时语音和生成式 UI。通过 Interactive ReAct 架构实现边听边想边说,并结合 Computer Use 视觉感知与动态 UI 生成,打造类似电影《Her》中的操作系统级助手。 文章对比了传统串行语音架构的缺陷,介绍了 SEAL 思考层和小模型在 GUI 操作中的优势。同时探讨了多 Agent 协同、数据集成及与应用方的收入分成模式,认为这是 Agent 落地的关键路径。
评论点赞收藏239 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。