Andrew Ng 入局 AI 工程
自最初的收养里程碑以来,我们已经数不清已经跨越了多少个里程碑人工智能工程师的崛起但显然,谷歌脑和Coursera的联合创始人吴安德鲁,以及许多其他项目的重启DeepLearning.ai其中专注于人工智能工程是一个很大的特点:
这是通过”对超过10,000条招聘信息的分析;与人工智能专家、招聘经理和招聘人员进行了数十次结构化面试;通过调查收集数据;以及综合其他在线数据” .
以下是Andrew认为最重要的四项人工智能工程技能:
你可以读书他的完整职位更多来自官方的见解,但我们同意“人工智能工程技能”广泛适用于不仅仅是“人工智能工程师”这一职位的人,这是一个有洞见的重点。
关于这四个技能的评论:
- 构建与部署人工智能应用: “擅长构建和部署AI应用的人理解AI的基本要素(如大型语言模型、上下文工程、RAG、代理工作流、机器学习和深度学习),更重要的是,知道如何利用统计技术来衡量、引导和管理AI系统,使其行为更具可预测性。其中一个核心技能是知道如何驱动有纪律的评估和误差分析循环.”
- 软件工程基础。“理解软件基础知识能让你认识到存在哪些权衡。这会让你在选择软件栈、设计系统架构、设计数据存储、测试等方面做出更好的决策。这也带来了比一个没有经验的开发者,在不了解编码代理所做的权衡的情况下,随意地编写解决方案——而这些往往是糟糕的,因为他们不知道该给编码代理提供什么上下文。”
- 是的。这一部分最接近传统的软件工程工作流程.LLM奖励专业知识——他们提升天花板(高技能开发者)远大于提高底线(低技能氛围设计师),尽管两者都有所提升。
- 使用编码代理。“有效使用代理编码已成为每位开发者的关键技能。拥有这项技能后,你就有一个很好的心理模型,了解代理的工作方式。你了解它们的局限性以及如何绕过它们,能够快速引导它们——知道该干预多少,该放手多少——构建出强大的软件,同时不浪费过多时间或代币。你还需要知道如何与明确的规格合作(以及何时不去做),协调多个协同工作的代理,避免像代理破坏你的生产数据库这样的陷阱。由于代理编码发展迅速,熟练地使用编码代理意味着不仅要掌握前沿实践,还要养成持续尝试新工具、随着最佳实践变化不断演进工作流程的习惯.”
- 当我们第一次谈论2023年获得1000X AI工程师奖当副驾驶是唯一的选择时,这一部分最不明显,但显然即将到来。2024-2026年间,编程业爆发,最终导致了Cursor的0-600亿美元史诗级连载,以及Claude Code、Codex、Cognition、Cline等其他编程巨头的崛起,这些都不是从C语言开始的。这里的灵活性是加分项,就像对带有LLM精神病的tokenmaxxs保持警惕一样。
- 塑造构建。“有效的人工智能工程需要具备产品意识,理解业务背景和客户目标,这样你就能参与塑造和推动这个构建......抓住这个机会需要知道如何推动项目向前发展。例如,知道何时快速构建一个MVP以供用户测试,以及什么时候该放慢脚步而且花更长时间才能更小心地建造。”
- 这或许是AI工程中唯一未在原文中预见到的部分;我们补充道2024年世博会的AI项目管理专题很快又包括设计工程及其他AIE相关领域,因为两边的界限开始迅速模糊。
总体来说,这是一次很棒的更新DeepLearning.AI专注。欢迎Andrew和团队!
2026年8月22日至8月24日的AI新闻。我们查了12个子版块,544条推特不再有Discord。AINews网站可以搜索所有过去的期刊。提醒一下,AINews 现已成为 Latent Space 的一个部门.你可以选择电子邮件频率!
AI推特回顾
代理线束、持久代理和企业MCP
- 线束设计正成为主要的优化表面: 多篇文章一致认为,代理质量越来越受束带而非基础模型影响。NVIDIA最新的评估工作认为,对代理“技能”的结构性检查几乎无法预测其实用性——扫描分数与评判质量仅在斯皮尔曼 ρ = 0.14——并提出测量“技能提升”相反:在相同条件下,有技能和无技能地完成同一任务,并对完成工作的差值进行评分(论文摘要通过@omarsar0).同时,一份关于人形式背带他主张企业应统一采用单一可复用的编码代理框架,而非定制的编排图,声称框架选择可能比企业工作中的模型选择更重要(摘要来自@dair_ai).
- 持久性和自我修改智能体正从概念转向开源实现:@andykonwinski介绍一头冲,一个开源的“微束”,用于持续思考而非仅凭请求思考的持久智能体。该系统将轨迹存储为 jsonl 文件的 DAG,保持自导内循环运行,据称实现了无人值守的自调试修复48分钟;权衡包括每小时1–2美元背景思维、成本和偶尔自我造成的失败。补充说,@omarsar0描述EXO一种用于递归自我改进的增强架构,具有仅附加事件日志、可交换执行器和支持快照/回滚的沙箱——明确设计使代理能够重写提示符/工具/内存而不破坏持久状态。这些帖子合起来表明,下一代智能体基础设施的兴起将是耐用性、叉形、回滚及连续工作,不仅仅是更好的提示。
- MCP正在成熟为企业基础设施:人类化推出企业管理的MCP连接器认证通过组织的身份提供者进行集中授权,使终端用户不再为Asana、Atlassian、Canva、Datadog、Figma、Notion、Slack和Supabase等连接器执行逐工具OAuth操作(@ClaudeDevs公告).另外,MCP路线图还强调了即将支持的带流式/服务器推送的长运行工作负载,本地服务器的HTTP,渐进式发现用于大型目录,标准身份/委派权限(路线图摘要,来源@_philschmid).这弥合了玩具演示与可审计企业部署之间的显著差距。
车型发布、泄露与竞争定位
- Qwen3.8-27B继续超越其级别:在Code Arena:WebDev中,Qwen 3.8-27B降落地点#9 总积分 1595 分,是同级别唯一进入前十的型号,仅比Qwen3.8-Max低六位(排行榜更新来自@arena).它在消费品、品牌/营销和游戏类别中排名也很靠前。一个相关的开源衍生版本,卡尼斯-V3-27B,由@kaiostephens: a27B,基于QwenHermes代理SFT旨在安装在消费级GPU(3090+)上,并合并了BF16和GGUF两个变体。
- 关于未发布边境模型的传闻愈发激烈:多条推文提及明显的抢先体验或未发布系统的痕迹:标识为EAP型号“克劳德·梅隆·伊普”以及“克劳德-棉花糖-EAP”据称强调三维/强化学习风格任务,并使用了许多思考符号(演示由@Lentils80);@kimmonismus收集的迹象新款Claude型号,牛阿尔法,Qwen 4,且已确认GPT Astra;以及@eliebakouch声称能接触到仍在训练中的模型,并进行了公开的W&B跑。把大部分内容当作生态系统信号而非经过验证的规范,但值得注意的是,现在讨论的焦点其实很大发布前访问不对称性而不是公开发布——呼应@michael_nielsen他警告说,控制未发布模型的访问正成为权力集中的来源。
- OpenAI和Anthropic定位仍在不断变化中:OpenAI开发者宣布GPT-5.6基罗的可用性和声称的每成功完成Terminal-Bench 2.1任务,成本降低~82%在Kiro为Terra变体设计的规范驱动环境中(公告).OpenAI 也被砍掉了GPT-5.6 索尔API定价4美元/百万以及每百万美元标记(价格说明通过@kimmonismus),竞技场更新显示太阳和月球调整了成本/绩效帕累托边界(@arena).从人为方面来看,@tenobrus指出,尽管外部测试者报告新Claude变体中度推理结果更强,但已有六个多月未有明确的Opus系列升级(@kimmonismus).
推断、基准与成本效益
- 工具延迟重叠正成为关键的线束级加速:@a1zhang介绍推测程序化工具调用(sPTC)该方法预测代码生成过程中的安全工具调用,并在环境副本早期启动,使执行与令牌生成重叠。目前报告的改善很有限——大约1.0–1.2×——但机制很重要:它将优化从代币级解码技巧转移到代理工作流程流水线.@lateinteraction将其与CPU推测执行进行比较,强调如果大多数猜测正确,丢弃的工作是可以接受的。
- 代币核算和基准卫生依然混乱: 多篇帖子指出了误导性的报道行为。@bnjmn_marie与9.189亿输入令牌,澄清了许多是缓存命中,而@cHHillee他直言不讳地认为,将缓存输入令牌计入“令牌使用”是“极其愚蠢的”。在评估方面,@jmbollenbacher警告称,当量化模型在基准测试上超过参考模型时,可能会表示量子的过拟合,不是真正的进步;@xeophon总结了更广泛的教训:修正评估可能比爬坡更重要。
- 成本归一化代理基准持续重塑模型选择:联合人工智能报告在100美元预算,GLM-5.3已完成5×多工作比寓言5大致在DeepSWE上17个任务对3个已解决任务,尽管首次尝试表现相似(推特).@reach_vb类似报道GPT-5.6 Sol Max在72.7%在DeepSWE v1.1上6.47美元/任务对抗寓言5 Max在69.7%以及21.63美元/任务.克莱恩也做了比较牛阿尔法与菲弗尔我用的是真正的bug修复,发现两者都能解决,但Ox用得很粗糙3× 输出令牌减少,表明在重新验证与基于第一个结论采取行动的培训后哲学上有明显不同的(与@cline的比较).
设备内人工智能与推理系统
- Liquid AI + Artificial Analysis 推出了严肃的设备基准测试栈:@liquidai发布移液器,一个用于设备内推断测量的开源评估套件质量、速度、延迟和内存跨模型 + 量化 + 运行时 + 设备组合,且10k+ 验证结果电压35个模型级别,7 量化,llama.cpp运行时,以及四个设备。人工分析与独立的电话级智能评估相结合,iPhone 17 Pro以及Galaxy S26 Ultra(完整讨论串).
- 手机尺度结果凸显了与云计算不同的帕累托前沿: 在8 GB 内存 / 16K 上下文框架,南贝歌4.2-3B以及LFM2.5-2.6B在63,而 LFM2.5-2.6B 在 iPhone 上效率要高得多 (8.0分,2.3 GB)比南贝格(21.4秒,4.0 GB).MoE设计,如LFM2.5-8B-A1B以及玲3.0微型值得注意的是,它们会激活~1B 参数/令牌,使电话硬件能够实现低于6秒的响应。评估还明确指出,许多“智能”推理模型与移动内存和延迟约束匹配度较差。
- 推理厂商不仅仅在原始TPS上,更在代理特定吞吐量上竞争: NVIDIA 的格罗克3 LPX被描述为在维拉·鲁宾,其中3,400个输出令牌/秒关于Gemma 4 31B在10万公里背景在人工分析基准测试中(摘要来自@kimmonismus);Groq表示,这将是最早在生产环境中部署该技术的企业之一(公告).另外,vLLM发布了大量相关内容AgentX 1.0对真实多回合编码轨迹的结果,强调KV 卸载,前缀重用, 和预填充/解码分解作为高代理吞吐量的关键,而非传统的单回合服务指标(@vllm_project).
研究、论文与技术教育
- 强化学习(LLM)和带束本土培训依然很热门:@cwolferesearch发布了一份全面的强化学习指南,涵盖了令牌级与完成级表述、PPO/GRPO变体、actor-critic方法、基于评分标准的RL以及代理RL/世界建模。这与“本土驱动”强化学习和代理环境日益受到关注的同时,这也反映在诸如这样的论文综述中@TheTuringPost以及讨论以下论文闪电特工,乐高-RL,环境束, 和技能门.
- 其他重要研究线索:Meta/USC的周期性行径μ子通过摊销昂贵的牛顿–舒尔茨更新,同时保持相较于AdamW的收益,将缪子优化扩展到更大的扩散变换器(摘要来自@iScienceLuvr);Adobe的潜在动力学推理通过模拟潜在状态演变而非直接预测未来,从像素学习外推视频世界模型(纸张通过@_akhaliq,作者注);翻筋斗报道人类运动生成的计算最优尺度定律,争论运动可能成为第五种具有类似龙猫缩放行为的模态(发射).
- 值得保存的教育内容:@fchollet推荐第15–16章使用Python的深度学习作为点积注意力为何有效的最佳易懂解释之一;@ProfTomYeh发布了一份详细的手写自我关注攻略;以及@mervenoyann宣布新家园llama.cpp文档,即将发布的作品推测解码,量子化,以及编码代理。
热门推文(按互动数)
- 产品/用户界面的实际操作性能: Anthropic 说 Claude 网页/桌面版的长回答现在可以流媒体播放~4×更顺滑,其中减少9×个摊位以及4.5×最短最严重的冻结在较慢的笔记本上(公告).
- 快速图像生成用户体验:@samdape展示了一种让GPT图像生成更快绘制的技术。
- OpenAI研究文化:@gdb补充了一篇来自@kundan2510称赞OpenAI愿意持续支持长期投资,如全双工模型。
- 学习资源:@fchollet推荐注意以下章节使用Python的深度学习是该组中信号最高的教育型职位之一。
- 企业号MCP:人类的企业管理的MCP连接器认证是生产代理部署中最具影响力的平台更新之一(公告).
AI Reddit 回顾
/r/LocalLlama + /r/localLLM 回顾
1. Qwen 3.8 27B编码与量化基准测试
- “Qwen 3.8 不是 Opus 级别”:我重新测试了一次。(活动:911):图像(链接)展示了 Deepseek/pi.dev 风格的编码束被使用
qwen3.8-27b在C#/OpenGL海洋渲染任务的“计划”模式下,支持帖子中关于线束质量强烈影响观测模型能力的观点。在作者的重播中,同一Qwen3.8模型和提示在VS Code Copilot下黑屏时失败,但在替代线束下成功,据称利用截图反馈,甚至在未启用视觉时生成PNG解码器,产生波浪、天空、太阳和水下视图1 hour在运行ninfer-nvfp4用~构建190k上下文在~150–180 tok/s.评论者普遍认为,这一结果显示出“懒惰”或沙盒编码框架与带有执行/截图反馈的代理框架之间存在巨大差距。Qwen3.8的最初批评者承认之前的结论是错误的,并开始重新测试pi.dev,发现比 VS Code/BYOM llama.cpp 崩溃更少,内存占用更低。- 一个关键技术主题是,线束质量可能主导模型能力的感知:评论者指出Qwen 3.8显然实现了“即时PNG解码器”尽管最初配置错误或执行有限,仍能正常运行海洋着色器。讨论将此框架为证据,表明像 Copilot 风格的沙盒工具可能低估了编码代理在获得适当运行/测试循环时的能力。
- 最初的测试者报告说切换是VS Code + BYOM 与llama.cpp通话到pi.dev在承认之前的安全带不够用之后。他们在 VS Code 设置中发现了两个具体问题:在生成测试可执行文件后出现驱动错误,以及在llama.cpp Lemonade SDK 的 RocM 1200 构建继续运行且无输出错误;相比之下,pi.dev没有崩溃,内存消耗明显减少。
- 有几位评论者比较了代理人的背带,比如pi.dev/OhMyPi,OpenCode,以及局部llama.cpp对这种框架所提供的自主性,超出标准的Claude式聊天流程。硬件限制也出现了:用户猜测RTX 5090或类似的高端本地GPU配置,可能配备以下工具尼弗可以使本地代理编码工作流程在无需云订阅的情况下更具可行性。
- 新 qwen3.8:27b 在 39k 线 C 转单文件 HTML / three.js 端口上(活动:655):一个一次性代理基准测试尝试移植
2.1 MB/39k-线 / ~600k-令牌单文件C程序式射击器(skill-issue)转换为单文件的 HTML/Three.js,其中源码为 >2× 可用262,144象征性上下文。在RTX 6000 Pro 96GB配vLLM、FP8权重和FP8 KV缓存时,Claude Code + Opus 5 产生了唯一“还行”的端口21 min/1759LOC,而 qwen3.8:27b 通过赫尔墨斯取得4h18m/949LOC和via codehamr(回收)1h40m/1056两者都被评为“糟糕”。评论者建议,直接的“转换此代码”提示会促使模型重新构想行为;更可靠的流水线是先生成一个转译器,获得可运行的目标语言输出,然后逐函数迭代重写,针对高级像素比较或低级寄存器/状态引用。技术讨论集中在糟糕的局部结果是更多源于提示/线束设计、缺失分解/测试,还是推理设置:多位评论者警告说FP8 KV缓存量化可能显著降低长上下文性能,建议不使用该程序重跑。也有人认为墙钟间隔是预期的,因为Anthropic可以跨越更多硬件并行化,建议先测量vLLM令牌/秒数,先规划,将单体C文件拆分成模块,并在移植前添加行为测试。- 几位评论者认为,直接“转换这个代码库”提示会导致模型重新构想即使是前沿模型,也更注重行为的源源而非保留。建议的工作流程是先让模型帮助编写目标语言的转译器,然后逐函数迭代重写,同时验证高层像素比较或低级寄存器/值痕迹,以达到像素完美等价。
- 多条评论质疑推理设置,具体来说FP8 KV缓存量化,问8,且未运行完整bf16 Qwen 27B搭载RTX 6000级显卡的型号。担忧是 KV 缓存压缩/量化可能在长上下文代码移植任务中带来严重的质量问题,且不使用 FP8 KV 缓存或完整 bf16 重运行将更好地隔离模型能力与量化伪影。
- 长运行时间的一个技术解释是反复进行KV缓存重处理vLLM:如果引擎释放会话缓存,可能会花费数分钟重新计算先前上下文,然后才生成任何新的令牌。有评论者建议用LMCache在RAM中持久化KV缓存,指出云服务商通常通过跨回合缓存处理后的上下文来避免这种延迟。
评论
?
参与讨论