AI 前沿

RSS: https://magazine.sebastianraschka.com/feed
Ahead of AI,Sebastian Raschka 博士的通讯,19 万+读者,专注于机器学习与 AI 前沿研究。

语言模型用于文本分类:从词袋到 Jev

<p>最近发布的过去两周,人工智能模型在技术社区中成为了一种相当大的文化现象。</p><p>虽然Jev旨在对事物进行分类,但人们很容易把Jev当作“只是一个分类器”,而我对Jev的看法在过去几天里发生了很大变化。特别是,我的想法从“分类器曾经是我的拿手好戏;我可以轻松自己构建这个”(稍后会详细说到)变成了“哇,这实际上比我想象的还要好用。”</p><p>当然,最新的GPT和开放权重LLM可以完成与Jev相同的分类任务,同时还能进行更广泛的决策。但Jev的优势在于它能更快更低成本地处理这些分类任务。</p><p>在另一端,对于一个狭窄且明确的问题,Jev可能不会给任何比专用分类器更好、更快或更便宜的分类。但它的卖点在于它比那些任务专用模型更通用。</p><p>那么,Jev(基于有根据的猜测)背后的方法论是什么?它能做什么,为什么它如此受欢迎?我打算在文章后面回答这些问题。不过,我认为从简要的语言模型决策模型历史开始是个很好的起点。<br><br>希望这能帮助揭开一些炒作的神秘面纱,展示Jev的出色之处(“Jev本质上是一个文本分类器”,但“Jev也不仅仅是一个文本分类器”)。</p><p><em>附言:我与Jev没有任何关联。另外,我没有免费获得Jev的访问权限,这也不是产品推荐,只是一篇技术文章,旨在提供一些关于文本分类历史的见解,帮助你理解最近的炒作。</em></p><p>既然这是一篇较长的文章,<strong>我推荐,</strong>你可以在左侧访问目录菜单。</p><h2>1. 变换器出现前时代的语言建模与分类</h2><p>为了完整起见,在我们把Jev…</p>
评论点赞收藏1 天前

GPT-6 Astra、Looped Transformers与隐藏推理

OpenAI GPT-6 Astra引发热议,传闻其采用looped transformer架构并隐藏推理链。文章详细解释looped transformers概念,分析隐藏推理与架构的关系,并引用最新研究论文的新见解。
评论点赞收藏21 天前

Claude AI文本水印技术详解

Claude推出AI生成文本水印技术,Sebastian Raschka发布48分钟详细讲解视频说明其实现原理。水印用于标识AI生成内容,技术细节包括嵌入方式和检测机制。
评论点赞收藏39 天前

从零搭建AI文本检测器

<p>Substack 最近在用户界面中推出了 AI 检测功能,这简直太有趣了。</p><p>另外,很多人还向我咨询了一些有趣的本地 DIY LLM 项目,作为演示案例,用来展示小型语言模型(SLM)究竟具备怎样的能力。</p><p>将这两点结合起来,我想到,不妨通过一个实例来展示如何实现 AI 检测器。同时,我也会将其用作验证器,训练一个小型语言模型,使其生成的文本能够规避检测。<br><br>这是一个小型的教育性项目,旨在深入研究 AI 检测器的局限性,并探索基于验证器的 LLM 应用场景——超越那些仅针对数学和代码进行训练的常规推理模型。</p><p>正如上文所述,本教程的预期目标是通过构建一个(简单的)AI 检测器,来讲解 AI 检测器的工作原理。</p><p>在实际应用中,这样的检测器不仅可以用来过滤垃圾内容,还能在一定程度上提升个人写作质量,避免让文字沦为 AI 生成的文本。例如,如果你写了一篇长篇文章,想要优化拼写和语法,那么借助语法检查工具对文章进行润色、提升可读性,无疑是一种很诱人、甚至非常实用的做法。<br><br>如今市面上有多种相关服务可供选择,包括像 ChatGPT 这样的通用型 LLM。然而,这也存在一定的风险:这些工具可能会将你的文字——尽管仍然是你自己的作品——过度修饰、变得过于完美,最终听起来像是 AI 生成的内容,从而被标记为垃圾内容。</p><p>以 AI 检查工具为例,你可以这样说道:“帮我修改语法,同时确保我的文本仍然能获得 0% 的 AI 生成…</p>
评论点赞收藏46 天前

在大语言模型中控制推理精力

<p>自从OpenAI发布o1——这款模型使基于大语言模型的推理模型这一理念广为人知——已经将近两年了。<br>大约四个月后,DeepSeek-R1随之问世,并公布了基于可验证奖励的强化学习(RLVR)训练方案的详细内容,<br>用于训练此类推理模型。</p><p>上周,OpenAI发布了GPT-5.6模型系列。该系列共分为三种规模,每种规模都配备了大约五到六个不同推理强度的设置。</p><p>图1:具有不同推理强度设置的GPT 5.6 Sol模型。(目前尚无Ultra的基准测试数据,但其表现应与Max大致相当,<br>因为两者采用的推理强度水平相近,且通过四个子代理实现了工作加速。<br>)</p><p>因此,是的,推理模型将长期存在,并已成为现代模型发布中不可或缺的标准组成部分。</p><p>在过去,我……</p>
评论点赞收藏74 天前

使用本地代码智能体

作者详细演示了如何搭建完全本地的代码智能体(Coding Agent),主要使用 Qwen3.6 模型配合 Ollama 推理引擎及 Qwen-Code 框架。 文章不仅提供实操教程,还对比了不同模型在长上下文下的速度、显存占用及工具调用准确率,指出本地方案在隐私保护和成本可控上的优势。 适合希望摆脱云端 API 限制、追求数据隐私或离线编程能力的开发者参考。
评论点赞收藏93 天前

LLM Research Papers: The 2026 List (January to May)

Sebastian Raschka整理2026年1-5月LLM研究论文,按架构设计、训练效率、推理优化等10个类别分类。重点推荐Nemotron 3 Super(混合架构用Mamba-2层处理长上下文),以及Mamba-3、Gated DeltaNet-2、Scaling Embeddings Outperforms Scaling Experts等新方向。 适合追踪LLM架构演进的研究者和工程师。
评论点赞收藏114 天前

LLM架构新进展:KV共享、逐层注意力预算与压缩卷积注意力详解

Sebastian Raschka(《From Zero to LLM》作者)以个人视角深度拆解近期开源大模型的核心架构创新。本文避开数据集、训练策略、基准分数等常规内容,专注Transformer块内部的真实改动:Google Gemma 4在小型模型中引入跨层KV共享,让后20层复用前层KV张量,在128K长上下文下节省2.7-6GB显存;同时采用逐层嵌入(PLE)方案,以轻量查表方式增加模型容量而非扩大主Transformer栈。 Poolside Laguna XS.2首创逐层查询头预算分配——全局注意力层只用6个查询头/KV头,滑动窗口层用8个,把注意力容量花在更关键的层上。 Zyphra ZAYA1-8B提出压缩卷积注意力(CCA),在压缩隐空间中直接计算注意力,与DeepSeek MLA思路相近但实现路径不同。作者不仅画出每张架构图、给出具体数字和层数配置,还附上自己从零实现的代码链接,并坦诚指出Gemma 4的PLE设计"需要更多对比研究才能验证效果"。 有信息量、有判断、有可复用的工程参考价值,适合关注LLM推理效率和长上下文优化的读者。
评论点赞收藏135 天前

我理解 LLM 架构的工作流程

作者用自己的实操经验分享了一套系统化的学习工作流:当面对一个全新的开源大模型时,从论文/技术报告→架构图→代码实现→实验验证,每一步该怎么读、重点看什么、如何建立自己的理解框架。 这不是泛泛的"学习建议",而是结合了 Raschka 多年研究实践和写书经验的具体方法,包括他实际使用的工具和阅读顺序。对想系统提升 LLM 技术理解能力的新手和中级工程师来说,这篇文章提供了可复用的方法论,比单纯的知识点罗列更有长期价值。
评论点赞收藏165 天前

Components of A Coding Agent

解析编程智能体如何利用工具、记忆和仓库上下文,在实际工程中提升 LLM 的表现与可靠性。
评论点赞收藏179 天前

现代大模型注意力机制变体视觉指南

一篇以图解为核心的技术指南,系统梳理了从多头注意力(MHA)、分组查询注意力(GQA)到多查询注意力(MLA)、稀疏注意力及混合架构的演进路径。 作者 Sebastian Raschka 用清晰的示意图配合简明解释,把每种变体的设计动机、计算效率与效果权衡讲得透彻可读。对想搞清楚 LLM 内部注意力机制差异、或正在做模型推理优化的工程师来说,这是一篇信息密度很高的扫盲与进阶读物,读完能建立起完整的注意力变体知识框架。
评论点赞收藏192 天前

开源大模型的春天:2026年1–2月十大架构盘点

Sebastian Raschka 带你快速纵览 2026 年初发布的 10 个开源大模型架构,包括 DeepSeek-V3、Qwen3、Llama 4 等最新进展。文章以横向对比的方式梳理了各模型的核心设计差异——注意力机制、MoE 配置、训练策略和上下文长度等关键维度,适合做模型选型或技术调研的快速参考。 虽然没有深入每个模型的实现细节,但作为春季发布窗口的概览图,信息密度高、时效性强,是对开源 LLM 格局保持跟踪的实用入口。
评论点赞收藏217 天前

推理时扩展分类:提升 LLM 推理能力的多种方法

围绕推理时计算扩展(inference-time scaling)这一 2025–2026 年最热门的 LLM 优化方向,Raschka 系统梳理了不同技术路线的分类框架:从 Best-of-N、Tree-of-Thoughts 到过程奖励模型、连续思考链等方法。 文章同时收录了近期相关论文的摘要与定位,帮助读者在"扩展推理计算"这个快速演进的子领域里建立全局认知。对关注推理模型(如 o1、R1 系列)技术原理的从业者来说,这是一篇清晰的路线图式整理。
评论点赞收藏249 天前

2025 年 LLM 现状:进展、问题与预测

Sebastian Raschka 的 2025 年度 LLM 全景回顾,覆盖了 DeepSeek R1 与 RLVR 引发的推理模型浪潮、推理时扩展计算的爆发、基准测试的演变,以及对 2026 年的技术预测。 文章结构清晰,信息量充足,但作为年度综述,部分内容与作者其他文章有重叠,属于"一篇看全年"的总结式长文。对想系统了解 2025 年 LLM 技术主线(而非追逐每日新闻)的读者来说,这是一份可信赖的年度索引,但缺乏个人立场或争议性观点来驱动讨论。
评论点赞收藏274 天前

2025 年 LLM 研究论文精选(7–12 月)

Sebastian Raschka 为付费订阅者整理的 2025 下半年 LLM 论文书签合集,延续了上半年列表的风格。文章按主题归类了多篇重要论文,但主要以链接+简短标注的形式呈现,缺乏对每篇论文方法、贡献或局限的深入评述。 对于已经熟悉该领域的研究者来说,这是一个不错的论文追踪索引;但对普通读者而言,信息价值更多在于"有哪些论文值得关注"而不是"为什么值得深入读"。 付费墙也让部分读者无法获取完整内容。
评论点赞收藏274 天前

大语言模型预训练与后训练新范式

本文深度对比分析Qwen 2、Apple Foundation Models、Gemma 2与Llama 3.1四大最新大模型的预训练与后训练技术路线。作者Sebastian Raschka以一线研究者视角,逐一拆解各模型的数据筛选策略、多阶段训练设计、知识蒸馏应用及DPO/RLHF偏好对齐方案,穿插NeurIPS现场观察与自研开源代码实现链接。 核心洞见包括:数据质量远胜数量已成行业共识、DPO取代PPO成为主流对齐手段、Apple创新性地采用委员会式多算法融合(iTeC+Mirror Descent)策略。 文章不满足于复述论文摘要,而是从工程实践出发给出横向对比判断,是LLM训练领域难得的高质量综述,适合关注AI模型开发的技术从业者深度阅读。
评论点赞收藏275 天前

理解编码器与解码器大语言模型

机器学习畅销书作者 Sebastian Raschka 用清晰的技术笔触拆解 LLM 架构核心概念:编码器(如 BERT/RoBERTa)擅长学习文本嵌入用于分类等预测任务,解码器(如 GPT 系列)擅长自回归生成新文本,而编码器-解码器混合架构(如 BART/T5)适合翻译和摘要等输入输出映射复杂的任务。 文章从 2017 年原始 Transformer 论文讲起,逐一说明掩码语言建模、下一句预测、自回归生成等关键机制,并澄清了"编码器-only"命名其实也涉及解码过程但非自回归。 这些知识并非颠覆性新发现,但由一线研究者以亲身教学口吻娓娓道来,附论文引用和架构演进总览图,适合想系统理解 LLM 技术分类的读者作为入门参考。
评论点赞收藏285 天前

从 DeepSeek V3 到 V3.2:架构演进、稀疏注意力与强化学习更新

深度拆解 DeepSeek 旗舰开源模型从 V3 到 V3.2 的技术演进路径,重点覆盖了架构设计变化、稀疏注意力机制的引入方式,以及强化学习训练策略的迭代。 Raschka 以一贯的清晰技术写作风格,把每次版本迭代的核心改动、设计动机和实际效果影响讲得具体可操作。对于关注 DeepSeek 系列、想理解其开源模型技术细节的工程师和研究者来说,这是一篇高质量的技术追踪文章,信息密度和准确性都在线。
评论点赞收藏301 天前

超越标准 Transformer:线性注意力混合、文本扩散、代码世界模型与小递归 Transformer

跳出标准 Transformer 架构,Raschka 介绍了四类前沿替代方案:线性注意力混合架构(兼顾效率与质量)、文本扩散模型(生成方式的新范式)、代码世界模型(将代码生成视为世界建模),以及小型递归 Transformer(在参数量受限下的新思路)。 每个方向都给出了技术背景、代表性论文和当前局限。对于想了解"Transformer 之后还有什么"的技术前瞻者来说,这篇文章提供了难得的结构化概览,信息密度高且不浮于表面。
评论点赞收藏330 天前

从零理解 LLM 评估的四大方法:选择题基准、验证器、排行榜与 LLM 裁判

系统梳理 LLM 评估的四种主流方法论:多项选择基准(如 MMLU、GSM8K)、验证器方法(过程奖励模型)、排行榜机制以及 LLM-as-Judge 范式,每种方法都附带了代码示例。 Raschka 胜在能把一个容易被轻视的"评估"话题讲出技术深度——不只是告诉你有哪些评估方式,而是解释每种方法为什么有效、有什么局限、在什么场景下适用。 对于需要为自己的模型或应用设计评估体系的工程师,这是一篇兼具理论框架和实操参考的高质量文章。
评论点赞收藏360 天前

深入理解并从头实现 Qwen3

以 Qwen3 为案例,Raschka 详细解读了该开源模型的核心架构并提供了从零实现的指导。文章覆盖了 Qwen3 的注意力机制设计、MoE 路由策略、训练细节和推理优化方案,不是停留在论文复述层面,而是结合代码实现拆解每个设计的实际效果。 对于想深入理解一个具体前沿模型而非仅看概览的研究者和工程师来说,这种方式比读原始论文更亲切实用——Raschka 把论文中的数学符号翻译成了可运行的工程思路。
评论点赞收藏389 天前

从 GPT-2 到 gpt-oss:架构演进分析

Sebastian Raschka 分析了从 GPT-2 到开源 GPT 模型(gpt-oss)的架构演进,并与 Qwen3 进行对比。对于关注 Transformer 架构演变和开源模型对比的读者,提供了一手技术拆解和有价值的参照系。
评论点赞收藏417 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。