AI 前沿

RSS: https://magazine.sebastianraschka.com/feed
Ahead of AI,Sebastian Raschka 博士的通讯,19 万+读者,专注于机器学习与 AI 前沿研究。

从零搭建AI文本检测器

Substack 最近在用户界面中推出了 AI 检测功能,这简直太有趣了。 另外,很多人还向我咨询了一些有趣的本地 DIY LLM 项目,作为演示案例,用来展示小型语言模型(SLM)究竟具备怎样的能力。 将这两点结合起来,我想到,不妨通过一个实例来展示如何实现 AI 检测器。同时,我也会将其用作验证器,训练一个小型语言模型,使其生成的文本能够规避检测。这是一个小型的教育性项目,旨在深入研究 AI ...
评论点赞收藏21 小时前

在大语言模型中控制推理精力

自从OpenAI发布o1——这款模型使基于大语言模型的推理模型这一理念广为人知——已经将近两年了。 大约四个月后,DeepSeek-R1随之问世,并公布了基于可验证奖励的强化学习(RLVR)训练方案的详细内容, 用于训练此类推理模型。 上周,OpenAI发布了GPT-5.6模型系列。该系列共分为三种规模,每种规模都配备了大约五到六个不同推理强度的设置。 图1:具有不同推理强度设置的GPT 5....
评论点赞收藏28 天前

使用本地代码智能体

作者详细演示了如何搭建完全本地的代码智能体(Coding Agent),主要使用 Qwen3.6 模型配合 Ollama 推理引擎及 Qwen-Code 框架。文章不仅提供实操教程,还对比了不同模型在长上下文下的速度、显存占用及工具调用准确率,指出本地方案在隐私保护和成本可控上的优势。适合希望摆脱云端 API 限制、追求数据隐私或离线编程能力的开发者参考。
评论点赞收藏48 天前

LLM架构新进展:KV共享、逐层注意力预算与压缩卷积注意力详解

Sebastian Raschka(《From Zero to LLM》作者)以个人视角深度拆解近期开源大模型的核心架构创新。本文避开数据集、训练策略、基准分数等常规内容,专注Transformer块内部的真实改动:Google Gemma 4在小型模型中引入跨层KV共享,让后20层复用前层KV张量,在128K长上下文下节省2.7-6GB显存;同时采用逐层嵌入(PLE)方案,以轻量查表方式增加模型容量而非扩大主Transformer栈。Poolside Laguna XS.2首创逐层查询头预算分配——全局注意力层只用6个查询头/KV头,滑动窗口层用8个,把注意力容量花在更关键的层上。Zyphra ZAYA1-8B提出压缩卷积注意力(CCA),在压缩隐空间中直接计算注意力,与DeepSeek MLA思路相近但实现路径不同。作者不仅画出每张架构图、给出具体数字和层数配置,还附上自己从零实现的代码链接,并坦诚指出Gemma 4的PLE设计"需要更多对比研究才能验证效果"。有信息量、有判断、有可复用的工程参考价值,适合关注LLM推理效率和长上下文优化的读者。
评论点赞收藏89 天前

我理解 LLM 架构的工作流程

作者用自己的实操经验分享了一套系统化的学习工作流:当面对一个全新的开源大模型时,从论文/技术报告→架构图→代码实现→实验验证,每一步该怎么读、重点看什么、如何建立自己的理解框架。这不是泛泛的"学习建议",而是结合了 Raschka 多年研究实践和写书经验的具体方法,包括他实际使用的工具和阅读顺序。对想系统提升 LLM 技术理解能力的新手和中级工程师来说,这篇文章提供了可复用的方法论,比单纯的知识点罗列更有长期价值。
评论点赞收藏119 天前

现代大模型注意力机制变体视觉指南

一篇以图解为核心的技术指南,系统梳理了从多头注意力(MHA)、分组查询注意力(GQA)到多查询注意力(MLA)、稀疏注意力及混合架构的演进路径。作者 Sebastian Raschka 用清晰的示意图配合简明解释,把每种变体的设计动机、计算效率与效果权衡讲得透彻可读。对想搞清楚 LLM 内部注意力机制差异、或正在做模型推理优化的工程师来说,这是一篇信息密度很高的扫盲与进阶读物,读完能建立起完整的注意力变体知识框架。
评论点赞收藏146 天前

开源大模型的春天:2026年1–2月十大架构盘点

Sebastian Raschka 带你快速纵览 2026 年初发布的 10 个开源大模型架构,包括 DeepSeek-V3、Qwen3、Llama 4 等最新进展。文章以横向对比的方式梳理了各模型的核心设计差异——注意力机制、MoE 配置、训练策略和上下文长度等关键维度,适合做模型选型或技术调研的快速参考。虽然没有深入每个模型的实现细节,但作为春季发布窗口的概览图,信息密度高、时效性强,是对开源 LLM 格局保持跟踪的实用入口。
评论点赞收藏171 天前

推理时扩展分类:提升 LLM 推理能力的多种方法

围绕推理时计算扩展(inference-time scaling)这一 2025–2026 年最热门的 LLM 优化方向,Raschka 系统梳理了不同技术路线的分类框架:从 Best-of-N、Tree-of-Thoughts 到过程奖励模型、连续思考链等方法。文章同时收录了近期相关论文的摘要与定位,帮助读者在"扩展推理计算"这个快速演进的子领域里建立全局认知。对关注推理模型(如 o1、R1 系列)技术原理的从业者来说,这是一篇清晰的路线图式整理。
评论点赞收藏203 天前

2025 年 LLM 现状:进展、问题与预测

Sebastian Raschka 的 2025 年度 LLM 全景回顾,覆盖了 DeepSeek R1 与 RLVR 引发的推理模型浪潮、推理时扩展计算的爆发、基准测试的演变,以及对 2026 年的技术预测。文章结构清晰,信息量充足,但作为年度综述,部分内容与作者其他文章有重叠,属于"一篇看全年"的总结式长文。对想系统了解 2025 年 LLM 技术主线(而非追逐每日新闻)的读者来说,这是一份可信赖的年度索引,但缺乏个人立场或争议性观点来驱动讨论。
评论点赞收藏228 天前

2025 年 LLM 研究论文精选(7–12 月)

Sebastian Raschka 为付费订阅者整理的 2025 下半年 LLM 论文书签合集,延续了上半年列表的风格。文章按主题归类了多篇重要论文,但主要以链接+简短标注的形式呈现,缺乏对每篇论文方法、贡献或局限的深入评述。对于已经熟悉该领域的研究者来说,这是一个不错的论文追踪索引;但对普通读者而言,信息价值更多在于"有哪些论文值得关注"而不是"为什么值得深入读"。付费墙也让部分读者无法获取完整内容。
评论点赞收藏228 天前

大语言模型预训练与后训练新范式

本文深度对比分析Qwen 2、Apple Foundation Models、Gemma 2与Llama 3.1四大最新大模型的预训练与后训练技术路线。作者Sebastian Raschka以一线研究者视角,逐一拆解各模型的数据筛选策略、多阶段训练设计、知识蒸馏应用及DPO/RLHF偏好对齐方案,穿插NeurIPS现场观察与自研开源代码实现链接。核心洞见包括:数据质量远胜数量已成行业共识、DPO取代PPO成为主流对齐手段、Apple创新性地采用委员会式多算法融合(iTeC+Mirror Descent)策略。文章不满足于复述论文摘要,而是从工程实践出发给出横向对比判断,是LLM训练领域难得的高质量综述,适合关注AI模型开发的技术从业者深度阅读。
评论点赞收藏230 天前

理解编码器与解码器大语言模型

机器学习畅销书作者 Sebastian Raschka 用清晰的技术笔触拆解 LLM 架构核心概念:编码器(如 BERT/RoBERTa)擅长学习文本嵌入用于分类等预测任务,解码器(如 GPT 系列)擅长自回归生成新文本,而编码器-解码器混合架构(如 BART/T5)适合翻译和摘要等输入输出映射复杂的任务。文章从 2017 年原始 Transformer 论文讲起,逐一说明掩码语言建模、下一句预测、自回归生成等关键机制,并澄清了"编码器-only"命名其实也涉及解码过程但非自回归。这些知识并非颠覆性新发现,但由一线研究者以亲身教学口吻娓娓道来,附论文引用和架构演进总览图,适合想系统理解 LLM 技术分类的读者作为入门参考。
评论点赞收藏240 天前

从 DeepSeek V3 到 V3.2:架构演进、稀疏注意力与强化学习更新

深度拆解 DeepSeek 旗舰开源模型从 V3 到 V3.2 的技术演进路径,重点覆盖了架构设计变化、稀疏注意力机制的引入方式,以及强化学习训练策略的迭代。Raschka 以一贯的清晰技术写作风格,把每次版本迭代的核心改动、设计动机和实际效果影响讲得具体可操作。对于关注 DeepSeek 系列、想理解其开源模型技术细节的工程师和研究者来说,这是一篇高质量的技术追踪文章,信息密度和准确性都在线。
评论点赞收藏255 天前

超越标准 Transformer:线性注意力混合、文本扩散、代码世界模型与小递归 Transformer

跳出标准 Transformer 架构,Raschka 介绍了四类前沿替代方案:线性注意力混合架构(兼顾效率与质量)、文本扩散模型(生成方式的新范式)、代码世界模型(将代码生成视为世界建模),以及小型递归 Transformer(在参数量受限下的新思路)。每个方向都给出了技术背景、代表性论文和当前局限。对于想了解"Transformer 之后还有什么"的技术前瞻者来说,这篇文章提供了难得的结构化概览,信息密度高且不浮于表面。
评论点赞收藏284 天前

从零理解 LLM 评估的四大方法:选择题基准、验证器、排行榜与 LLM 裁判

系统梳理 LLM 评估的四种主流方法论:多项选择基准(如 MMLU、GSM8K)、验证器方法(过程奖励模型)、排行榜机制以及 LLM-as-Judge 范式,每种方法都附带了代码示例。Raschka 胜在能把一个容易被轻视的"评估"话题讲出技术深度——不只是告诉你有哪些评估方式,而是解释每种方法为什么有效、有什么局限、在什么场景下适用。对于需要为自己的模型或应用设计评估体系的工程师,这是一篇兼具理论框架和实操参考的高质量文章。
评论点赞收藏314 天前

深入理解并从头实现 Qwen3

以 Qwen3 为案例,Raschka 详细解读了该开源模型的核心架构并提供了从零实现的指导。文章覆盖了 Qwen3 的注意力机制设计、MoE 路由策略、训练细节和推理优化方案,不是停留在论文复述层面,而是结合代码实现拆解每个设计的实际效果。对于想深入理解一个具体前沿模型而非仅看概览的研究者和工程师来说,这种方式比读原始论文更亲切实用——Raschka 把论文中的数学符号翻译成了可运行的工程思路。
评论点赞收藏343 天前

从 GPT-2 到 gpt-oss:架构演进分析

Sebastian Raschka 分析了从 GPT-2 到开源 GPT 模型(gpt-oss)的架构演进,并与 Qwen3 进行对比。对于关注 Transformer 架构演变和开源模型对比的读者,提供了一手技术拆解和有价值的参照系。
评论点赞收藏371 天前

大模型架构大对比:从 DeepSeek-V3 到 Kimi K2

横向对比从 DeepSeek-V3 到 Kimi K2 等多个主流 LLM 的架构设计选择,包括注意力变体、MoE 配置、层归一化策略、序列长度与训练数据配比等核心维度。Raschka 的对比不是简单的表格罗列,而是解释了每项设计选择背后的复杂度-效果权衡。对于需要在不同开源模型之间做技术选型、或希望理解"当前最强模型为什么这么设计"的工程师来说,这篇文章的系统性和专业度都值得信赖。
评论点赞收藏392 天前

2025 年 LLM 研究论文精选(1–6 月)

2025 上半年 LLM 论文索引合集,按主题组织收录了 200+ 篇论文。与下半年列表一样,文章以链接+简短归类为主,缺少实质性的技术评述或横向对比。对于深耕该领域的研究者来说是一个可用的 bookmark 资源,但作为独立文章来看,原创信息密度偏低,更像一个带注释的参考文献列表。如果没有付费订阅可能也无法查看完整内容,进一步限制了实用性。
评论点赞收藏410 天前

从零理解并编程实现 LLM 中的 KV 缓存

KV Cache 是 LLM 推理中最关键的优化技术之一,Raschka 用自己标志性的"从零实现"风格,先讲清楚 KV Cache 为什么能加速自回归推理(避免重复计算 Key 和 Value),再逐步写出可运行代码。文章把理论与工程实践的衔接处理得非常到位——你不仅能理解原理,还能真正动手写出来。对于正在做 LLM 推理加速、服务部署或模型量化的工程师来说,这是极少数能把 KV Cache 讲透又能直接转化为代码的教材级内容。
评论点赞收藏424 天前

从零写大模型:完整课程上线

Sebastian Raschka 推出了一门从零开始动手实现 LLM 的完整课程,延续了他同名畅销书的教学思路——用代码而不是数学公式来理解大模型。课程覆盖了从 tokenizer、注意力机制、Transformer 层到训练和推理的完整链路。文章本身是课程介绍,但作者分享了不少教学设计背后的思考,以及读者反馈("很多读者说学得很开心"),让这篇发布文有了真实的人味和教学热情。对想真正动手理解 LLM 而非只看论文摘要的学习者来说,这是值得收藏的资源入口。
评论点赞收藏462 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。