Sebastian Raschka, PhD

RSS: https://sebastianraschka.com/rss_feed.xml
Sebastian Raschka 的个人主页,AI 研究员与教育者,《Build a Large Language Model (From Scratch)》作者。

语言模型用于文本分类:从词袋到 Jev

Sebastian Raschka 写的一篇长文,梳理了文本分类方法从 bag-of-words + naive Bayes/logistic regression,到词嵌入 + CNN/RNN/LSTM,再到 BERT/GPT 等 transformer 的历史脉络,并将其映射到 2026 年 Typesafe 新发布的通用分类器模型 Jev 上。 核心判断:Jev 不是"只是分类器",它把"窄问题专用模型"与"大模型零样本能力"之间的中间地带填上了——比专用分类器更通用、比 GPT 更快更便宜;但对非常窄的单一任务,专用模型仍可能更强。 作者还提到自己在 15 年前做过 bag-of-words 分类,以及 2014 年的 arXiv 早期教程,把 Jev 放进自己亲历的技术演进里。文章配了大量插图与代码链接(GitHub 上的 LR、LSTM、CNN 教程),并强调自己与 Jev 无利益关联,纯技术解读。 整体信息密度较高,带个人视角与历史纵深,对工程实践者读起来像一条清晰的"分类器简史 + Jev 定位"线索。
评论点赞收藏1 天前

关注后训练

<p>为什么我会投资经过后训练的现有开源大语言模型,以 Fireworks 的 Ember-1 为例,它在推理时更具 token 效率。</p>
评论点赞收藏2 天前

逐层嵌入(PLE):Gemma 4 小模型如何在不堆主干算力的前提下塞进更多 token 特定信息

Google 在 Gemma 4 E2B/E4B 中引入了一种叫"逐层嵌入"(PLE)的参数效率设计:token ID 先走逐层嵌入查表,同时普通 token embedding 经线性投影映射到同一 PLE 空间,两者相加缩放后按层切片。 在 transformer 块内,普通 attention+FFN 残差更新照常进行,得到的隐藏状态再门控该层的 PLE 向量,投影回模型维度后作为额外残差更新加回。 E 的"effective"含义是:主干计算量接近 2.3B/4.5B,但计入嵌入表后总参数为 5.1B/8B。作者 Sebastian Raschka 明确指出这是 Google 单方说法,效果待验证;并说明 PLE 不限于小模型,但大模型已有足够容量、且 MoE 是更主流的扩容路线。 文章附带了他从零实现的 Gemma 4 E2B/E4B 代码链接,对想啃 LLM 架构细节的读者有直接上手价值。
评论点赞收藏8 天前

Pacing 不等于放慢研发

<p>我对人工智能模型发布节奏的看法:将其作为一种用于版本检查的框架,以及围绕模型发布的竞争压力。</p>
评论点赞收藏16 天前

AI 推理模型课程上线 LinkedIn Learning

Sebastian Raschka 发布了一门 90 分钟的 LinkedIn Learning 课程,讲解 AI 推理模型(reasoning models)与传统 LLM 的关系及其开发方式。 内容偏课程推广,信息量有限。
评论点赞收藏17 天前

OpenAI Astra 与循环 Transformer

<p>关于 OpenAI Astra、递归深度、循环 Transformer、南贝格 4.2 以及《递归混合模型》论文的一则简短说明。</p>
评论点赞收藏28 天前

从零搭建推理模型:代码环境配置

Sebastian Raschka 发布从零搭建推理模型的代码教程,讲解传统 LLM 与推理模型、Agent 的关系,并提供基于 Python、PyTorch 和 uv 的环境配置方案。
评论点赞收藏31 天前

GLM-5.3-Flash 架构笔记

Sebastian Raschka 发布 GLM-5.3-Flash(前 Ox Alpha)的架构笔记,涵盖 KDA 与 MLA/DSA 混合注意力、稀疏 MoE 主干及四流 mHC 残差路径。
评论点赞收藏35 天前

Claude AI文本水印技术详解

Claude推出AI生成文本水印技术,Sebastian Raschka发布48分钟详细讲解视频说明其实现原理。水印用于标识AI生成内容,技术细节包括嵌入方式和检测机制。
评论点赞收藏39 天前

从零搭建AI文本检测器

Substack推出AI检测器后,作者从零搭建了一个AI文本检测器,并用它训练小语言模型生成绕过检测的文本。项目目标是理解AI检测器的工作原理,同时探索验证器驱动的小语言模型应用,超越传统的数学和代码推理训练。
评论点赞收藏46 天前

Meta Muse Glimmer 30B 架构笔记

Sebastian Raschka 发布 Meta Muse Glimmer 30B 的架构速览,涵盖 gated local/global GQA、KV-cache 效率优化,以及发布时的基准测试对比数据。
评论点赞收藏50 天前

Kimi K3 架构概览与笔记

<p>关于Kimi K3的简要架构说明,包括LatentMoE、Kimi Delta Attention、注意力残差、无位置编码(NoPE)、多模态能力,以及推理效率方面的设计选择。</p>
评论点赞收藏63 天前

Kimi K3 架构概览与笔记

<p>关于Kimi K3的简要架构说明,包括LatentMoE、Kimi Delta Attention、Attention Residuals、NoPE、多模态以及推理效率方面的选择。</p>
评论点赞收藏64 天前

本周几款值得关注的开源模型

<p>关于六种全新开放权重模型架构的简要说明,包括南贝格4.2、拉古纳S 2.1、Motif-3-Beta、Solar Open 2、Antares 1B 和 BTL-3。</p>
评论点赞收藏66 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。