Sebastian Raschka, PhD

RSS: https://sebastianraschka.com/rss_feed.xml
Sebastian Raschka 的个人主页,AI 研究员与教育者,《Build a Large Language Model (From Scratch)》作者。

从零搭建AI文本检测器

Substack推出AI检测器后,作者从零搭建了一个AI文本检测器,并用它训练小语言模型生成绕过检测的文本。项目目标是理解AI检测器的工作原理,同时探索验证器驱动的小语言模型应用,超越传统的数学和代码推理训练。
评论点赞收藏21 小时前

Claude 文本水印技术解析

Claude 文本水印机制的技术解析。Anthropic 通过在生成文本的 token 分布中嵌入统计标记来标识 AI 生成内容,具体方法基于官方发布材料。
评论点赞收藏1 天前

Meta Muse Glimmer 30B 架构笔记

Sebastian Raschka 发布 Meta Muse Glimmer 30B 的架构速览,涵盖 gated local/global GQA、KV-cache 效率优化,以及发布时的基准测试对比数据。
评论点赞收藏5 天前

Kimi K3 架构概览与笔记

Kimi K3 是 Kimi Linear 的放大版,参数规模从 48B 扩展到 2.8T,是目前最大的开源模型。它引入了 LatentMoE、注意力残差连接和 NoPE 位置嵌入等创新,并原生支持多模态。文章详细分析了这些组件的原理和影响,提供了技术细节和比较。
评论点赞收藏18 天前

Kimi K3 架构概览与笔记

关于Kimi K3的简要架构说明,包括LatentMoE、Kimi Delta Attention、Attention Residuals、NoPE、多模态以及推理效率方面的选择。
评论点赞收藏19 天前

控制大模型的推理努力程度

Sebastian Raschka 探讨大语言模型如何学习低、中、高三种推理努力模式。文章聚焦于控制模型在解决问题时的计算资源投入与推理深度之间的平衡,涉及训练策略与推理效率的工程权衡。
评论点赞收藏28 天前

我的博客订阅者达到20万

Sebastian Raschka 宣布其独立研究博客订阅数突破20万,感谢读者支持。文中提及正在撰写新文章,预计下周发布。
评论点赞收藏34 天前

GPT 5.6 的 72 种配置:什么是好的默认值?

Sebastian Raschka 分析了 GPT 5.6 模型在训练时间和推理时间扩展上的组合,得出 72 种可能的配置选项。文章探讨了不同 effort 选择如何映射到具体的缩放策略,为开发者在部署大模型时提供配置参考和权衡思路。
评论点赞收藏37 天前

在编程工具链中使用本地开源大模型

作者 Sebastian Raschka 分享了他尝试在本地运行开源权重大模型(如 Qwen-Code、Codex 和 Claude Code)的经验。这是一篇简短的技术笔记,主要关注这些模型在编程辅助场景下的实际表现。
评论点赞收藏50 天前

VibeThinker-3B:后训练对模型能力的决定性作用

分析 VibeThinker-3B 模型,该模型基于 Qwen2.5-Coder-3B,通过强大的后训练(Post-Training)显著提升了编码和推理能力。强调了在基础架构之上,后训练数据和质量对模型最终表现的关键影响,观点鲜明。
评论点赞收藏60 天前

Nemotron 3 Ultra与潜在MoE扩展

文章介绍了NVIDIA发布的Nemotron 3 Ultra模型。该模型总参数量为550B,激活参数为55B,采用混合Mamba-Transformer的潜在MoE架构。内容侧重于技术规格和扩展性分析。
评论点赞收藏72 天前

MiniMax M2 技术报告简析:全注意力与细粒度 MoE 设计

Sebastian Raschka 对 MiniMax-M2 技术报告的解读。核心亮点包括采用 Full Attention 而非稀疏机制,结合细粒度 MoE 架构,以及针对 Agent 管道和速度奖励的自我进化策略。对于关注模型底层架构设计和推理效率优化的工程师有参考价值。
评论点赞收藏80 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。