从零搭建AI文本检测器Substack推出AI检测器后,作者从零搭建了一个AI文本检测器,并用它训练小语言模型生成绕过检测的文本。项目目标是理解AI检测器的工作原理,同时探索验证器驱动的小语言模型应用,超越传统的数学和代码推理训练。 评论点赞收藏21 小时前
Claude 文本水印技术解析Claude 文本水印机制的技术解析。Anthropic 通过在生成文本的 token 分布中嵌入统计标记来标识 AI 生成内容,具体方法基于官方发布材料。 评论点赞收藏1 天前
《从零构建推理模型》已在 Amazon 上架,附盗版警告Sebastian Raschka 的《Build a Reasoning Model From Scratch》已在 Amazon 上架,但印度区出现黑白盗版翻印,建议通过官方渠道购买。 评论点赞收藏4 天前
Meta Muse Glimmer 30B 架构笔记Sebastian Raschka 发布 Meta Muse Glimmer 30B 的架构速览,涵盖 gated local/global GQA、KV-cache 效率优化,以及发布时的基准测试对比数据。 评论点赞收藏5 天前
《从零开始构建 LLM》仓库 GitHub 星标突破 10 万Sebastian Raschka 的 LLMs From Scratch 仓库 GitHub 星标突破 10 万。帖子简要总结了仓库中的学习材料内容。 评论点赞收藏8 天前
Kimi K3 架构概览与笔记Kimi K3 是 Kimi Linear 的放大版,参数规模从 48B 扩展到 2.8T,是目前最大的开源模型。它引入了 LatentMoE、注意力残差连接和 NoPE 位置嵌入等创新,并原生支持多模态。文章详细分析了这些组件的原理和影响,提供了技术细节和比较。 评论点赞收藏18 天前
Kimi K3 架构概览与笔记关于Kimi K3的简要架构说明,包括LatentMoE、Kimi Delta Attention、Attention Residuals、NoPE、多模态以及推理效率方面的选择。 评论点赞收藏19 天前
本周几款值得关注的开源模型关于六种全新开放权重模型架构的简要说明,包括南贝格4.2、拉古纳S 2.1、Motif-3-Beta、Solar Open 2、Antares 1B 和 BTL-3。 评论点赞收藏21 天前
《从零构建推理模型》第6.5节代码勘误Sebastian Raschka 发布勘误,修正其新书《Build a Reasoning Model From Scratch》第198页代码清单6.5中的随机种子设置。 评论点赞收藏22 天前
控制大模型的推理努力程度Sebastian Raschka 探讨大语言模型如何学习低、中、高三种推理努力模式。文章聚焦于控制模型在解决问题时的计算资源投入与推理深度之间的平衡,涉及训练策略与推理效率的工程权衡。 评论点赞收藏28 天前
英克林:一款全新开放式重量975B莫伊,还带有一些惊喜。简要介绍思考机器实验室的975B Inkling开重模型,其基准性能曲线、稀疏MoE设计、短卷积、嵌入式RMSNorm以及相对位置偏置。 评论点赞收藏30 天前
GPT 5.6 的 72 种配置:什么是好的默认值?Sebastian Raschka 分析了 GPT 5.6 模型在训练时间和推理时间扩展上的组合,得出 72 种可能的配置选项。文章探讨了不同 effort 选择如何映射到具体的缩放策略,为开发者在部署大模型时提供配置参考和权衡思路。 评论点赞收藏37 天前
在编程工具链中使用本地开源大模型作者 Sebastian Raschka 分享了他尝试在本地运行开源权重大模型(如 Qwen-Code、Codex 和 Claude Code)的经验。这是一篇简短的技术笔记,主要关注这些模型在编程辅助场景下的实际表现。 评论点赞收藏50 天前
GLM-5.2与IndexShare:面向长上下文的稀疏注意力优化关于 GLM-5.2 的简短说明:这是一项开放权重的 GLM 更新,它保留了 GLM-5 稀疏 MoE 背骨结构,并新增了 IndexShare 功能,以实现更低成本的 100 万 token DSA 推理。 评论点赞收藏59 天前
VibeThinker-3B:后训练对模型能力的决定性作用分析 VibeThinker-3B 模型,该模型基于 Qwen2.5-Coder-3B,通过强大的后训练(Post-Training)显著提升了编码和推理能力。强调了在基础架构之上,后训练数据和质量对模型最终表现的关键影响,观点鲜明。 评论点赞收藏60 天前
North Mini Code:Cohere 的 Agentic 编码 MoE 模型关于北迷你代码的简短说明:Cohere 的 30B 总量和 3B 活跃开放权重 MoE 模型,用于代理编码任务。 评论点赞收藏64 天前
Nemotron 3 Ultra与潜在MoE扩展文章介绍了NVIDIA发布的Nemotron 3 Ultra模型。该模型总参数量为550B,激活参数为55B,采用混合Mamba-Transformer的潜在MoE架构。内容侧重于技术规格和扩展性分析。 评论点赞收藏72 天前
MiniMax M2 技术报告简析:全注意力与细粒度 MoE 设计Sebastian Raschka 对 MiniMax-M2 技术报告的解读。核心亮点包括采用 Full Attention 而非稀疏机制,结合细粒度 MoE 架构,以及针对 Agent 管道和速度奖励的自我进化策略。对于关注模型底层架构设计和推理效率优化的工程师有参考价值。 评论点赞收藏80 天前