Substack 最近在用户界面中推出了 AI 检测功能,这简直太有趣了。 另外,很多人还向我咨询了一些有趣的本地 DIY LLM 项目,作为演示案例,用来展示小型语言模型(SLM)究竟具备怎样的能力。 将这两点结合起来,我想到,不妨通过一个实例来展示如何实现 AI 检测器。同时,我也会将其用作验证器,训练一个小型语言模型,使其生成的文本能够规避检测。这是一个小型的教育性项目,旨在深入研究 AI ...
LLM Research Papers: The 2026 List (January to May) As some of you know, I have the long-running habit of keeping a running list of research papers I want to read, revisit, or cite in future articles ...
Sebastian Raschka(《From Zero to LLM》作者)以个人视角深度拆解近期开源大模型的核心架构创新。本文避开数据集、训练策略、基准分数等常规内容,专注Transformer块内部的真实改动:Google Gemma 4在小型模型中引入跨层KV共享,让后20层复用前层KV张量,在128K长上下文下节省2.7-6GB显存;同时采用逐层嵌入(PLE)方案,以轻量查表方式增加模型容量而非扩大主Transformer栈。Poolside Laguna XS.2首创逐层查询头预算分配——全局注意力层只用6个查询头/KV头,滑动窗口层用8个,把注意力容量花在更关键的层上。Zyphra ZAYA1-8B提出压缩卷积注意力(CCA),在压缩隐空间中直接计算注意力,与DeepSeek MLA思路相近但实现路径不同。作者不仅画出每张架构图、给出具体数字和层数配置,还附上自己从零实现的代码链接,并坦诚指出Gemma 4的PLE设计"需要更多对比研究才能验证效果"。有信息量、有判断、有可复用的工程参考价值,适合关注LLM推理效率和长上下文优化的读者。