一次对Chinchilla缩放法则的快速实测Giles Thomas用自家GPT-2风格模型实测Chinchilla缩放法则:参数和token同比例放大√2倍,测试损失确实更低,但优势仅约1%,在噪声边缘。他同时发现,把参数均匀分配到层数和隐维度上比想象中复杂得多,随便调参很容易偏差近10%。 评论点赞收藏8 天前
我在本博客中使用人工智能。Inspired by this LessWrong post, I thought I'd write about how I use AI here. This is less in the interest of disclosure, more to provide a snapshot of what I'm doing right now so that I can revisit i... 评论点赞收藏15 天前
为什么 OpenAI 的 GPT-2 权重比我自己的强?第二部分:修复 bug作者用 ChatGPT 审读评测代码时发现了一个 bug,修复后重新生成基线数据。OpenAI 的 GPT-2 权重在指令跟随评测上仍优于自己的模型。 评测流程:在 Alpaca 指令数据集的子集上多 epoch 训练,每个 epoch 结束后在验证集上计算 loss,loss 开始上升时提前终止;最终用 GPT 5.5 作为 judge 对多个模型的输出进行交叉打分。bug 影响了基线数值和模型排序,但不改变核心结论。 评论点赞收藏16 天前
为什么 OpenAI 的 GPT-2 权重比我训练的模型表现更好?GPT-2 small 在指令微调评估中得分 26.73,远超作者训练的同类模型最高分 20.71,尽管后者的测试损失更低。作者提出假设:OpenAI 权重的初始位置更接近指令微调的损失洼地,且使用了 weight tying,使其在小参数规模下表现更优。 评论点赞收藏17 天前
在RTX 3090上对Qwen 3.6 35B MoE(3B活跃)进行基准测试我在群聊里提到我买了第二台RTX 3090,一个朋友说: 我知道这不是你的菜......但请告诉我它运行得有多快 Qwen 3.6 350亿 MoE。只有24GB显存,你需要用4位量化显存 版本不同,你不会看到巨大的上下文窗口。但应该还是 挺酷的。 他说得对,这其实并不是我的风格——我一直在专注于我的 最近拥有了LLM。我决定深入挖掘,特别是玩玩Llama.cpp,我已经有一阵子没用了。然后事情变... 评论点赞收藏22 天前