Dot Net Perls

RSS: https://dotnetperls.com/rss.xml
Dot Net Perls 提供 .NET 编程示例和教程。

Reliability and Small Models

Large models with 2 billion or more parameters (such as Gemma 4 E4B) tend to be reliable in tool calling in agentic systems. But as one tries smaller and smaller models, reliability drops. Sub-1B mode...
评论点赞收藏37 天前

AI Bubble and Small Models

The AI bubble refers to the concept that the excitement about AI has led to excess investment. Many areas are contending with new data centers being built. The idea is that huge models, with trillions...
评论点赞收藏38 天前

Small Language Models (350M Parameters)

I have had good results with small language models (such as 1.2B parameters) for interacting with my MCP server. I decided to try to see how small I could go—if 1.2B worked, would 350M work, would 230...
评论点赞收藏39 天前

GNOME Resources

Yesterday I was trying to track memory usage of some programs I was running, and was using top in Ubuntu. I can never remember how to use commands with top; in any case I found the "help" section. I d...
评论点赞收藏40 天前

灵 Tiny 与大语言模型作为商品

<p>我有一台小型的MCP服务器,用于处理一些管理任务。我发现有好几种大模型都可以用来运行MCP服务器——因此我可以从Hugging Face上的GGUF文件中进行选择,根据实际需求选用最适合自己、或者速度最快的那一个。</p><figure><img src="https://www.dotnetperls.com/ling-tiny-commodity.avif"><figcaption>Ling 3.0 Tiny</figcaption></figure><p>今天,<code>llama-cpp</code>新增了对灵模型(由蚂蚁集团开发,与阿里巴巴有着某种关联)的支持。于是我下载了<code>Ling-3.0-tiny-Q4_K_M.gguf</code>,并在我的MCP服务器上试用了它。</p><p>• 运行效果非常好——速度快,调用工具非常精准。</p><p>• 它很可能完全取代了我平时常用的其他大模型,比如LFM 2.5。</p><p>• 我觉得,大模型正迅速沦为一种“商品”——许多大模型都能胜任特定的任务,而且很容易被替代。</p><p>我不确定自己是会将灵3.0 Tiny用于日常任务,还是会继续使用LFM 2.5,但能自由选择对我来说意义重大。这样我就不会被某一家供应商束缚,也不会因为使用某个特定的模型而不得不支付每月费用。</p>
评论点赞收藏44 天前

Small Model Rampages and Safety

Now that I have an agentic AI system set up (I wrote my own local MCP server) I can test different models on it. However, it became clear in testing that occasionally a model will make a "bad" tool ca...
评论点赞收藏51 天前

在 Llama-cpp 中使用 ui-mcp-proxy 解决跨域问题

作者使用 Rust 编写的 MCP 服务器调用本地大语言模型时遭遇浏览器 CORS 错误,通过 llama-cpp 的 ui-mcp-proxy 参数将 MCP 服务与 llama-server 部署在同一台机器上,彻底解决跨域问题并移除 CORS 中间件代码。
评论点赞收藏66 天前

编写本地 MCP Server 让大模型调用自定义工具

作者用 Python 和 Rust 实现了本地 MCP Server,让 LLM 能可靠调用自定义工具。Gemma 4 12B 等模型可直接通过 HTTP JSON 接口触发如 create_archive 等操作,比纯文本指令更稳定,但需注意 CORS 问题。
评论点赞收藏67 天前

用 Laguna 在 Rust 中编写测试

作者使用 Laguna XS 结合 OpenCode 优化 Rust 测试用例。发现 AI 生成的单元测试往往过于狭窄,于是利用 AI 移除大量细碎测试,替换为一个覆盖多个函数的通用测试。 结果测试数量减少但覆盖率提升,维护成本降低且代码更整洁。作者认为这是 Agentic AI 辅助工程实践的一个有效案例。
评论点赞收藏69 天前

在 OpenCode 中使用 Laguna XS 模型

Poolside AI 发布的 Laguna XS 小模型已支持 llama-cpp,作者在本地使用 OpenCode 对该模型进行代码重构测试。相比 Qwen 3.6 35B、Gemma 4 等开源模型,Laguna XS 在针对性修改任务中表现更佳,但在开放优化任务上仍有局限。
评论点赞收藏70 天前

用 AI Markdown 文件替代脚本

提出用 Markdown 文件配合本地 AI Agent(如 llama-cpp)替代传统 Bash 脚本的想法,声称自然语言指令更易维护。但也指出低质模型执行不准及文件本身仍具维护负担的问题。
评论点赞收藏71 天前

实测 Kimi K3 编程能力

<p>本周,全新模型Kimi K3正式发布,据称其质量已接近前沿级别,与Fable和GPT不相上下。<br>我决定试用一下,看看它是否能优化我的Rust程序。<br>我觉得,像“以某种方式优化这个函数”这样不够具体的任务,其实是个不错的测试方式。</p><p>Kimi K3</p><p>我在OpenCode中设置了Kimi K3,并复制了一份自己的程序目录,这样就能轻松地将所做的修改全部丢弃。<br>我向想要优化的函数发出了提示。我花了相当多的时间来优化这个函数,但似乎独自一人并没有取得太大进展。</p><p>Kimi K3给出了两条建议,我决定让其采用SWAR优化——“寄存器内SIMD”。<br>通过SWAR,一个64位值会被视为8个8位值——因此我们可以一次性处理8个u8类型的数据(单字节数据)。</p><p>Kimi K3用了大约15分钟就完成了这项任务,而且表现得非常完美。我发现,这次优化使程序的速度提升了2%。由此可见,Kimi K3不仅做出了恰当的优化方案,还毫无错误地实现了这一优化——在我看来,Kimi K3完全有资格达到广告宣传中所宣称的前沿级水平。<br><br>在OpenRouter上,每条令牌的费用约为1美元。</p>
评论点赞收藏72 天前

利用 AI 重写代码:从直接操作到生成脚本的实战反思

作者尝试用 AI 代理直接重写 Rust 代码库中的注释,发现大文件处理容易出错。最终改为让 LLM 生成 Python 脚本进行批量处理,效果更可靠且速度更快。 这一实战经验表明,让 AI 编写脚本来操作代码,比直接让 AI 重写代码更具实用价值。
评论点赞收藏79 天前

使用 llama-cpp 进行本地代码开发

针对本地大模型代码助手(如 OpenCode)在中等配置显卡上运行缓慢的问题,作者通过实验发现直接使用 llama-cpp 配合内置工具(edit file, read file)能显著减少 Prompt 大小,从而提升速度并降低系统内存占用(避免了加载整个 JavaScript 运行时)。 虽然这种方式要求用户手动管理项目信息文件,且智能体的意图猜测能力稍弱,但对于硬件资源有限的开发者来说,这是一种可行的替代方案。
评论点赞收藏81 天前

在 llama.cpp 中使用工具调用功能

作者演示了如何在 llama.cpp 中启用 Tool Calls,让本地大模型(如 Gemma、Qwen)具备读取文件或执行系统调用的能力。通过将指令写入 Markdown 文件并让模型读取,实现了类似 Bash 脚本但更易维护的代码编辑流程。
评论点赞收藏84 天前

MTP、EAGLE-3 与 DFlash 推测解码调优笔记

作者在 RTX 3060 上测试 MTP、EAGLE-3 和 DFlash 等推测解码技术,发现对 Qwen 35B 等大模型,将 spec-draft-n-max 设为 1 比设更高值更有效。 实测 DFlash 略快于 EAGLE-3,推测解码使代码模型生成速度从 24 提升至 39 tokens/s,提升 38%。建议消费级显卡用户减少推测量并使用更小的推测模型。
评论点赞收藏85 天前

DFlash:利用扩散模型加速本地 LLM 推理

Z-Lab 提出 DFlash,利用扩散模型推测下一个 token 来加速本地 LLM 推理。实测 Qwen 3 8B 在 llama-cpp 中生成代码速度从 58 提升至 123 tokens/s,但其他文本类型提升有限。 该方法适合显存未满的场景,旨在让已适配 GPU 的快速模型进一步提速。
评论点赞收藏90 天前

Why Local LLMs Are Necessary

Currently it is not feasible (for most people) to run frontier, state-of-the-art models (LLMs) locally. Data centers are needed to run these large models. However, I remain convinced that local LLMs a...
评论点赞收藏95 天前

Agentic Coding Outperforms Human

I spent an hour trying to improve a function in my Rust program. Unfortunately, after all my work, it turned out my changes made it slower, so I had to discard the new version. In dismay, I loaded a l...
评论点赞收藏98 天前

AutoRound Quantization for LLMs

When an LLM is quantized, it becomes possible to fit it onto a consumer GPU. Quantization is an important step in getting an LLM to work on many GPUs. Recently I investigated the AutoRound quantizatio...
评论点赞收藏99 天前

ComfyUI Optimal Settings

Recently I have been using ComfyUI to generate desktop backgrounds for my Ubuntu system. I have an Nvidia GPU (RTX 3060 12 GB) so I have been able to do it entirely locally. It took me a while to figu...
评论点赞收藏100 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。