llama.cpp 在 Windows 11 上安装,并下载运行第一个本地模型

想尝试一下用 llama.cpp 在本地 Windows 电脑上运行一个翻译模型,把一部分中文内容翻译成英文。折腾了一上午,终于安装好了。之前在 Windows 上使用过 Ollama, 参照前文,Ollama 安装 Google Gemma 3n 模型,整体上 llama.cpp 比 ollama 稍微麻烦一点点,但是差别不大。

llama 就是羊驼的意思🦙。。。

下载 llama.cpp

因为我想指定安装目录,毕竟这台老电脑 C 盘系统盘剩余空间不多了。于是没有使用 powershell 命令安装,而是采用直接下载 exe 可执行文件的方式。下载地址:

https://github.com/ggml-org/llama.cpp/releases

找到 Windows x64 (CPU) 版本,直接下载即可。最大的惊喜是,这个 zip 包只有 19M,比 ollama 的安装包可小太多了。印象中 ollama 有 700M 以上。解压之后,就能直接使用了。里面有一堆 exe 文件,稍后了解一下每个的作用。

然后把 llama.cpp 的解压目录设置到系统的环境变量 PATH 中,方便在命令行中调用。

下载模型

只是下载了 llama.cpp 还啥也干不了,还缺少模型。官方是推荐使用下面的命令安装模型:

# Download and run a model directly from Hugging Face
llama cli -hf ggml-org/Qwen3.5-0.8B-GGUF

# Launch OpenAI-compatible API server
llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF

但是,大家都知道,在国内是无法直接访问 Hugging Face 的。所以,就需要找到一个镜像站。

https://modelscope.cn

打开之后,在里面搜索你想安装的模型即可。例如我想安装的是 Hy-MT2-1.8B,搜索到

https://modelscope.cn/models/Tencent-Hunyuan/Hy-MT2-1.8B-GGUF

点击下载模型,按照提示,先安装 python 依赖

pip install modelscope

然后使用安装好的 modelscope 进行下载

modelscope download --model Tencent-Hunyuan/Hy-MT2-1.8B-GGUF README.md --local_dir ./dir

把 README.md 替换为你想下载的 .gguf 文件名即可。这个模型 1G 左右。

跑起来

执行

llama-server -m Hy-MT2-1.8B-Q6_K.gguf --port 8080

会看到提示:

0.00.003.588 I srv  llama_server: initializing ...
0.00.022.599 I cmn  common_param: common_params_print_info: verbosity = 3 (adjust with the `-lv N` CLI arg)
0.00.023.015 W srv  llama_server: security: no API key is set and CORS allows all origins (see https://github.com/ggml-org/llama.cpp/pull/25655)
0.00.029.825 I srv    load_model: loading model 'Hy-MT2-1.8B-Q6_K.gguf'
0.00.851.910 W load: special_eos_id is not in special_eog_ids - the tokenizer config may be incorrect
0.04.102.178 I cmn          init: llama threadpool init, n_threads = 6
0.38.440.620 I srv    load_model: initializing, n_slots = 4, n_ctx_slot = 216064, kv_unified = 'true'
0.38.547.017 I srv  llama_server: model loaded
0.38.547.623 I srv  llama_server: listening on http://127.0.0.1:8080

当看到 listening on http://127.0.0.1:8080 说明跑起来了(需要耐心等几秒钟)。这时就可以在浏览器里使用了

llama.cpp WEB UI

界面跟 DeepSeek 网页版类似。后面测试一下如何用 Python 调用,这样就能本地自动跑一些翻译任务了。长文翻译效果,参考对本篇文章做的全文翻译 Install llama.cpp on Windows 11 and download to run the first local model

继续阅读

Python 调用 llama.cpp 运行的模型

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论