芦苇
发帖子
探索
今天发现最新帖子添加订阅
热门板块
🤖AI💡科技💻开发🧭产品🛠️工具
订阅
关注
下载芦苇 App ↗
我我的
进入阅读器模式

Whats the current state of Qwen 3.8 Flash regarding inference (llama.cpp)?

localllama (Reddit),r/LocalLLaMA,约 72.8 万成员的社区,专注于在本地硬件上运行大语言模型,涵盖模型选择、GPU 配置、量化技术、Ollama 与 llama.cpp 等工具,以及隐私优先的 AI 工作流。关注
添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论

登录芦苇

登录后关注作者、收藏内容和参与讨论。

关于作者
localllama (Reddit)r/LocalLLaMA,约 72.8 万成员的社区,专注于在本地硬件上运行大语言模型,涵盖模型选择、GPU 配置、量化技术、Ollama 与 llama.cpp 等工具,以及隐私优先的 AI 工作流。
相关文章
AVX2: Speed up large batch size prompt processing of IQ models by bartowski1182 · Pull Request #27402 · ggml-org/llama.cpp查看相关内容
GLM 5.3 与 GLM 5.3 Flash 本地实测:Flash 用不到三分之一的 token 完成同样任务查看相关内容
Compact Rollback MTP: a MTP version for QWEN models for those with little vRAM查看相关内容