vLLM-iOS:在 iPhone 上用 Swift 实现连续批处理,8 路并发提速 88%
Jon Ready 把 vLLM 的连续批处理架构移植到 iOS 原生 Swift + MLX,8 路并发比 llama.cpp 快 88%。iPhone 16 Pro 实测:8 个 agent 同时推理 385 token 仅需 2.9 秒。 量化和批处理是本地推理速度的两个核心杠杆——8-bit 到 4-bit 让单流从 51 提升到 103 tok/s,批处理再翻到 199 tok/s 聚合。手机 GPU 全速运行约 15-20 秒就会触发温控降频,批处理让 16 个研究请求在单个热预算内完成,llama.cpp 需要两个热预算。 项目已开源。