inco.ai
暂无简介
提交点赞

DFlash 2:保持并行草稿生成

Inco AI 发布 DFlash 2 并行投机解码技术,Qwen3.8-27B 模型在 SGLang/vLLM/llama.cpp 上吞吐量达自回归解码的 2.7-3.4 倍。DFlash 2 通过路径选择器和局部卷积,在仅增加 1.3% 延迟的前提下,每轮验证输出提升 21%。NVIDIA、Google、CoreWeave 等已在其推理引擎中集成原版 DFlash,Hugging Face 下载量超 350 万次。
评论点赞收藏22 小时前

DFlash 2: Keep Drafting Parallel

Inco AI 发布 DFlash 2 并行投机解码技术,Qwen3.8-27B 模型在 SGLang/vLLM/llama.cpp 上吞吐量达自回归解码的 2.7-3.4 倍。DFlash 2 通过路径选择器和局部卷积,在仅增加 1.3% 延迟的前提下,每轮验证输出提升 21%。NVIDIA、Google、CoreWeave 等已在其推理引擎中集成原版 DFlash,Hugging Face 下载量超 350 万次。
评论点赞收藏1 天前