扩散大模型的KV缓存与去噪过程无关
典型的语言模型是自回归的(AR):它从左到右逐个预测每个词元,每个词元的生成都依赖于其前面的词元。这带来了两个局限性:一是当后续上下文表明先前的词元可能不正确时,模型无法对其进行修正;二是生成延迟会随序列长度线性增长,因为每个词元都需要单独进行一次前向计算。
扩散语言模型则避免了这些问题。1 生成过程从一串纯噪声序列开始,在每一步中,模型同时对序列中的每一个位置预测一个更清晰的版本。
重复这一过程固定次数后,噪声序列便会逐步演化为可读的文本。由于整个序列是并行地被逐步优化的,模型在生成过程中可以随时对任意位置进行修正。
评论
?
参与讨论