LLM 推理背后的记忆、调度与流式传输系统

当我刚开始研究时,我以为推理过程基本上就是这样的:
while True: logits = model(tokens) token = logits[-1].argmax() tokens.append(token),从技术上讲,这没错。
然而,这并不能说明当两个人同时使用模型时会发生什么,也无法解释模型如何保存所有历史 token,更无法解释为什么 ChatGPT 在完整回复尚未生成时就开始输出了。
Transformer 只负责预测下一个 token。在其外围还有一整套系统,负责记忆历史状态、决定接下来该为谁生成哪个 token,并将该 token 发送给对应的用户。

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论