Width vs. Depth: Speculating on the Margin

Some thinking about how to trade off batching and speculative decoding in a running inference engine.

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论