首token延迟-大模型多久才开始回答

使用大模型时,我们对“快”通常有两种感受:一种是问题发出后,第一个字多久出现;另一种是开始回答后,后面的文字生成得是否流畅。 这很像与人对话:你问完问题后,对方可能会先停顿一下,然后才开口。TTFT(…

The post appeared first on Jake blog.

添加评论
点赞收藏
点踩分享查看原文
评论
?
参与讨论