把 prompt 藏进 tokenizer
<p>拥抱的脸<code>tokenizer.json</code>spec 允许你在后期处理器中隐藏提示。在这篇文章中,我将向你展示它是如何运作的,以及它如何提升代币化器的可移植性。</p><h2>前缀提示</h2><p>提示,或者更技术上说,设置系统提示,自从OpenAI允许用户通过API调用向模型发送系统提示后,已经变得无处不在。也许不太为人所知的是,许多普通变换器是在文档前缀前缀简单提示词来训练的,而不是作为单独的消息。例如,请你先做前言<code>query :</code>查询或一般文档,以及<code>passage :</code>要取回文件。这些提示词本身并非模型工件的一部分;你需要知道如何使用它们,忘记使用它们会降低性能。 我觉得最后一点特别重要:忘记添加提示会降低性能,但这种下降在不做评估的情况下很难察觉。你的模型能正常工作,只是不会达到最佳状态。</p><p>它很好地支持提示及其模型管理:提示词以字符串形式存储在<code>sentence-transformers-config.json</code>然后在文档前加上,之后整个字符串被标记化。<br><br>字符串连接的一个潜在问题是分词器可以跨提示边界分词,这可能会改变结果。</p><p>不过,我认为训练模型是很常见的<code>sentence-transformers</code>然后通过专门的服务框架来服务它们,例如:.在这样做时,你必须记得以同样的方式在同样的提示前加上。</p><p>我展示了隐藏一个<em>单…</em></p>