Skeletoken 0.4.0 发布:词汇表合并与模型嵌入安全调整
Skeletoken 0.4.0 新增 consolidate_vocabulary 方法,自动清理因添加 normalizer 或 pre-tokenizer 导致的词汇表冗余和冲突条目,同时保持 merge table 和 token ID 一致。新增 ModelDelta 功能,在编辑词汇表后自动映射旧 token ID 到新 ID,安全调整模型 embedding 表,无需从头重新训练。支持 transformers、sentence-transformers、pylate 和 model2vec 四个框架。修复词汇合并 bug 和预处理空 token 问题,CI 升级至 Python 3.14。