腾讯开源微信端到端文档解析模型 WeVisDoc 一张图片直接出 Markdown
腾讯微信视觉团队开源 2B / 4B 两个文档解析模型,整页图片直接输出带 LaTeX 公式和 HTML 表格的 Markdown。它在端到端模型里四项评测都排第一,但在 PureDocBench 上综合分第一主要靠公式和表格,纯文字识别并不是最强;放进全部模型比,干净页和算法退化页仍是第一,但 OmniDocBench 输给两个流水线系统,真实拍摄页输给两个通用大模型。训练分两段:先广覆盖,再按残差分清是缺数据还是练得少。
评论
?
参与讨论