用 LLM 搜索相关性评估时,检查两次,再做一次判断
作者基于 WANDS 家具电商搜索数据集,探讨如何用 LLM 做 pairwise 搜索相关性评估,并与人类标注员偏好对齐。核心发现:(1) 允许 LLM 回答"不确定/两者都不是"可提升 precision 但大幅降低 recall;(2) 关键技巧是"双向检查"——交换 LHS/RHS 产品顺序各问一次,取两次一致的结果,可显著消除 LLM 的位置偏差;(3) 组合"双向检查 + 允许弃权"可达到最高 precision(90.76%),但 recall 降至 11.9%。 作者还对比了仅用 product name、class、分类层级、description 等不同字段的评估效果,给出完整的 confusion matrix。对做 LLM-as-judge 搜索评估的团队有直接工程参考价值,"双向检查去位置偏差"是一个实用且易被忽略的技巧。 文末有课程推广。 







