诊断与缓解 MiMo-v2.6 中的工具调用重复
小米 MiMo 团队披露 MiMo-V2.6 在 RL 训练后出现工具调用重复问题:模型在 agent 场景中反复发出相同或高度相似的 tool call,导致上下文浪费。 文章区分了并行调用、洪水调用与重复调用的定义,用精确指标(同回合内 JSON 规范化后工具名+参数完全相同)量化重复率,并展示了不同 harness 下的重复率与 RL 各 step 的变化。 直接降阈惩罚方案成本高(约 231 万美元)且泛化性差;团队最终采用 MOPD(多教师 on-policy 蒸馏)方法,训练专用 RL 教师学习"何时停止",仅用约 9 万美元成本(MixRL 方案的 4%)即显著降低重复率,同时整体基准成绩稳定。 开源了 MOPD 检查点,并重置了 MiMo Desktop 用户配额。