核心看点:通过58组对照实验发现,用o3-mini等推理模型替代传统RAG管线效果并不理想,关键发现是"推理≠经验"——推理模型能理解检索工具的定义,但缺乏使用工具的经验性知识(tacit knowledge),在检索质量和知识抽取上并未超越传统手动调优管线。实验设置了完整对照组:传统固定管线 vs 基于o3-mini的模块化RAG(工具全开放/受限、提示词高度结构化/开放式、中/高推理强度多种组合)。结果仅在代码生成上有改善,检索质量持平,而CoT推理大幅增加延迟。模型常常犹豫是否调用工具、难以区分检索结果优劣。文章坦诚分享了负面实验结果并指出了改进方向(更精细的提示策略、预训练/微调工具使用技能、混合架构),对正在选型RAG方案的工程师有实际参考价值。