Elastic 团队深入解析了其自研的向量搜索内核 simdvec。文章指出,面对多种量化类型(如 int8, BBQ)和不同硬件架构(x86/ARM),通用库难以兼顾性能与灵活性。因此,Elastic 通过 Panama FFI 调用手写优化的 C++ SIMD 内核,实现了批量打分和显式预取。基准测试显示,在数据超出 CPU 缓存的生产级规模下,simdvec 利用架构特定的内存延迟隐藏策略(x86 预取 vs ARM 交错加载),性能显著优于 FAISS 和 jvector。核心观点是:向量搜索的性能瓶颈不在于单点计算速度,而在于大规模并发下如何高效隐藏内存延迟。