Elastic

Elastic,Elasticsearch 与 Kibana 的母公司,提供企业搜索、可观测性与安全解决方案,帮助用户从数据中实时获取洞察。

Elasticsearch 多模态语义搜索:semantic 字段使用指南

Elasticsearch 9.5 推出 semantic 字段,支持图片、音频、视频和 PDF 的多模态向量搜索,所有模态共享同一向量空间,可通过文本描述检索图片或用视频片段匹配音频。技术预览版,需配置推理端点,输入文件默认上限 1MB。
评论点赞收藏10 天前

从未唤醒的磁盘:Elasticsearch 与 Qdrant 的基准测试罗生门

Elastic 复现并拆解了与 Qdrant 的向量搜索基准测试争议。通过严格对照硬件与参数,发现此前双方互指的性能差距主要源于段数量、文档检索开销及内存缓存状态,而非所谓的 io_uring 磁盘读取瓶颈。文章揭示了 HNSW 架构在段合并上的权衡,以及 Elasticsearch 在快速索引下的实际表现,为选型提供了基于工程细节的参考。
评论点赞收藏32 天前

Elastic 的 Agentic SOC:利用工作流和 AI Agent 自动化告警初筛

Elastic 内部团队构建了一套基于原生栈的 Agentic SOC 系统,将告警初筛时间从 30 分钟压缩至 3 分钟以内。核心策略是用确定性的 ES|QL 查询零成本关闭大量误报,仅对模糊告警调用 AI Agent。文章详细拆解了从工作流编排、上下文富集到专用 Agent(如 macOS 取证)及最终审核 Agent 的完整架构,强调通过限制 Agent 权限和细化提示词来降低 Token 消耗并提高一致性。这对处理海量告警的安全团队具有极高的工程参考价值。
评论点赞收藏40 天前

我们在 Elasticsearch 上构建了持久化 Agent 记忆层,召回率达 0.89

文章介绍了一种基于 Elasticsearch 构建持久化 Agent 记忆层的架构。针对大模型上下文窗口限制和“中间迷失”问题,该方案将记忆分为情景、语义和程序性三类,分别对应不同的索引和生命周期管理。检索采用混合搜索(BM25+向量)结合重排器,实现高召回率。核心创新包括:通过覆盖机制处理事实矛盾而非删除,确保审计追踪;强制同轮次写入可见性以解决异步刷新导致的读取延迟;利用成功/失败计数优化程序性记忆排序。实测在 QA 评估中达到 0.89 的召回率,且无跨租户数据泄露。
评论点赞收藏58 天前

Elasticsearch 存储向量查询提速 3 倍的新特性

Elasticsearch 9.4 新增 lookup 功能,将原本需要两次网络请求(先获取向量再搜索)的存储向量查询合并为单次请求。这消除了客户端往返延迟和序列化开销,在基准测试中实现了最高 3.3 倍的延迟降低。虽然这是针对特定场景的性能优化,但对于使用向量搜索的工程团队来说,这是一个能显著简化代码并提升性能的实用更新。
评论点赞收藏86 天前

ECK 3.4 发布:简化区域感知、滚动重启与 mTLS 配置

Elastic Cloud on Kubernetes (ECK) 3.4 版本主要简化了日常运维操作。核心更新包括:1. 区域感知高可用:只需在 NodeSet 中设置一个字段,即可自动处理跨可用区的拓扑分布和调度,大幅减少 YAML 配置复杂度。2. 声明式滚动重启:通过添加注解即可触发集群滚动重启,完美适配 GitOps 流程,无需修改 Spec。3. 自动化 mTLS:操作员自动配置 Kibana 与 Elasticsearch 之间的双向 TLS 认证,包括证书生成和管理。此外还增加了原生 Go FIPS 140-3 支持及多项可靠性修复。这对使用 K8s 部署 Elastic 栈的运维人员有直接实用价值。
评论点赞收藏92 天前

Elasticsearch 向量搜索引擎 simdvec 深度解析:如何用 SIMD 优化隐藏内存延迟

Elastic 团队深入解析了其自研的向量搜索内核 simdvec。文章指出,面对多种量化类型(如 int8, BBQ)和不同硬件架构(x86/ARM),通用库难以兼顾性能与灵活性。因此,Elastic 通过 Panama FFI 调用手写优化的 C++ SIMD 内核,实现了批量打分和显式预取。基准测试显示,在数据超出 CPU 缓存的生产级规模下,simdvec 利用架构特定的内存延迟隐藏策略(x86 预取 vs ARM 交错加载),性能显著优于 FAISS 和 jvector。核心观点是:向量搜索的性能瓶颈不在于单点计算速度,而在于大规模并发下如何高效隐藏内存延迟。
评论点赞收藏95 天前

Elasticsearch 的 BBQ 与 TurboQuant 对决:CPU 提速 10-40 倍,降低排序噪声

Elastic 发布对比测试,声称其向量搜索量化算法 OSQ(BBQ 底层)在 CPU 上比 Google 的 TurboQuant 快 10-40 倍且排序噪声更低。文章深入分析了两者差异:TurboQuant 优化 MSE 重建误差,依赖 Hadamard 旋转和非均匀质心;OSQ 则牺牲部分 MSE 以优化点积准确性(即排序相关性),利用整数运算和 SIMD 指令加速。结论指出,虽然 TurboQuant 在纯 MSE 指标上略优,但其优势主要来自旋转而非质心设计,且在 CPU 搜索场景中,OSQ 的整数算术路径在吞吐量和存储效率上更具实战价值。
评论点赞收藏99 天前

比 Prometheus 快 30 倍:我们将 Elasticsearch 重建为领先的列式存储引擎

Elastic 宣布重构了 Elasticsearch 的时序数据存储层和计算引擎,使其成为全列式指标引擎。相比 Prometheus、Mimir 和 ClickHouse,新架构在查询速度上快 30 倍,存储效率提升 2.5 倍(单数据点仅 3.75 字节)。核心优化包括:用 Doc Value Skippers 替代倒排索引以节省存储和 CPU;引入合成 ID 和序列号裁剪进一步压缩体积;支持 OTLP Protobuf 直接摄入以减少解析开销;以及通过向量化执行、零拷贝解码和优化的计数器速率计算大幅提升查询性能。这使得 ES 能在保持日志、链路追踪统一查询能力的同时,作为高性能的单一指标存储后端。
评论点赞收藏100 天前

Elastic 9.4 正式发布 Workflows:原生安全自动化与案件管理升级

Elastic 9.4 正式推出 Workflows 功能,旨在提供原生的安全自动化能力。核心亮点包括:新增25个专门针对案件管理(Case Management)的步骤,覆盖从创建到关闭的全生命周期;引入“人在回路”(Human-in-the-loop)机制,允许工作流在关键决策点暂停等待人工审批;支持自然语言生成 YAML 工作流代码,降低使用门槛;具备工作流组合与复用能力,提升复杂逻辑的可维护性。此外,新版本强化了错误处理、并发控制及基于执行的统一计费模式。对于依赖 Elastic 进行安全运营(SecOps)的团队,这能显著减少重复性手动操作,提升响应效率。
评论点赞收藏103 天前

Elasticsearch 正式支持 PromQL:统一时序数据查询的新方案

Elasticsearch 在 ES|QL 中新增 PROMQL 命令,允许直接使用 PromQL 语法查询时间序列数据。核心亮点在于 PromQL 并非独立引擎,而是被翻译为 ES|QL 执行,从而能利用 ES 的底层优化。相比原生 Prometheus,它支持自动推断时间范围、步长,并能与日志、链路追踪数据混合查询,或通过 LOOKUP JOIN 关联外部元数据。目前为技术预览版,覆盖大部分常用查询。
评论点赞收藏122 天前

从人工评判列表到训练好的学习排序(LTR)模型

本文介绍了如何利用 Elastic 的 Judgment Lists 训练 Learning to Rank (LTR) 模型,以系统化提升搜索相关性。核心流程包括:从 Judgment Lists 提取特征(如 BM25 分数、文档流行度),构建训练数据集,使用 XGBoost 进行排序模型训练,最后将模型部署回 Elasticsearch 作为重排序器。文章通过电影搜索案例,展示了如何通过特征重要性分析来优化模型,并提供了完整的代码示例和 Notebook 链接。适合对搜索引擎优化和机器学习应用感兴趣的开发者。
评论点赞收藏130 天前

为上下文工程构建高效的数据库检索工具

Elastic团队在构建Agent Builder过程中总结的数据库检索工具最佳实践。核心观点是解决Agent在搜索时的三大难题:选对索引、生成高效查询、控制响应体积。具体建议包括:1. 工具设计遵循“低门槛、高上限”,结合通用工具和专用工具;2. 通过元数据描述和数据采样帮助Agent准确选择索引;3. 规范工具命名和描述,使用思维链参数提高准确率;4. 简化参数,强制校验输入;5. 优化返回结果的长度、宽度和深度,防止上下文溢出;6. 提供详细的错误信息以便Agent自我修正。这是一篇基于一线工程经验的实战指南。
评论点赞收藏133 天前

RaBitQ 二进制量化入门详解

本文详细解释了 RaBitQ 算法如何通过二进制量化大幅压缩向量存储(相比标量量化压缩32倍),同时利用质心距离和点积残差校正因子来保持搜索精度。文章通过二维向量示例,逐步演示了索引构建、查询转换及距离估算过程,并指出实际应用中需结合重排序机制以平衡召回率与性能。适合对向量数据库底层优化感兴趣的工程师。
评论点赞收藏140 天前

BM25排序中业务信号的加法与乘法提升对比

文章对比了在Elasticsearch中调整BM25搜索排序时,加法提升与乘法提升的区别。指出常用的should子句和rank_feature属于加法调整,会导致不同查询下权重失衡,排序不稳定。推荐使用function_score进行乘法提升,能保持BM25原始相关性结构,使业务指标(如利润、库存)以比例方式影响排序,既可控又具备可解释性,并通过电商案例演示了具体效果。
评论点赞收藏235 天前

DiskBBQ:Elasticsearch 的新型向量存储格式

Elastic 推出 DiskBBQ 作为 HNSW 的替代方案,旨在解决 HNSW 在内存不足时性能急剧下降的问题。DiskBBQ 利用分层 K-means 聚类和二进制量化技术,将向量分块存储在磁盘上,仅在需要时加载到内存。测试显示,在内存受限场景下,DiskBBQ 的性能降级比 HNSW 更平缓,且索引速度更快。虽然在高召回率和高低延迟场景下 HNSW 仍具优势,但对于成本敏感且能接受稍低召回率的场景,DiskBBQ 是更好的选择。
评论点赞收藏255 天前

登录芦苇

登录后关注作者、收藏内容和参与讨论。