T-Digest 算法详解
T-Digest 是一种用于近似估计分位数 (Approximate Quantile Estimation) 的概率数据结构和算法。它由 Ted Dunning 于 2014 年提出,旨在高效地处理大规模流式数据,以极低的内存占用提供对任意分位数的精确估计,尤其是在数据分布的极端区域(如 P99, P99.9)依然能保持较高精度。T-Digest 的核心思想是通过维护一个有序的质心 (Centroid) 列表,这些质心以不同密度分布,从而在数据量极大时仍能提供高效且准确的分位数估计。 核心思想:将数据压缩为一组代表性的质心 (mean, weight),在数据稀疏的尾部区域保留更多质心(更精细的表示),而在数据密集的中间区域则合并更多质心(更粗略的表示),以实现内存与精度之间的最佳平衡。 一、为什么需要 T-Digest?传统方法的局限性在处理大规模数据集时,精确计算分位数(如中位数、百分之九十九分位数 P99)面临着巨大的挑战: 内存消耗:精确计算分位数通常需要存储所有数据点并进行排序。对于TB或PB级别的数据,这在内存上是不可行的。 计算成本:对海量数据进行排序是...
日志采集方案Loki详解:轻量、高效、可扩展
在云原生时代,日志是可观测性(Observability)的三大支柱之一(另外两个是指标和链路追踪)。传统的日志系统(如 ELK Stack)虽然功能强大,但其高昂的存储成本和复杂的运维管理一直是挑战。Loki 作为一种新一代的日志聚合系统,以其独特的“只索引标签,不索引全文”的设计理念,提供了成本效益高、易于部署和管理的日志解决方案,尤其适合 Kubernetes 环境。 核心思想:Loki 是一个受 Prometheus 启发而设计的日志聚合系统,它不索引日志内容本身,而是通过少量标签对日志流(log stream)进行索引。这种设计显著降低了存储和索引的成本,使得用户可以通过标签过滤日志流,然后进行 Grep 式的全文搜索。它是 Grafana Labs 家族产品的一员,与 Prometheus 和 Grafana 紧密集成,提供了统一的可观测性体验。 一、Loki 简介与核心理念Loki 是 Grafana Labs 于 2018 年开源的日志聚合系统。其设计的核心理念与 Prometheus 有着异曲同工之处: 受 Prometheus 启发:Loki 的数...
