科普
行式存储与列式存储
从访问模式、压缩、扫描和写入代价理解行式与列式存储。
项目对比
在明确场景、版本和测试边界后,比较不同技术的取舍。
对比文章不追求脱离场景的“冠军”。每篇文章都会先固定问题、数据和环境,再从架构、执行模型、生态、运维和适用边界展开比较。
从访问模式、压缩、扫描和写入代价理解行式与列式存储。
用批量处理而不是逐行处理理解向量化执行,以及它为什么常出现在 OLAP 系统中。
从计算抽象、任务调度、数据处理和生态边界理解 Spark 与 Ray 的区别。
比较 Spark 与 Daft 在数据抽象、执行计划、生态和适用场景上的差异。
从执行模型、Shuffle、Spark SQL 到流处理,建立 Spark 专题路线。
解释分布式计算为什么需要重新分布数据,以及 Shuffle 的成本从哪里来。
从 Tasks、Actors 和调度模型出发,理解 Ray 的分布式应用路径。
记录 MPP 分析、分区分桶、表模型和查询加速相关实践。
记录 DataFrame、物理执行计划和分布式数据处理之间的联系。
从数据组织、查询执行、生态和运维边界出发,建立 ClickHouse 与 Doris 的比较框架。
围绕 MergeTree、排序键、分区和查询执行,拆解 ClickHouse 的分析型路径。