科普
行式存储与列式存储
从访问模式、压缩、扫描和写入代价理解行式与列式存储。
概念科普
用直观模型和最小示例解释数据系统中的通用原理。
这一部分连接不同项目的共同底层:存储、执行、调度、数据分布和查询优化。先理解概念,再回到具体项目,会更容易判断技术差异来自哪里。
从访问模式、压缩、扫描和写入代价理解行式与列式存储。
用批量处理而不是逐行处理理解向量化执行,以及它为什么常出现在 OLAP 系统中。
从计算抽象、任务调度、数据处理和生态边界理解 Spark 与 Ray 的区别。
比较 Spark 与 Daft 在数据抽象、执行计划、生态和适用场景上的差异。
从执行模型、Shuffle、Spark SQL 到流处理,建立 Spark 专题路线。
解释分布式计算为什么需要重新分布数据,以及 Shuffle 的成本从哪里来。
从 Tasks、Actors 和调度模型出发,理解 Ray 的分布式应用路径。
记录 MPP 分析、分区分桶、表模型和查询加速相关实践。
记录 DataFrame、物理执行计划和分布式数据处理之间的联系。
从数据组织、查询执行、生态和运维边界出发,建立 ClickHouse 与 Doris 的比较框架。
围绕 MergeTree、排序键、分区和查询执行,拆解 ClickHouse 的分析型路径。