科普
行式存储与列式存储
从访问模式、压缩、扫描和写入代价理解行式与列式存储。
技术文档
围绕 Spark、ClickHouse、Doris、Ray 和 Daft 的系统化技术记录。
这里按项目建立长期维护的技术入口。每个专题会记录核心概念、可复现实验、版本边界和常见故障,避免把不同层次的问题混在同一篇文章里。
当前专题覆盖:Spark、ClickHouse、Doris、Ray 和 Daft。
从访问模式、压缩、扫描和写入代价理解行式与列式存储。
用批量处理而不是逐行处理理解向量化执行,以及它为什么常出现在 OLAP 系统中。
从计算抽象、任务调度、数据处理和生态边界理解 Spark 与 Ray 的区别。
比较 Spark 与 Daft 在数据抽象、执行计划、生态和适用场景上的差异。
从执行模型、Shuffle、Spark SQL 到流处理,建立 Spark 专题路线。
解释分布式计算为什么需要重新分布数据,以及 Shuffle 的成本从哪里来。
从 Tasks、Actors 和调度模型出发,理解 Ray 的分布式应用路径。
记录 MPP 分析、分区分桶、表模型和查询加速相关实践。
记录 DataFrame、物理执行计划和分布式数据处理之间的联系。
从数据组织、查询执行、生态和运维边界出发,建立 ClickHouse 与 Doris 的比较框架。
围绕 MergeTree、排序键、分区和查询执行,拆解 ClickHouse 的分析型路径。