科普
行式存储与列式存储
从访问模式、压缩、扫描和写入代价理解行式与列式存储。
全部内容
围绕数据系统、分布式计算和通用原理建立可复用的技术知识库。
这里直接进入知识库:技术文档、跨项目对比和概念科普统一在同一个入口中。
内容会围绕 Spark、ClickHouse、Doris、Ray 和 Daft 持续整理,并用可复现实验补充结论。
从访问模式、压缩、扫描和写入代价理解行式与列式存储。
用批量处理而不是逐行处理理解向量化执行,以及它为什么常出现在 OLAP 系统中。
从计算抽象、任务调度、数据处理和生态边界理解 Spark 与 Ray 的区别。
比较 Spark 与 Daft 在数据抽象、执行计划、生态和适用场景上的差异。
从执行模型、Shuffle、Spark SQL 到流处理,建立 Spark 专题路线。
解释分布式计算为什么需要重新分布数据,以及 Shuffle 的成本从哪里来。
从 Tasks、Actors 和调度模型出发,理解 Ray 的分布式应用路径。
记录 MPP 分析、分区分桶、表模型和查询加速相关实践。
记录 DataFrame、物理执行计划和分布式数据处理之间的联系。
从数据组织、查询执行、生态和运维边界出发,建立 ClickHouse 与 Doris 的比较框架。
围绕 MergeTree、排序键、分区和查询执行,拆解 ClickHouse 的分析型路径。