科普
行式存储与列式存储
从访问模式、压缩、扫描和写入代价理解行式与列式存储。
全部内容
技术文档、跨项目对比和概念科普的统一入口。
这里汇总所有面向技术知识库的内容。可以按项目文档、跨项目对比或通用概念继续浏览。
从访问模式、压缩、扫描和写入代价理解行式与列式存储。
用批量处理而不是逐行处理理解向量化执行,以及它为什么常出现在 OLAP 系统中。
从计算抽象、任务调度、数据处理和生态边界理解 Spark 与 Ray 的区别。
比较 Spark 与 Daft 在数据抽象、执行计划、生态和适用场景上的差异。
从执行模型、Shuffle、Spark SQL 到流处理,建立 Spark 专题路线。
解释分布式计算为什么需要重新分布数据,以及 Shuffle 的成本从哪里来。
从 Tasks、Actors 和调度模型出发,理解 Ray 的分布式应用路径。
记录 MPP 分析、分区分桶、表模型和查询加速相关实践。
记录 DataFrame、物理执行计划和分布式数据处理之间的联系。
从数据组织、查询执行、生态和运维边界出发,建立 ClickHouse 与 Doris 的比较框架。
围绕 MergeTree、排序键、分区和查询执行,拆解 ClickHouse 的分析型路径。