<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Spark on 影神图</title><link>https://jiangxt2.github.io/topics/spark/</link><description>Recent content in Spark on 影神图</description><generator>Hugo</generator><language>zh-CN</language><lastBuildDate>Thu, 17 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://jiangxt2.github.io/topics/spark/index.xml" rel="self" type="application/rss+xml"/><item><title>Shuffle 是什么</title><link>https://jiangxt2.github.io/concepts/shuffle/</link><pubDate>Thu, 17 Sep 2026 00:00:00 +0000</pubDate><guid>https://jiangxt2.github.io/concepts/shuffle/</guid><description>解释分布式计算为什么需要重新分布数据，以及 Shuffle 的成本从哪里来。</description></item><item><title>Spark</title><link>https://jiangxt2.github.io/docs/spark/</link><pubDate>Thu, 17 Sep 2026 00:00:00 +0000</pubDate><guid>https://jiangxt2.github.io/docs/spark/</guid><description>从执行模型、Shuffle、Spark SQL 到流处理，建立 Spark 专题路线。</description></item><item><title>Spark vs Daft：数据处理模型的差异</title><link>https://jiangxt2.github.io/comparisons/spark-vs-daft/</link><pubDate>Thu, 17 Sep 2026 00:00:00 +0000</pubDate><guid>https://jiangxt2.github.io/comparisons/spark-vs-daft/</guid><description>比较 Spark 与 Daft 在数据抽象、执行计划、生态和适用场景上的差异。</description></item><item><title>Spark vs Ray：批处理与分布式应用</title><link>https://jiangxt2.github.io/comparisons/spark-vs-ray/</link><pubDate>Thu, 17 Sep 2026 00:00:00 +0000</pubDate><guid>https://jiangxt2.github.io/comparisons/spark-vs-ray/</guid><description>从计算抽象、任务调度、数据处理和生态边界理解 Spark 与 Ray 的区别。</description></item><item><title>行式存储与列式存储</title><link>https://jiangxt2.github.io/concepts/columnar-storage/</link><pubDate>Thu, 17 Sep 2026 00:00:00 +0000</pubDate><guid>https://jiangxt2.github.io/concepts/columnar-storage/</guid><description>从访问模式、压缩、扫描和写入代价理解行式与列式存储。</description></item></channel></rss>