<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>Big Data - 标签 - Victor's Code Journey</title><link>http://www.victorchu.info/tags/big-data/</link><description>Big Data - 标签 - Victor's Code Journey</description><generator>Hugo -- gohugo.io</generator><language>zh-cn</language><managingEditor>victorchu0610@outlook.com (victorchutian)</managingEditor><webMaster>victorchu0610@outlook.com (victorchutian)</webMaster><lastBuildDate>Sun, 14 Sep 2025 14:36:31 +0800</lastBuildDate><atom:link href="http://www.victorchu.info/tags/big-data/" rel="self" type="application/rss+xml"/><item><title>Apache Livy 简介</title><link>http://www.victorchu.info/posts/2025/09/5d3219a3/</link><pubDate>Sun, 14 Sep 2025 14:36:31 +0800</pubDate><author><name>victorchutian</name></author><guid>http://www.victorchu.info/posts/2025/09/5d3219a3/</guid><description><![CDATA[<div class="featured-image">
                <img src="/feature-images/spark.webp" referrerpolicy="no-referrer">
            </div><p>当你把一个 Spark 应用交给数据平台服务化时，很快会遇到三个现实问题：客户端机器不一定能直连集群；<code>spark-submit</code> 不适合由 Web 后端反复执行；多个用户的长任务、权限、日志和资源也不能只靠脚本管理。Apache Livy 要解决的就是这一层问题：它把 Spark 集群包装成可远程访问、可管理、可多租户使用的 REST 服务。</p>
<p>这篇文章面向已经了解 Spark Driver、Executor 和 Cluster Manager 的读者。读完你可以理解 Livy Server 的职责边界、Interactive Session 与 Batch Session 的差异、RSC 的连接建立过程、Executor 资源如何分配和扩缩容、Session 状态恢复机制，以及 Livy 与 Spark Connect 的适用边界。</p>]]></description></item><item><title>Spark 简介</title><link>http://www.victorchu.info/posts/2025/08/7274c97b/</link><pubDate>Thu, 14 Aug 2025 11:22:51 +0800</pubDate><author><name>victorchutian</name></author><guid>http://www.victorchu.info/posts/2025/08/7274c97b/</guid><description><![CDATA[<div class="featured-image">
                <img src="/feature-images/spark.webp" referrerpolicy="no-referrer">
            </div><p>当数据量超过单机内存和 CPU 的处理能力时，很多熟悉的批处理程序会遇到同一个问题：逻辑不难，但很难高效地拆到多台机器上运行。Spark 要解决的正是这件事。它把分布式存储上的数据抽象成可并行操作的数据集，把用户代码转换成可以在集群中调度的任务，同时提供 SQL、流处理、机器学习等统一 API。</p>]]></description></item></channel></rss>