16个任务（1048.5 MB）的序列化结果总大小大于spark.driver.maxResultSize（1024.0 MB）

Question

当我将--conf spark.driver.maxResultSize=2050添加到我的spark-submit命令时，我收到以下错误。

17/12/27 18:33:19 ERROR TransportResponseHandler: Still have 1 requests outstanding when connection from /XXX.XX.XXX.XX:36245 is closed
17/12/27 18:33:19 WARN Executor: Issue communicating with driver in heartbeater
org.apache.spark.SparkException: Exception thrown in awaitResult:
        at org.apache.spark.util.ThreadUtils$.awaitResult(ThreadUtils.scala:205)
        at org.apache.spark.rpc.RpcTimeout.awaitResult(RpcTimeout.scala:75)
        at org.apache.spark.rpc.RpcEndpointRef.askSync(RpcEndpointRef.scala:92)
        at org.apache.spark.executor.Executor.org$apache$spark$executor$Executor$$reportHeartBeat(Executor.scala:726)
        at org.apache.spark.executor.Executor$$anon$2$$anonfun$run$1.apply$mcV$sp(Executor.scala:755)
        at org.apache.spark.executor.Executor$$anon$2$$anonfun$run$1.apply(Executor.scala:755)
        at org.apache.spark.executor.Executor$$anon$2$$anonfun$run$1.apply(Executor.scala:755)
        at org.apache.spark.util.Utils$.logUncaughtExceptions(Utils.scala:1954)
        at org.apache.spark.executor.Executor$$anon$2.run(Executor.scala:755)
        at java.util.concurrent.Executors$RunnableAdapter.call(Executors.java:511)
        at java.util.concurrent.FutureTask.runAndReset(FutureTask.java:308)
        at java.util.concurrent.ScheduledThreadPoolExecutor$ScheduledFutureTask.access$301(ScheduledThreadPoolExecutor.java:180)
        at java.util.concurrent.ScheduledThreadPoolExecutor$ScheduledFutureTask.run(ScheduledThreadPoolExecutor.java:294)
        at java.util.concurrent.ThreadPoolExecutor.runWorker(ThreadPoolExecutor.java:1149)
        at java.util.concurrent.ThreadPoolExecutor$Worker.run(ThreadPoolExecutor.java:624)
        at java.lang.Thread.run(Thread.java:748)
Caused by: java.io.IOException: Connection from /XXX.XX.XXX.XX:36245 closed
        at org.apache.spark.network.client.TransportResponseHandler.channelInactive(TransportResponseHandler.java:146)

添加此配置的原因是错误：

py4j.protocol.Py4JJavaError: An error occurred while calling o171.collectToPython.
: org.apache.spark.SparkException: Job aborted due to stage failure: Total size of serialized results of 16 tasks (1048.5 MB) is bigger than spark.driver.maxResultSize (1024.0 MB)

因此，我将maxResultSize增加到2.5 Gb，但无论如何Spark工作都失败了（上面显示的错误）。如何解决这个问题？

Answer 1

看起来问题是您尝试撤回到驱动程序的数据量太大。您很可能使用collect方法从DataFrame / RDD中检索所有值。驱动程序是一个进程，通过收集DataFrame，您将所有已在群集中分发的数据提取回一个节点。这违背了分发它的目的！只有在将数据减少到可管理的数量后才能执行此操作。

您有两种选择：

如果您确实需要处理所有数据，那么您应该将其保留在执行程序中。使用HDFS和Parquet以分布式方式保存数据，并使用Spark方法处理群集上的数据，而不是尝试将其全部收集回一个位置。
如果您确实需要将数据返回给驱动程序，则应检查是否确实需要所有数据。如果您只需要汇总统计信息，那么在调用collect之前在执行程序上计算出来。或者，如果您只需要前100名结果，那么只收集前100名。

更新：

还有另一个原因可以解决这个不那么明显的错误。当您明确调用collect时，Spark将尝试将数据发送回驱动程序。如果您正在使用累加器，广播连接的数据以及有关每个任务的一些小状态数据，它还将发送每个任务的累加器结果。如果您有很多分区（根据我的经验，20k +），您有时会看到此错误。这是一个known issue有一些改进，和更多in the works。

如果这是您的问题，过去的选项是：

增加spark.driver.maxResultSize或将其设置为0表示无限制
如果广播连接是罪魁祸首，您可以减少spark.sql.autoBroadcastJoinThreshold以限制广播连接数据的大小
减少分区数量

16个任务（1048.5 MB）的序列化结果总大小大于spark.driver.maxResultSize（1024.0 MB）

问题描述投票：6回答：1

1个回答

最新问题

16个任务（1048.5 MB）的序列化结果总大小大于spark.driver.maxResultSize（1024.0 MB）

问题描述 投票：6回答：1

1个回答

最新问题

问题描述投票：6回答：1