在Kafka Spark流中读取和处理并行性

Question

我正在尝试并行读取Kafka消息，从而并行处理它们。 我的Kafka主题有10个分区。 我正在尝试创建5个DStream，并应用Union方法对单个DStream进行操作。 这是我到目前为止尝试过的代码：

  def main(args: scala.Array[String]): Unit = {

    val properties = readProperties()

    val streamConf = new SparkConf().setMaster("local[2]").setAppName("KafkaStream")
    val ssc = new StreamingContext(streamConf, Seconds(1))
    //  println("defaultParallelism: "+ssc.sparkContext.defaultParallelism)
    ssc.sparkContext.setLogLevel("WARN")
    val numPartitionsOfInputTopic = 5
    val group_id = Random.alphanumeric.take(4).mkString("consumer_group")
    val kafkaStream = {
      val kafkaParams = Map("zookeeper.connect" -> properties.getProperty("zookeeper_connection_str"),
                            "group.id" -> group_id,
                            "zookeeper.connection.timeout.ms" -> "3000")                      

      val streams = (1 to numPartitionsOfInputTopic).map { _ =>
                          KafkaUtils.createStream[scala.Array[Byte], String, DefaultDecoder, StringDecoder](
                          ssc, kafkaParams, Map("kafka_topic" -> 1), StorageLevel.MEMORY_ONLY_SER).map(_._2)
      }
    val unifiedStream = ssc.union(streams)
    val sparkProcessingParallelism = 5 
    unifiedStream.repartition(sparkProcessingParallelism)
    }

  kafkaStream.foreachRDD { x => 
  x.foreach {       
      msg => println("Message: "+msg)
      processMessage(msg)
   }      
  }

  ssc.start()
  ssc.awaitTermination()
}

执行后，它甚至没有收到任何一条消息，更不用说对其进行进一步处理了。 我在这里想念什么吗？ 如果需要，请提出更改建议。 谢谢。

Answer 1

我强烈建议切换到直接流。 为什么？

默认情况下，Direct Stream将并行性设置为您在Kafka中拥有的分区数。 无需做其他任何事情-只需创建Direct Stream并完成您的工作即可：)

如果创建5个DStream，默认情况下将读取5个线程，一个非Direct-DStream =一个线程

在Kafka Spark流中读取和处理并行性

问题描述

1 个解决方案

解决方案1
0 2017-09-16 18:28:45

在Kafka Spark流中读取和处理并行性

问题描述

1 个解决方案

解决方案1 0 2017-09-16 18:28:45

解决方案1
0 2017-09-16 18:28:45