在Spark Streaming中使用Spark SQL

Question

關於Spark結構化流，嘗試使SparkSql有意義。
Spark Session從kafka主題讀取事件，將數據聚合到按不同列名分組的計數，並將其打印到控制台。
原始輸入數據的結構如下：

+--------------+--------------------+----------+----------+-------+-------------------+--------------------+----------+
|.  sourceTypes|                Guid|  platform|datacenter|pagesId|     eventTimestamp|              Id1234|  Id567890|
+--------------+--------------------+----------+----------+-------+-------------------+--------------------+----------+
| Notififcation|....................|   ANDROID|       dev|     aa|2018-09-27 09:41:29|fce81f05-a085-392...|{"id":...|
| Notififcation|....................|   ANDROID|       dev|     ab|2018-09-27 09:41:29|fce81f05-a085-392...|{"id":...|
| Notififcation|....................|     WEBOS|       dev|     aa|2018-09-27 09:42:46|0ee089c1-d5da-3b3...|{"id":...|
| Notififcation|....................|     WEBOS|       dev|     aa|2018-09-27 09:42:48|57c18964-40c9-311...|{"id":...|
| Notififcation|....................|     WEBOS|       dev|     aa|2018-09-27 09:42:48|5ecf1d77-321a-379...|{"id":...|
| Notififcation|....................|     WEBOS|       dev|     aa|2018-09-27 09:42:48|5ecf1d77-321a-379...|{"id":...|
| Notififcation|....................|     WEBOS|       dev|     aa|2018-09-27 09:42:52|d9fc4cfa-0934-3e9...|{"id":...|
+--------------+--------------------+----------+----------+-------+-------------------+--------------------+---------+

sourceTypes ， platform ， datacenter和pageId都需要計數。

使用以下代碼聚合數據：

Dataset<Row> query = sourceDataset
        .withWatermark("eventTimestamp", watermarkInterval)
        .select(
            col("eventTimestamp"),
            col("datacenter"),
            col("platform"),
            col("pageId")
        )
        .groupBy(
            window(col("eventTimestamp"), windowInterval),
            col("datacenter"),
            col("platform"),
            col("pageId")
        )
        .agg(
            max(col("eventTimestamp"))
        );

這里watermarkInterval=45seconds ， windowInterval=15seconds和triggerInterval=15seconds 。

使用以下新的聚合數據集：

aggregatedDataset
        .writeStream()
        .outputMode(OutputMode.Append())
        .format("console")
        .trigger(Trigger.ProcessingTime(triggerInterval))
        .start();

有幾個問題：

輸出數據不會打印每個groupBy的計數，例如平台，pageId等。
如何以json格式打印輸出？ 我嘗試在控制台上輸出數據時使用select(to_json(struct("*")).as("value")) ，但它不起作用。

Answer 1

您可以使用以下代碼段解決問題：

.outputMode("complete")

在Spark Streaming中使用Spark SQL

問題描述

1 個解決方案

解決方案1
0 2018-09-27 18:47:54

在Spark Streaming中使用Spark SQL

問題描述

1 個解決方案

解決方案1 0 2018-09-27 18:47:54

解決方案1
0 2018-09-27 18:47:54