使用SCALA删除DataFrame中的空格。（我已将CSV文件加载到RDD中，然后尝试从中删除空格

Question

我的CSV文件中包含不需要的空格和Null值的数据。 我把这个文件加载到spark RDD中，直到这里没问题。 现在我必须从此RDD中删除空格和空值。 如何做到这一点任何人都可以帮助我吗？

object Oracle {def main(args: Array[String]): Unit = {
import org.apache.spark.SparkContext
import org.apache.spark.sql.SparkSession    
System.setProperty("hadoop.home.dir","D:\\hadoop\\");
val spark = SparkSession.builder().appName("Schema").master("local[*]").getOrCreate()

import spark.implicits._
import org.apache.spark.sql.functions._
val inpp = spark.read.csv("file:///C:/Users/user/Desktop/xyz.csv")
inpp.show()

val df = inpp.toDF("name")

inpp.select(
    col("name"),
    regexp_replace(col("name"), "\\s+$", ""),
    rtrim(col("name")),
    length(col("name"))
    ).show() }}

这是我的数据，包含不想要的空格和空值。

Answer 1

你可以这样做：

scala> val someDFWithName = Seq((1, "anu rag"), (2,"raj u"),(3, "  ram   "), (4, null), (5, "")).toDF("id", "name")

现在筛选空值或空值并应用正则表达式以删除额外空格：

scala> someDFWithName.filter(col("name") !== "").select(
 |     col("name"),
 |     regexp_replace(col("name"), " ", ""),
 |     length(col("name"))
 |     ).show()

输出将是：

+--------+-------------------------+------------+
|    name|regexp_replace(name,  , )|length(name)|
+--------+-------------------------+------------+
| anu rag|                   anurag|           7|
|   raj u|                     raju|           5|
|  ram   |                      ram|           8|
+--------+-------------------------+------------+

谢谢。

Answer 2

您可以在csv阅读器中提供这些选项以修剪数据，然后过滤不相关的数据：

val df = spark.read
.format("csv")
.option("ignoreLeadingWhiteSpace", "true")
.option("ignoreTrailingWhiteSpace", "true")
.option("inferSchema", "true")
.option("header", "true")
.load("file:///C:/Users/user/Desktop/xyz.csv")
.filter(col("name").isNotNull)
.show()

使用SCALA删除DataFrame中的空格。（我已将CSV文件加载到RDD中，然后尝试从中删除空格

问题描述

2 个解决方案

解决方案1
0 2019-05-26 19:52:20

解决方案2
0 2019-05-27 05:29:17

使用SCALA删除DataFrame中的空格。 （我已将CSV文件加载到RDD中，然后尝试从中删除空格

问题描述

2 个解决方案

解决方案1 0 2019-05-26 19:52:20

解决方案2 0 2019-05-27 05:29:17

使用SCALA删除DataFrame中的空格。（我已将CSV文件加载到RDD中，然后尝试从中删除空格

解决方案1
0 2019-05-26 19:52:20

解决方案2
0 2019-05-27 05:29:17