如何在pyspark中连接同名列的值

Question

我们有一个功能请求，我们想根据请求从数据库中提取一个表并对其执行一些转换。 但是这些表可能有重复的列[同名列]。 我想将这些列合并为一列

例如：

Request  for input table named ages:


+---+----+------+-----+
|age| ids | ids | ids |
+---+----+------+-----+
| 25|  1  |  2  |  3  |
+---+----+------+-----+
| 26|  4  |  5  |  6  |
+---+----+------+-----+


the output table  is :

+---+----+------+-----+
|age|       ids       |
+---+----+------+-----+
| 25| [1  ,  2  ,  3] |
+---+----+------+-----+
| 26| [4  ,  5  ,  6] |
+---+----+------+-----+


next time  we might get a request for input table names:

+---+----+------+-----+
|name| company | company| 
+---+----+------+-----+
| abc|  a      |  b     | 
+---+----+------+-----+
| xyc|  c      |  d     |  
+---+----+------+-----+

The output table should be:

+---+----+------+
|name| company  | 
+---+----+------+
| abc|  [a,b]   | 
+---+----+------+
| xyc|  [c,d]   |  
+---+----+------+

所以基本上我需要找到具有相同名称的列，然后合并其中的值。

Answer 1

您可以将 spark 数据帧转换为 pandas 数据帧，执行必要的操作并将其转换回 spark 数据帧。

为了清楚起见，我添加了必要的注释。

使用熊猫：

import pandas as pd
from collections import Counter

pd_df = spark_df.toPandas() #converting spark dataframe to pandas dataframe

pd_df.head()

def concatDuplicateColumns(df):
    duplicate_cols = [] #to store duplicate column names
    for col in dict(Counter(df.columns)):
        if dict(Counter(df.columns))[col] >1:
            duplicate_cols.append(col)

    final_dict = {}
    for cols in duplicate_cols:
        final_dict[cols] = []  #initialize dict

    for cols in duplicate_cols:
        for ind in df.index.tolist():
            final_dict[cols].append(df.loc[ind, cols].tolist())

    df.drop(duplicate_cols, axis=1, inplace=True)
    for cols in duplicate_cols:
        df[cols] = final_dict[cols]
    return df

final_df = concatDuplicateColumns(pd_df)

spark_df = spark.createDataFrame(final_df)

spark_df.show()

如何在pyspark中连接同名列的值

问题描述

1 个解决方案

解决方案1
0 2021-06-24 03:30:48

如何在pyspark中连接同名列的值

问题描述

1 个解决方案

解决方案1 0 2021-06-24 03:30:48

解决方案1
0 2021-06-24 03:30:48