如何將 pyspark 中的列轉換為行？

Question

我有一個 dataframe 有幾列，我需要把它放在一個列中，我怎樣才能在不失去 pyspark 的並行能力的情況下在性能上做到這一點？ 有人能幫我嗎？

USER|ID_1   |ID_2   |ID_3   |ID_4   |Name1|Name2|Name3|Name4

1234|1234500|null   |null   |null   |text |null |null |null   
1234|1234500|null   |null   |null   |text |null |null |null   
1234|null   |null   |1111500|null   |null |null |text |null   
1234|null   |null   |1111500|null   |null |null |text |null   
1234|null   |1111222|null   |null   |null |text |null |null   
1234|null   |1111222|null   |null   |null |text |null |null   
1234|null   |null   |null   |1111333|null |null |null |text   
1234|null   |null   |null   |1111333|null |null |null |text

預期 output：

USER|ID     |Name
 
1234|1234500|text
 
1234|1234500|text 

1234|1111500|text
   
1234|1111500|text |   
1234|1111222|text |   
1234|1111222|text |   
1234|1111333|text |   
1234|1111333|text |

Answer 1

嘗試使用coalesce(col1,col2,col3..coln)

Example:

df.withColumn("id",coalesce(col("ID_1"),col("ID_2"),col("ID_3"),col("ID_4"))).\
withColumn("Name",coalesce(col("Name1"),col("Name2"),col("Name3"),col("Name4"))).\
show()

如何將 pyspark 中的列轉換為行？

問題描述

1 個解決方案

解決方案1
0 2021-12-06 23:41:32

如何將 pyspark 中的列轉換為行？

問題描述

1 個解決方案

解決方案1 0 2021-12-06 23:41:32

解決方案1
0 2021-12-06 23:41:32