根据列组合在 dataframe 中创建唯一标识符

Question

我有以下 dataframe：

    id  Lat         Lon         Year    Area    State
50319   -36.0629    -62.3423    2019    90  Iowa
18873   -36.0629    -62.3423    2017    90  Iowa
18876   -36.0754    -62.327     2017    124 Illinois
18878   -36.0688    -62.3353    2017    138 Kansas

我想创建一个新列，它根据Lat 、 Lon和Area列是否具有相同的值来分配唯一标识符。 例如，在这种情况下，第 1 行和第 2 行在这些列中具有相同的值，并将被赋予相同的唯一标识符0_Iowa ，其中Iowa来自State列。 我尝试使用 for 循环，但有没有更 Pythonic 的方式来做到这一点？

id       Lat         Lon       Year    Area State   unique_id
50319   -36.0629    -62.3423    2019    90  Iowa    0_Iowa
18873   -36.0629    -62.3423    2017    90  Iowa    0_Iowa
18876   -36.0754    -62.327     2017    124 Illinois    1_Illinois
18878   -36.0688    -62.3353    2017    138 Kansas  2_Kansas

Answer 1

我将 go 与groupby.ngroup设置sort=False用于分组和str.cat与State连接设置分隔符：

df['Sate'] = (df.groupby(['Lat','Lon','Area'], sort=False)
                .ngroup() 
                .astype(str)
                .str.cat(df.State, sep='_'))

print(df)

      id      Lat      Lon  Year  Area     State        Sate
0  50319 -36.0629 -62.3423  2019    90      Iowa      0_Iowa
1  18873 -36.0629 -62.3423  2017    90      Iowa      0_Iowa
2  18876 -36.0754 -62.3270  2017   124  Illinois  1_Illinois
3  18878 -36.0688 -62.3353  2017   138    Kansas    2_Kansas
1

Answer 2

您可以执行groupby.ngroup并添加列 State：

df['unique_id'] = (df.groupby(['Lat', 'Lon','Area'], sort=False).ngroup().astype(str) 
                   + '_' + df['State'])
print (df)
      id      Lat      Lon  Year  Area     State   unique_id
0  50319 -36.0629 -62.3423  2019    90      Iowa      0_Iowa
1  18873 -36.0629 -62.3423  2017    90      Iowa      0_Iowa
2  18876 -36.0754 -62.3270  2017   124  Illinois  1_Illinois
3  18878 -36.0688 -62.3353  2017   138    Kansas    2_Kansas

根据列组合在 dataframe 中创建唯一标识符

问题描述

2 个解决方案

解决方案1
5 已采纳 2020-06-15 20:42:09

解决方案2
3 2020-06-15 20:41:18

根据列组合在 dataframe 中创建唯一标识符

问题描述

2 个解决方案

解决方案1 5 已采纳 2020-06-15 20:42:09

解决方案2 3 2020-06-15 20:41:18

解决方案1
5 已采纳 2020-06-15 20:42:09

解决方案2
3 2020-06-15 20:41:18