Python 3 Pandas合并或合并具有相似数据的列

Question

我有一个数据框，我试图用性别列更新性别列

import pandas as pd
import numpy as np

df=pd.DataFrame({'Users': [ 'Al Gore', 'Ned Flonders', 'Kim jong un', 'Al Sharpton', 'Michele', 'Richard Johnson', 'Taylor Swift', 'Alf pig', 'Dick Johnson', 'Dana Jovy'],
                 'Gender': [np.nan,'Male','Male','Male',np.nan,np.nan, 'Female',np.nan,'Male','Female'],
                 'Sex': ['M',np.nan,np.nan,'M','F',np.nan, 'F',np.nan,np.nan,'F']})

产量

>>> 
   Gender  Sex            Users
0     NaN    M          Al Gore
1    Male  NaN     Ned Flonders
2    Male  NaN      Kim jong un
3    Male    M      Al Sharpton
4     NaN    F          Michele
5     NaN  NaN  Richard Johnson
6  Female    F     Taylor Swift
7     NaN  NaN          Alf pig
8    Male  NaN     Dick Johnson
9  Female    F        Dana Jovy

[10 rows x 3 columns]

因此，如果在“性别”列中为男性，则在性别列中将显示为M。

到目前为止，这是我尝试过的事情：

df['Sex2']=(df.Gender.isin(['Male']).map({True:'M',False:''}) +
                df.Sex.isin(['M']).map({True:'M',False:''}) +
                df.Sex.isin(['F']).map({True:'F',False:''})+
                df.Gender.isin(['Female']).map({True:'F',False:''}))

print(df)

产量

[10 rows x 3 columns]
   Gender  Sex            Users Sex2
0     NaN    M          Al Gore    M
1    Male  NaN     Ned Flonders    M
2    Male  NaN      Kim jong un    M
3    Male    M      Al Sharpton   MM
4     NaN    F          Michele    F
5     NaN  NaN  Richard Johnson     
6  Female    F     Taylor Swift   FF
7     NaN  NaN          Alf pig     
8    Male  NaN     Dick Johnson    M
9  Female    F        Dana Jovy   FF

[10 rows x 4 columns]

我几乎明白了，但这可能不太有效

这是我想要的输出

>>> 
   Gender  Sex            Users
0     NaN    M          Al Gore
1    Male    M     Ned Flonders
2    Male    M      Kim jong un
3    Male    M      Al Sharpton
4     NaN    F          Michele
5     NaN  NaN  Richard Johnson
6  Female    F     Taylor Swift
7     NaN  NaN          Alf pig
8    Male    M     Dick Johnson
9  Female    F        Dana Jovy

[10 rows x 3 columns]

是否可以使用某些合并或更新功能来做到这一点？

Answer 1

使用map ：

In [14]:

import pandas as pd
import numpy as np

df=pd.DataFrame({'Users': [ 'Al Gore', 'Ned Flonders', 'Kim jong un', 'Al Sharpton', 'Michele', 'Richard Johnson', 'Taylor Swift', 'Alf pig', 'Dick Johnson', 'Dana Jovy'],
                 'Gender': [np.nan,'Male','Male','Male',np.nan,np.nan, 'Female',np.nan,'Male','Female'],
                 'Sex': ['M',np.nan,np.nan,'M','F',np.nan, 'F',np.nan,np.nan,'F']})

In [15]:

df

Out[15]:

   Gender  Sex            Users
0     NaN    M          Al Gore
1    Male  NaN     Ned Flonders
2    Male  NaN      Kim jong un
3    Male    M      Al Sharpton
4     NaN    F          Michele
5     NaN  NaN  Richard Johnson
6  Female    F     Taylor Swift
7     NaN  NaN          Alf pig
8    Male  NaN     Dick Johnson
9  Female    F        Dana Jovy

[10 rows x 3 columns]

In [16]:

# create a sex dict
sex_map = {'Male':'M', 'Female':'F'}
# update only those where sex is NaN, apply map to gender to fill in values
df.loc[df.Sex.isnull(),'Sex'] = df['Gender'].map(sex_map)
df

Out[16]:

   Gender  Sex            Users
0     NaN    M          Al Gore
1    Male    M     Ned Flonders
2    Male    M      Kim jong un
3    Male    M      Al Sharpton
4     NaN    F          Michele
5     NaN  NaN  Richard Johnson
6  Female    F     Taylor Swift
7     NaN  NaN          Alf pig
8    Male    M     Dick Johnson
9  Female    F        Dana Jovy

[10 rows x 3 columns]

比较效果：

In [21]:
%timeit df['Sex2']=(df.Gender.isin(['Male']).map({True:'M',False:''}) + df.Sex.isin(['M']).map({True:'M',False:''}) + df.Sex.isin(['F']).map({True:'F',False:''})+                df.Gender.isin(['Female']).map({True:'F',False:''}))

100 loops, best of 3: 2.38 ms per loop

In [24]:
%timeit df.loc[df.Sex.isnull(),'Sex'] = df['Gender'].map(sex_map)

1000 loops, best of 3: 1.21 ms per loop

In [27]:
# without the NaN mask which is similar to what you are doing
%timeit df['Sex'] = df['Gender'].map(sex_map)

1000 loops, best of 3: 531 µs per loop

因此，在这个小样本上，它速度更快，而对于更大的数据帧，由于使用了cython，它应该明显更快。

Python 3 Pandas合并或合并具有相似数据的列

问题描述

1 个解决方案

解决方案1
1 已采纳 2014-05-10 20:20:16

Python 3 Pandas合并或合并具有相似数据的列

问题描述

1 个解决方案

解决方案1 1 已采纳 2014-05-10 20:20:16

解决方案1
1 已采纳 2014-05-10 20:20:16