[英]Get both the top-n values and the names of columns they occur in, within each row in dataframe
[英]How to find column-index of top-n values within each row of huge dataframe
我有一個格式的數據框:(示例數據)
Metric1 Metric2 Metric3 Metric4 Metric5
ID
1 0.5 0.3 0.2 0.8 0.7
2 0.1 0.8 0.5 0.2 0.4
3 0.3 0.1 0.7 0.4 0.2
4 0.9 0.4 0.8 0.5 0.2
其中得分范圍在[0,1]和我希望生成一個函數,對於每個id(行),計算前n個度量,其中n是函數的輸入以及原始數據幀。
我的理想輸出是:(例如,n = 3)
Top_1 Top_2 Top_3
ID
1 Metric4 Metric5 Metric1
2 Metric2 Metric3 Metric5
3 Metric3 Metric4 Metric1
4 Metric1 Metric3 Metric4
現在我編寫了一個可行的函數:
def top_n_partners(scores,top_n=3):
metrics = np.array(scores.columns)
records=[]
for rec in scores.to_records():
rec = list(rec)
ID = rec[0]
score_vals = rec[1:]
inds = np.argsort(score_vals)
top_metrics = metrics[inds][::-1]
dic = {
'top_score_%s' % (i+1):top_metrics[i]
for i in range(top_n)
}
dic['ID'] = ID
records.append(dic)
top_n_df = pd.DataFrame(records)
top_n_df.set_index('ID',inplace=True)
return top_n_df
然而,它似乎相當低效/緩慢,特別是對於我將要運行的數據量(具有數百萬行的數據幀),我想知道是否有更聰明的方法可以解決這個問題?
你可以使用numpy.argsort
:
print (np.argsort(-df.values, axis=1)[:,:3])
[[3 4 0]
[1 2 4]
[2 3 0]
[0 2 3]]
print (df.columns[np.argsort(-df.values, axis=1)[:,:3]])
Index([['Metric4', 'Metric5', 'Metric1'], ['Metric2', 'Metric3', 'Metric5'],
['Metric3', 'Metric4', 'Metric1'], ['Metric1', 'Metric3', 'Metric4']],
dtype='object')
df = pd.DataFrame(df.columns[np.argsort(-df.values, axis=1)[:,:3]],
index=df.index)
df = df.rename(columns = lambda x: 'Top_{}'.format(x + 1))
print (df)
Top_1 Top_2 Top_3
ID
1 Metric4 Metric5 Metric1
2 Metric2 Metric3 Metric5
3 Metric3 Metric4 Metric1
4 Metric1 Metric3 Metric4
感謝Divakar的改進:
n = 3
df = pd.DataFrame(df.columns[df.values.argsort(1)[:,-n+2:1:-1]],
index=df.index)
df = df.rename(columns = lambda x: 'Top_{}'.format(x + 1))
print (df)
Top_1 Top_2 Top_3
ID
1 Metric4 Metric5 Metric1
2 Metric2 Metric3 Metric5
3 Metric3 Metric4 Metric1
4 Metric1 Metric3 Metric4
使用Pandas重塑的另一種方式:
df.set_index('ID', inplace=True)
df_out = df.rank(axis=1, ascending=False).astype(int).reset_index().melt(id_vars='ID').query('value <= 3').pivot(index='ID',columns='value')
df_out.columns = df_out.columns.droplevel().astype(str)
df_out = df_out.add_prefix('Top_')
print(df_out)
輸出:
value Top_1 Top_2 Top_3
ID
1 Metric4 Metric5 Metric1
2 Metric2 Metric3 Metric5
3 Metric3 Metric4 Metric1
4 Metric1 Metric3 Metric4
聲明:本站的技術帖子網頁,遵循CC BY-SA 4.0協議,如果您需要轉載,請注明本站網址或者原文地址。任何問題請咨詢:yoyou2525@163.com.