Pandas 使用嵌套數據框列的總和創建一列

Question

如何使用來自嵌套數據幀的值的總和將新列添加到數據幀，而不會丟失任何其他列和使用 Pandas 的嵌套數據？

具體來說，我想創建一個新列total_cost ，其中包含一行的所有嵌套數據幀的總和。

我設法使用一系列groupby和apply創建了以下數據groupby ：

  user_id   description                                       unit_summary
0     111  xxx  [{'total_period_cost': 100, 'unit_id': 'xxx', ...
1     222  xxx  [{'total_period_cost': 100, 'unit_id': 'yyy', ...

我正在嘗試添加列total_cost ，它是每個嵌套數據幀的total_period_cost的總和（按user_id分組）。 如何實現以下數據框？

  user_id   description   total_cost                          unit_summary
0     111  xxx  300  [{'total_period_cost': 100, 'unit_id': 'xxx', ...
1     222  xxx  100  [{'total_period_cost': 100, 'unit_id': 'yyy', ...

我的代碼：

import pandas as pd

series = [{
    "user_id":"111", 
    "description": "xxx",
    "unit_summary":[
        {
        "total_period_cost":100,
        "unit_id":"xxx",
        "cost_per_unit":50,
        "total_period_usage":2
        },
        {
        "total_period_cost":200,
        "unit_id":"yyy",
        "cost_per_unit":25,
        "total_period_usage": 8
        }
    ]
},
{
    "user_id":"222",
    "description": "xxx",
    "unit_summary":[
        {
            "total_period_cost":100,
            "unit_id":"yyy",
            "cost_per_unit":25,
            "total_period_usage": 4
        }
    ]
}]

df = pd.DataFrame(series)

print(df)
print(df.to_dict(orient='records'))

這是我用來實現`series` JSON 對象的 groupby..apply 代碼示例：

import pandas as pd

series = [
    {"user_id":"111", "unit_id":"xxx","cost_per_unit":50, "total_period_usage": 1},
    {"user_id":"111", "unit_id":"xxx","cost_per_unit":50, "total_period_usage": 1},
    {"user_id":"111", "unit_id":"yyy","cost_per_unit":25, "total_period_usage": 8},
    {"user_id":"222", "unit_id":"yyy","cost_per_unit":25, "total_period_usage": 3},
    {"user_id":"222", "unit_id":"yyy","cost_per_unit":25, "total_period_usage": 1}
]

df = pd.DataFrame(series)

sumc = (
    df.groupby(['user_id', 'unit_id', 'cost_per_unit'], as_index=False)
        .agg({'total_period_usage': 'sum'})
)

sumc['total_period_cost'] = sumc.total_period_usage * sumc.cost_per_unit

sumc = (
    sumc.groupby(['user_id'])
        .apply(lambda x: x[['total_period_cost', 'unit_id', 'cost_per_unit', 'total_period_usage']].to_dict('r'))
        .reset_index()
)

sumc = sumc.rename(columns={0:'unit_summary'})

sumc['description'] = 'xxx'

print(sumc)
print(sumc.to_dict(orient='records'))

通過在 anky_91 的答案中添加以下內容來解決它：

def myf(x):
    return pd.DataFrame(x).loc[:,'total_period_cost'].sum()
# Sum all server sumbscriptions total_period_cost
sumc['total_period_cost'] = sumc['unit_summary'].apply(myf)

Answer 1

您可以將unit_summary列中的每一行讀取為數據unit_summary並對所需的列求和：

方法一： apply

def myf(x):
    return pd.DataFrame(x).loc[:,'total_period_cost'].sum()
df['total_cost'] = df['unit_summary'].apply(myf)

print(df)

方法2：同樣通過列表理解：

df['total_cost'] = [pd.DataFrame(i)['total_period_cost'].sum() 
                            for i in df['unit_summary'].tolist()]

方法3：使用explode ：

m = df['unit_summary'].explode()
df['total_cost'] = pd.DataFrame(m.tolist(),index=m.index)['total_period_cost'].sum(level=0)

  user_id description                                       unit_summary  \
0     111         xxx  [{'total_period_cost': 100, 'unit_id': 'xxx', ...   
1     222         xxx  [{'total_period_cost': 100, 'unit_id': 'yyy', ...   

   total_cost  
0         300  
1         100

除了上述之外，從您的原始數據幀開始，我們還可以執行以下操作來實現所需的輸出，但這不會為您提供帶有 dicts ('unit_summary`) 的系列：

(df.assign(total_cost=df['cost_per_unit']*df['total_period_usage'])
  .groupby(['user_id'],as_index=False)['total_cost'].sum().assign(description='xxxx'))

  user_id  total_cost description
0     111         300        xxxx
1     222         100        xxxx

Pandas 使用嵌套數據框列的總和創建一列

問題描述

我的代碼：

這是我用來實現`series` JSON 對象的 groupby..apply 代碼示例：

通過在 anky_91 的答案中添加以下內容來解決它：

1 個解決方案

解決方案1
2 已采納 2019-12-31 09:48:54

Pandas 使用嵌套數據框列的總和創建一列

問題描述

我的代碼：

這是我用來實現series JSON 對象的 groupby..apply 代碼示例：

通過在 anky_91 的答案中添加以下內容來解決它：

1 個解決方案

解決方案1 2 已采納 2019-12-31 09:48:54

這是我用來實現`series` JSON 對象的 groupby..apply 代碼示例：

解決方案1
2 已采納 2019-12-31 09:48:54