根据累积总和将数据分成批次

Question

我正在尝试根据start_date和end_date批量处理一些数据，这些数据的条件是累积总和 <= 500000。假设我有一个包含两列的简单数据框：

index  Date            num_books
0      2021-01-01       200000
1      2021-01-02       240000
2      2021-01-03       55000
3      2021-01-04       400000
4      2021-01-05       80000
5      2021-01-06       100000

我需要对num_books中的值进行累积总和，直到它 <= 500000 并记录开始日期、结束日期和累积值。 这是我想要实现的一个例子

start_date  end_date   cumsum_books
2021-01-01  2021-01-03  495000
2021-01-04  2021-01-05  480000
2021-01-06  2021-01-06  100000

有没有一种有效的方法/功能来实现这一目标？ 谢谢！

Answer 1

这是一种方法：

from io import StringIO as sio
d = sio("""
index  Date            num_books
0      2021-01-01       200000
1      2021-01-02       240000
2      2021-01-03       55000
3      2021-01-04       400000
4      2021-01-05       80000
5      2021-01-06       100000
""")

import pandas as pd
df = pd.read_csv(d, sep='\s+')

batch_num = 5*10**5
df['batch_num'] = df['num_books'].cumsum()//batch_num 

result = df.groupby('batch_num').agg(start_date=('Date', 'min'), end_date=('Date', 'max'), cumsum_books=('num_books','sum'))
print(result)

#           start_date    end_date  cumsum_books
#batch_num                                      
#0          2021-01-01  2021-01-03        495000
#1          2021-01-04  2021-01-05        480000
#2          2021-01-06  2021-01-06        100000

请注意， result dataframe 还包含超过500_000的条目，但删除/过滤掉它是微不足道的。

根据累积总和将数据分成批次

问题描述

1 个解决方案

解决方案1
2 已采纳 2021-03-04 22:19:50

根据累积总和将数据分成批次

问题描述

1 个解决方案

解决方案1 2 已采纳 2021-03-04 22:19:50

解决方案1
2 已采纳 2021-03-04 22:19:50