如何在Dataframe中找到最长的NaN序列？

Question

假设我有一个这样的数据框：

Time                           A            B           C             D                                                               
2019-06-17 08:45:00     12089.89     12089.89    12087.71      12087.71      
2019-06-17 08:46:00          NaN          NaN    12087.71      12087.91      
2019-06-17 08:47:00          NaN     12088.21    12084.21      12085.21      
2019-06-17 08:48:00          NaN     12090.21         NaN           NaN      
2019-06-17 08:49:00          NaN     12090.21         NaN           NaN     
2019-06-17 08:50:00          NaN          NaN    12504.11           NaN     
2019-06-17 08:51:00          NaN          NaN    12503.11      12503.11    
2019-06-17 08:52:00     12504.11          NaN    12503.11      12503.11      
2019-06-17 08:53:00     12503.61     12503.61    12503.61      12503.61      
2019-06-17 08:54:00     12503.61     12503.61    12503.11      12503.11

如何在整个df中找到最长的不间断NaN序列的长度？ （在示例中为 6 ）有效吗？

编辑：忘记强调“有效”这个词，因为 df 大约有 1mio 行长

Answer 1

让我们尝试apply一个用户定义的函数，它cumsum()使用cumsum()来识别块：

def max_na(s):
    isna = s.isna()
    blocks = (~isna).cumsum()
    return isna.groupby(blocks).sum().max()

df.apply(max_na).max()
# 6.0

如何在Dataframe中找到最长的NaN序列？

问题描述

1 个解决方案

解决方案1
3 已采纳 2020-08-26 21:13:32

如何在Dataframe中找到最长的NaN序列？

问题描述

1 个解决方案

解决方案1 3 已采纳 2020-08-26 21:13:32

解决方案1
3 已采纳 2020-08-26 21:13:32