使用pandas中的groupby用模式替换缺失值时的IndexError

Question

我有一个需要缺失价值处理的数据集。

 Column                      Missing Values

 Complaint_ID                    0         
 Date_received                   0         
 Transaction_Type                0         
 Complaint_reason                0         
 Company_response              22506         
 Date_sent_to_company            0         
 Complaint_Status                0         
 Consumer_disputes             7698

现在的问题是，当我尝试使用groupby用其他columns模式替换缺少的values时：

码：

data11["Company_response"] = 
data11.groupby("Complaint_reason").transform(lambda x: x.fillna(x.mode() 
[0]))["Company_response"]

data11["Consumer_disputes"] = 
data11.groupby("Transaction_Type").transform(lambda x: x.fillna(x.mode() 
[0]))["Consumer_disputes"]

我收到以下错误：

堆栈跟踪

Traceback (most recent call last):

File "<ipython-input-89-8de6a010a299>", line 1, in <module>
    data11["Company_response"] = data11.groupby("Complaint_reason").transform(lambda x: x.fillna(x.mode()[0]))["Company_response"]

  File "C:\Anaconda3\lib\site-packages\pandas\core\groupby.py", line 3741, in transform
    return self._transform_general(func, *args, **kwargs)

  File "C:\Anaconda3\lib\site-packages\pandas\core\groupby.py", line 3699, in _transform_general
    res = path(group)

  File "C:\Anaconda3\lib\site-packages\pandas\core\groupby.py", line 3783, in <lambda>
    lambda x: func(x, *args, **kwargs), axis=self.axis)

  File "C:\Anaconda3\lib\site-packages\pandas\core\frame.py", line 4360, in apply
    ignore_failures=ignore_failures)

  File "C:\Anaconda3\lib\site-packages\pandas\core\frame.py", line 4456, in _apply_standard
    results[i] = func(v)

  File "C:\Anaconda3\lib\site-packages\pandas\core\groupby.py", line 3783, in <lambda>
    lambda x: func(x, *args, **kwargs), axis=self.axis)

  File "<ipython-input-89-8de6a010a299>", line 1, in <lambda>
    data11["Company_response"] = data11.groupby("Complaint_reason").transform(lambda x: x.fillna(x.mode()[0]))["Company_response"]

  File "C:\Anaconda3\lib\site-packages\pandas\core\series.py", line 601, in __getitem__
    result = self.index.get_value(self, key)

  File "C:\Anaconda3\lib\site-packages\pandas\core\indexes\base.py", line 2434, in get_value
    return libts.get_value_box(s, key)

  File "pandas\_libs\tslib.pyx", line 923, in pandas._libs.tslib.get_value_box (pandas\_libs\tslib.c:18843)

  File "pandas\_libs\tslib.pyx", line 939, in pandas._libs.tslib.get_value_box (pandas\_libs\tslib.c:18560)

IndexError: ('index out of bounds', 'occurred at index Consumer_disputes')

我检查了dataframe及其所有列的length ，它是相同的：43266。

我也发现了类似的问题，但没有正确的答案：点击这里

请帮助解决错误。

IndexError :('index out of bounds'，'发生在索引Consumer_disputes'）

以下是数据集的快照，如果它有任何帮助：数据集快照

我成功使用以下代码。 但它并不完全符合我的目的。 尽管有助于填补缺失的值。

data11['Company_response'].fillna(data11['Company_response'].mode()[0], 
inplace=True)
data11['Consumer_disputes'].fillna(data11['Consumer_disputes'].mode()[0], 
inplace=True)

Edit1 :(附加样本）

输入给定：

预期产出：

您可以看到Tr-1和Tr-3的公司响应的缺失值通过采用投诉原因的模式来填充。 对于消费者纠纷，类似于采用交易类型的方式，对于Tr-5。

下面的代码段由数据框和代码组成，供那些想要复制并试一试的人使用。

复制代码

import pandas as pd
import numpy as np

data11=pd.DataFrame({'Complaint_ID':['Tr-1','Tr-2','Tr-3','Tr-4','Tr-5','Tr-6'],
                    'Transaction_Type':['Mortgage','Credit card','Bank account or service','Debt collection','Credit card','Mortgage'],
                    'Complaint_reason':['Loan servicing, payments, escrow account','Incorrect information on credit report',"Cont'd attempts collect debt not owed","Cont'd attempts collect debt not owed",'Payoff process','Loan servicing, payments, escrow account'],
                    'Company_response':[np.nan,'Company chooses not to provide a public response',np.nan,'Company believes it acted appropriately as authorized by contract or law','Company has responded to the consumer and the CFPB and chooses not to provide a public response','Company disputes the facts presented in the complaint'],
                    'Consumer_disputes':['Yes','No','No','No',np.nan,'Yes']})

data11.isnull().sum()

data11["Company_response"] = data11.groupby("Complaint_reason").transform(lambda x: x.fillna(x.mode()[0]))["Company_response"]
data11["Consumer_disputes"] = data11.groupby("Transaction_Type").transform(lambda x: x.fillna(x.mode()[0]))["Consumer_disputes"]

Answer 1

引发错误是因为对于至少一个组，相应聚合列中的值仅包含np.nan值。 在这种情况下， pd.Series([np.nan]).mode()返回一个空系列，当你取第一个值时会导致错误。

所以，你可以使用像transform(lambda x: x.fillna(x.mode()[0] if not x.mode().empty else "Empty") )这样的东西transform(lambda x: x.fillna(x.mode()[0] if not x.mode().empty else "Empty") ) 。

Answer 2

尝试：

data11["Company_response"] = data11.groupby("Complaint_reason")['Company_response'].transform(lambda x: x.fillna(x.mode()[0]))

data11["Consumer_disputes"] = data11.groupby("Transaction_Type")['Consumer_disputes'].transform(lambda x: x.fillna(x.mode()[0]))

Answer 3

@Mikhail Berlinkov几乎肯定是正确的。 我能够重现你的错误，然后使用dropna()来避免它：

data11.groupby("Transaction-Type").transform(
    lambda x: x.fillna(x.mode() [0]))["Consumer-disputes"]  
# Returns IndexError

data11.dropna().groupby("Transaction-Type").transform(
    lambda x: x.fillna(x.mode() [0]))["Consumer-disputes"]  
# Works

使用pandas中的groupby用模式替换缺失值时的IndexError

问题描述

堆栈跟踪

复制代码

3 个解决方案

解决方案1
2 2019-01-01 16:42:05

解决方案2
1 已采纳 2019-01-01 20:09:16

解决方案3
0 2019-01-02 07:53:49

使用pandas中的groupby用模式替换缺失值时的IndexError

问题描述

堆栈跟踪

复制代码

3 个解决方案

解决方案1 2 2019-01-01 16:42:05

解决方案2 1 已采纳 2019-01-01 20:09:16

解决方案3 0 2019-01-02 07:53:49

解决方案1
2 2019-01-01 16:42:05

解决方案2
1 已采纳 2019-01-01 20:09:16

解决方案3
0 2019-01-02 07:53:49