将包含nan的Pandas列转换为dtype ' int '

我将数据从.csv文件读取到Pandas数据框架，如下所示。对于其中一列，即id，我想将列类型指定为int。问题是id系列有缺失/空值。

当我试图在读取.csv时将id列强制转换为整数时，我得到:

df= pd.read_csv("data.csv", dtype={'id': int}) 
error: Integer column has NA values

或者，我尝试转换列类型后，阅读如下，但这一次我得到:

df= pd.read_csv("data.csv") 
df[['id']] = df[['id']].astype(int)
error: Cannot convert NA to integer

我该如何解决这个问题?

当前回答

与Int64的问题，像许多其他的解决方案，是如果你有空值，他们被替换为<NA>值，这与熊猫默认的'NaN'函数，如isnull()或fillna()不工作。或者，如果您将值转换为-1，则可能会删除您的信息。我的解决方案有点蹩脚，但将用np提供int值。Nan，允许Nan函数在不影响您的值的情况下工作。

            def to_int(x):
                try:
                    return int(x)
                except:
                    return np.nan

            df[column] = df[column].apply(to_int)

2021-03-16 00:26:50

其他回答

import pandas as pd

df= pd.read_csv("data.csv")
df['id'] = pd.to_numeric(df['id'])

2020-06-06 00:09:14

我认为@消化1010101的方法更适合Pandas 1.2。+版本，像这样的东西应该做的工作:

df = df.astype({
            'col_1': 'Int64',
            'col_2': 'Int64',
            'col_3': 'Int64',
            'col_4': 'Int64', })

2021-06-29 03:47:43

类似于@hibernado的答案，但保持为整数(而不是字符串)

df[col] = df[col].fillna(-1)
df[col] = df[col].astype(int)
df[col] = np.where(df[col] == -1, np.nan, df[col])

2022-08-09 08:59:19

我的用例是在加载到DB表之前修改数据:

df[col] = df[col].fillna(-1)
df[col] = df[col].astype(int)
df[col] = df[col].astype(str)
df[col] = df[col].replace('-1', np.nan)

删除nan，转换为int，转换为str，然后重新插入nan。

它不漂亮，但它完成了工作!

2018-05-02 10:28:33

试试这个:

df[id]]

如果你输出它的dtypes，你将得到id Int64而不是普通的Int64

2020-09-23 11:28:57

将包含nan的Pandas列转换为dtype ' int '

推荐文章

最新文章

标签