将包含nan的Pandas列转换为dtype ' int '

我将数据从.csv文件读取到Pandas数据框架，如下所示。对于其中一列，即id，我想将列类型指定为int。问题是id系列有缺失/空值。

当我试图在读取.csv时将id列强制转换为整数时，我得到:

df= pd.read_csv("data.csv", dtype={'id': int}) 
error: Integer column has NA values

或者，我尝试转换列类型后，阅读如下，但这一次我得到:

df= pd.read_csv("data.csv") 
df[['id']] = df[['id']].astype(int)
error: Cannot convert NA to integer

我该如何解决这个问题?

当前回答

假设您的DateColumn格式3312018.0应该转换为03/31/2018作为字符串。并且，一些记录丢失或为0。

df['DateColumn'] = df['DateColumn'].astype(int)
df['DateColumn'] = df['DateColumn'].astype(str)
df['DateColumn'] = df['DateColumn'].apply(lambda x: x.zfill(8))
df.loc[df['DateColumn'] == '00000000','DateColumn'] = '01011980'
df['DateColumn'] = pd.to_datetime(df['DateColumn'], format="%m%d%Y")
df['DateColumn'] = df['DateColumn'].apply(lambda x: x.strftime('%m/%d/%Y'))

2018-04-06 14:40:04

其他回答

对于任何需要在包含NULL/ nan的列中具有int值，但在其他答案中提到的不能使用pandas版本0.24.0可空整数特性的约束下工作的人，我建议使用pd.where将列转换为对象类型:

df = df.where(pd.notnull(df), None)

这将数据帧中的所有nan转换为None，将混合类型的列作为对象，但将int值保留为int，而不是float。

2021-05-07 15:41:13

首先删除包含NaN的行。然后对其余行进行整型转换。最后再次插入删除的行。希望能奏效

2018-08-01 10:05:17

我也遇到过类似的问题。这就是我的解决方案:

def toint(zahl = 1.1):
    try:
        zahl = int(zahl)
    except:
        zahl = np.nan
    return zahl

print(toint(4.776655), toint(np.nan), toint('test'))

4 楠楠

df = pd.read_csv("data.csv") 
df['id'] = df['id'].astype(float)
df['id'] = toint(df['id'])

2021-05-28 22:27:59

从Pandas 1.0.0开始，你可以使用Pandas了。NA的价值观。这不会强制缺少值的整数列为浮点数。

在读取数据时，您需要做的是:

df= pd.read_csv("data.csv", dtype={'id': 'Int64'})

注意'Int64'被引号括起来，I是大写的。这区分了Panda的'Int64'和numpy的'Int64'。

作为旁注，这也适用于.astype()

df['id'] = df['id'].astype('Int64')

文件在这里 https://pandas.pydata.org/pandas-docs/stable/user_guide/integer_na.html

2020-09-15 03:26:41

import pandas as pd

df= pd.read_csv("data.csv")
df['id'] = pd.to_numeric(df['id'])

2020-06-06 00:09:14

将包含nan的Pandas列转换为dtype ' int '

推荐文章

最新文章

标签