将包含nan的Pandas列转换为dtype ' int '

我将数据从.csv文件读取到Pandas数据框架，如下所示。对于其中一列，即id，我想将列类型指定为int。问题是id系列有缺失/空值。

当我试图在读取.csv时将id列强制转换为整数时，我得到:

df= pd.read_csv("data.csv", dtype={'id': int}) 
error: Integer column has NA values

或者，我尝试转换列类型后，阅读如下，但这一次我得到:

df= pd.read_csv("data.csv") 
df[['id']] = df[['id']].astype(int)
error: Cannot convert NA to integer

我该如何解决这个问题?

当前回答

无论您的pandas系列是对象数据类型还是简单的浮点数据类型，下面的方法都可以工作

df = pd.read_csv("data.csv") 
df['id'] = df['id'].astype(float).astype('Int64')

2021-07-16 08:24:34

其他回答

首先删除包含NaN的行。然后对其余行进行整型转换。最后再次插入删除的行。希望能奏效

2018-08-01 10:05:17

无论您的pandas系列是对象数据类型还是简单的浮点数据类型，下面的方法都可以工作

df = pd.read_csv("data.csv") 
df['id'] = df['id'].astype(float).astype('Int64')

2021-07-16 08:24:34

如果可以修改存储的数据，可以使用一个标记值来替换缺失的id。一个常见的用例，由列名推断，id是一个严格大于零的整数，您可以使用0作为前哨值，这样就可以编写

if row['id']:
   regular_process(row)
else:
   special_process(row)

2016-04-25 08:38:01

我也遇到过类似的问题。这就是我的解决方案:

def toint(zahl = 1.1):
    try:
        zahl = int(zahl)
    except:
        zahl = np.nan
    return zahl

print(toint(4.776655), toint(np.nan), toint('test'))

4 楠楠

df = pd.read_csv("data.csv") 
df['id'] = df['id'].astype(float)
df['id'] = toint(df['id'])

2021-05-28 22:27:59

import pandas as pd

df= pd.read_csv("data.csv")
df['id'] = pd.to_numeric(df['id'])

2020-06-06 00:09:14

将包含nan的Pandas列转换为dtype ' int '

推荐文章

最新文章

标签