如何检查在熊猫数据框架中是否有NaN值

在Python Pandas中，检查DataFrame是否有一个(或多个)NaN值的最佳方法是什么?

我知道函数pd。isnan，但这将返回每个元素的布尔值的DataFrame。这篇文章也没有完全回答我的问题。

当前回答

这将只包括至少有一个null/na值的列。

 df.isnull().sum()[df.isnull().sum()>0]

2022-09-24 20:20:54

其他回答

由于pandas必须为DataFrame.dropna()找到这一点，我看了看他们是如何实现它的，并发现他们使用了DataFrame.count()，它会计数DataFrame中的所有非空值。参考熊猫源代码。我还没有对这种技术进行基准测试，但我认为库的作者可能已经就如何实现它做出了明智的选择。

2016-06-16 05:06:18

最好的方法是:

df.isna().any().any()

原因如下。所以isna()被用来定义isnull()，但这两者当然是相同的。

这甚至比公认的答案还要快，并且涵盖了所有2D熊猫数组。

2019-06-03 11:00:51

另一种方法是dropna，检查长度是否相等:

>>> len(df.dropna()) != len(df)
True
>>>

2021-10-18 15:06:15

df为Pandas数据框架的名称，任意值为numpy。Nan为空值。

如果你想查看哪些列有空，哪些没有(只有True和False) .any df.isnull () () 如果您只想查看有空值的列 df。loc [: df.isnull () .any ()] .columns 如果您想查看每一列中null的计数 .sum df.isna () () 如果您想查看每一列中空的百分比 .sum df.isna () () / (len (df)) * 100 如果你想查看只有空值的列中空值的百分比:

df.loc[:,list(df.loc[:,df.isnull().any()].columns)].isnull().sum()/(len(df))*100

编辑1:

如果你想从视觉上看到数据缺失的地方:

import missingno
missingdata_df = df.columns[df.isnull().any()].tolist()
missingno.matrix(df[missingdata_df])

2019-07-22 07:29:07

Jwilner的回答是正确的。我正在探索是否有更快的选择，因为根据我的经验，平坦数组的和(奇怪地)比计数快。这段代码似乎更快:

df.isnull().values.any()

import numpy as np
import pandas as pd
import perfplot


def setup(n):
    df = pd.DataFrame(np.random.randn(n))
    df[df > 0.9] = np.nan
    return df


def isnull_any(df):
    return df.isnull().any()


def isnull_values_sum(df):
    return df.isnull().values.sum() > 0


def isnull_sum(df):
    return df.isnull().sum() > 0


def isnull_values_any(df):
    return df.isnull().values.any()


perfplot.save(
    "out.png",
    setup=setup,
    kernels=[isnull_any, isnull_values_sum, isnull_sum, isnull_values_any],
    n_range=[2 ** k for k in range(25)],
)

df.isnull().sum().sum()有点慢，但当然，它有额外的信息——nan的数量。

2015-04-09 05:39:54

如何检查在熊猫数据框架中是否有NaN值

推荐文章

最新文章

标签