检测和排除熊猫数据框架中的异常值

我有一个很少列的熊猫数据帧。

现在我知道某些行是基于某个列值的异常值。

例如

列“Vol”的所有值都在12xx左右，其中一个值是4000(离群值)。

现在我想排除那些Vol列像这样的行。

所以，本质上，我需要在数据帧上放一个过滤器，这样我们就可以选择所有的行，其中某一列的值距离平均值在3个标准差之内。

实现这一点的优雅方式是什么?

当前回答

把98和2百分位作为离群值的极限

upper_limit = np.percentile(X_train.logerror.values, 98) 
lower_limit = np.percentile(X_train.logerror.values, 2) # Filter the outliers from the dataframe
data[‘target’].loc[X_train[‘target’]>upper_limit] = upper_limit data[‘target’].loc[X_train[‘target’]<lower_limit] = lower_limit

2019-04-25 00:47:14

其他回答

#------------------------------------------------------------------------------
# accept a dataframe, remove outliers, return cleaned data in a new dataframe
# see http://www.itl.nist.gov/div898/handbook/prc/section1/prc16.htm
#------------------------------------------------------------------------------
def remove_outlier(df_in, col_name):
    q1 = df_in[col_name].quantile(0.25)
    q3 = df_in[col_name].quantile(0.75)
    iqr = q3-q1 #Interquartile range
    fence_low  = q1-1.5*iqr
    fence_high = q3+1.5*iqr
    df_out = df_in.loc[(df_in[col_name] > fence_low) & (df_in[col_name] < fence_high)]
    return df_out

2017-10-14 03:09:23

对于你的每一个数据帧列，你可以得到分位数:

q = df["col"].quantile(0.99)

然后用:

df[df["col"] < q]

如果需要移除上下异常值，将condition与and语句结合:

q_low = df["col"].quantile(0.01)
q_hi  = df["col"].quantile(0.99)

df_filtered = df[(df["col"] < q_hi) & (df["col"] > q_low)]

2017-03-29 12:22:09

删除至少一列中有异常值的所有行

如果你的数据框架中有多列，并且想要删除至少一列中有异常值的所有行，下面的表达式可以一次性完成:

import pandas as pd
import numpy as np
from scipy import stats


df = pd.DataFrame(np.random.randn(100, 3))

df[(np.abs(stats.zscore(df)) < 3).any(axis=1)]

描述:

中的每个列，它首先计算每个值的z分数列，相对于列的均值和标准差。然后取绝对z分数，因为方向没有物质，只有当它低于阈值时。 All(轴=1)确保对于每一行，所有列都满足约束。最后，这个条件的结果被用于索引数据帧。

基于单个列筛选其他列

为zscore指定一列，例如df[0]，并删除.all(axis=1)。

df[(np.abs(stats.zscore(df[0])) < 3)]

2014-04-21 17:20:35

你可以使用布尔掩码:

import pandas as pd

def remove_outliers(df, q=0.05):
    upper = df.quantile(1-q)
    lower = df.quantile(q)
    mask = (df < upper) & (df > lower)
    return mask

t = pd.DataFrame({'train': [1,1,2,3,4,5,6,7,8,9,9],
                  'y': [1,0,0,1,1,0,0,1,1,1,0]})

mask = remove_outliers(t['train'], 0.1)

print(t[mask])

输出:

   train  y
2      2  0
3      3  1
4      4  1
5      5  0
6      6  0
7      7  1
8      8  1

2019-05-21 10:02:59

去掉离群值的函数

def drop_outliers(df, field_name):
    distance = 1.5 * (np.percentile(df[field_name], 75) - np.percentile(df[field_name], 25))
    df.drop(df[df[field_name] > distance + np.percentile(df[field_name], 75)].index, inplace=True)
    df.drop(df[df[field_name] < np.percentile(df[field_name], 25) - distance].index, inplace=True)

2018-06-15 08:15:21

检测和排除熊猫数据框架中的异常值

推荐文章

最新文章

标签