标准化R中的数据列

我有一个名为spam的数据集，其中包含58列和约3500行与垃圾邮件相关的数据。

我计划将来在这个数据集上运行一些线性回归，但我想事先做一些预处理，并将列标准化，使其具有零平均值和单位方差。

有人告诉我，最好的方法是用R，所以我想问，如何用R实现归一化?我已经正确加载了数据，我只是在寻找一些包或方法来执行这个任务。

当前回答

我假设你想要的是均值为0，标准差为1。如果你的数据在一个数据框架中，所有的列都是数值的，你可以简单地调用数据上的缩放函数来做你想做的事情。

dat <- data.frame(x = rnorm(10, 30, .2), y = runif(10, 3, 5))
scaled.dat <- scale(dat)

# check that we get mean of 0 and sd of 1
colMeans(scaled.dat)  # faster version of apply(scaled.dat, 2, mean)
apply(scaled.dat, 2, sd)

使用内置函数是有品位的。比如这只猫:

2013-03-05 03:49:06

其他回答

折叠包提供了最快的缩放函数-在c++中使用Welfords在线算法实现:

dat <- data.frame(x = rnorm(1e6, 30, .2), 
                  y = runif(1e6, 3, 5),
                  z = runif(1e6, 10, 20))

library(collapse)
library(microbenchmark)
microbenchmark(fscale(dat), scale(dat))

Unit: milliseconds
        expr       min       lq      mean    median        uq      max neval cld
 fscale(dat)  27.86456  29.5864  38.96896  30.80421  43.79045 313.5729   100  a 
  scale(dat) 357.07130 391.0914 489.93546 416.33626 625.38561 793.2243   100   b

此外:fscale是S3通用的向量、矩阵和数据帧，还支持分组和/或加权缩放操作，以及缩放到任意均值和标准偏差。

2020-09-01 21:58:15

缩放可以用于完整的数据帧和特定的列。对于特定的列，可以使用以下代码:

trainingSet[, 3:7] = scale(trainingSet[, 3:7]) # For column 3 to 7
trainingSet[, 8] = scale(trainingSet[, 8]) # For column 8

全数据帧

trainingSet <- scale(trainingSet)

2017-10-19 14:21:20

在我碰巧发现这条线索之前，我也有同样的问题。我有用户依赖的列类型，所以我写了一个for循环遍历它们并获得所需的列。也许有更好的方法，但这个方法很好地解决了问题:

 for(i in 1:length(colnames(df))) {
        if(class(df[,i]) == "numeric" || class(df[,i]) == "integer") {
            df[,i] <- as.vector(scale(df[,i])) }
        }

作为。向量是一个必要的部分，因为scale做rownames x 1矩阵这通常不是你想要的在data。frame中。

2017-06-12 14:35:04

当我使用Dason提出的解决方案时，而不是得到一个数据帧作为结果，我得到了一个数字向量(我的df的缩放值)。

为了防止有人遇到同样的问题，你必须在代码中添加as.data.frame()，就像这样:

df.scaled <- as.data.frame(scale(df))

我希望这对有同样问题的人有用!

2016-10-31 14:16:49

再说一次，尽管这是一个老问题，但它非常相关!我发现了一个简单的方法来规范化某些列，而不需要任何包:

normFunc <- function(x){(x-mean(x, na.rm = T))/sd(x, na.rm = T)}

例如

x<-rnorm(10,14,2)
y<-rnorm(10,7,3)
z<-rnorm(10,18,5)
df<-data.frame(x,y,z)

df[2:3] <- apply(df[2:3], 2, normFunc)

您将看到y和z列已经规范化。不需要软件包:-)

2018-07-04 16:43:11

标准化R中的数据列

推荐文章

最新文章

标签