计算一个值在数据帧列中出现的频率

我有一个数据集

category
cat a
cat b
cat a

我希望能够返回(显示唯一值和频率)

category   freq 
cat a       2
cat b       1

当前回答

如果你想应用到所有列，你可以使用:

df.apply(pd.value_counts)

这将对每一列应用一个基于列的聚合函数(在本例中为value_counts)。

2016-04-05 18:30:11

其他回答

下面的代码为名为“smaller_dat1”的数据帧中的“Total_score”列中的各种值创建频率表，然后返回值“300”在该列中出现的次数。

valuec = smaller_dat1.Total_score.value_counts()
valuec.loc[300]

2021-06-27 20:21:21

使用value_counts()作为@DSM注释。

In [37]:
df = pd.DataFrame({'a':list('abssbab')})
df['a'].value_counts()

Out[37]:

b    3
a    2
s    2
dtype: int64

还有groupby和count。在这里有很多方法可以剥猫皮。

In [38]:
df.groupby('a').count()

Out[38]:

   a
a   
a  2
b  3
s  2

[3 rows x 1 columns]

查看在线文档。

如果你想将频率添加回原始数据帧，使用transform返回一个对齐的索引:

In [41]:
df['freq'] = df.groupby('a')['a'].transform('count')
df

Out[41]:

   a freq
0  a    2
1  b    3
2  s    2
3  s    2
4  b    3
5  a    2
6  b    3

[7 rows x 2 columns]

2014-03-13 21:41:34

如果没有任何库，你可以这样做:

def to_frequency_table(data):
    frequencytable = {}
    for key in data:
        if key in frequencytable:
            frequencytable[key] += 1
        else:
            frequencytable[key] = 1
    return frequencytable

例子:

to_frequency_table([1,1,1,1,2,3,4,4])
>>> {1: 4, 2: 1, 3: 1, 4: 2}

2017-03-27 22:05:15

n_values = data.income.value_counts()

第一个唯一值计数

n_at_most_50k = n_values[0]

第二个唯一值计数

n_greater_50k = n_values[1]

n_values

输出:

<=50K    34014
>50K     11208

Name: income, dtype: int64

输出:

n_greater_50k,n_at_most_50k:-
(11208, 34014)

2018-06-28 09:01:34

如果你的DataFrame有相同类型的值，你也可以在numpy.unique()中设置return_counts=True。

index, counts= np.unique(df.values,return_counts=True)

如果您的值是整数，则Np.bincount()可能更快。

2017-10-04 22:06:38

计算一个值在数据帧列中出现的频率

推荐文章

最新文章

标签