在Pandas数据帧中选择多个列

列名（字符串）无法按您尝试的方式进行切片。

这里有两个选项。如果您从上下文中知道要分割哪些变量，只需通过将列表传递到__getitem_语法（[]）中，即可返回这些列的视图。

df1 = df[['a', 'b']]

或者，如果重要的是对它们进行数字索引，而不是按它们的名称进行索引（假设您的代码应该在不知道前两列的名称的情况下自动进行索引），那么您可以改为这样做：

df1 = df.iloc[:, 0:2] # Remember that Python does not slice inclusive of the ending index.

此外，您应该熟悉Pandas对象视图与该对象副本的概念。上述第一个方法将在内存中返回所需子对象（所需切片）的新副本。

然而，有时Pandas中有一些索引约定不这样做，而是给你一个新变量，它只引用与原始对象中的子对象或切片相同的内存块。这将发生在第二种索引方式中，因此您可以使用.copy（）方法对其进行修改以获得常规副本。当发生这种情况时，更改您认为的切片对象有时会更改原始对象。时刻注意这一点总是很好的。

df1 = df.iloc[0, 0:2].copy() # To avoid the case where changing df1 also changes df

要使用iloc，您需要知道列位置（或索引）。由于列位置可能会改变，您可以使用iloc和dataframe对象的columns方法的get_loc函数来获取列索引，而不是硬编码索引。

{df.columns.get_loc(c): c for idx, c in enumerate(df.columns)}

现在，您可以使用此字典通过名称和iloc访问列。

2012-07-02 02:43:02

也可以使用df.pop（）：

>>> df = pd.DataFrame([('falcon', 'bird',    389.0),
...                    ('parrot', 'bird',     24.0),
...                    ('lion',   'mammal',   80.5),
...                    ('monkey', 'mammal', np.nan)],
...                   columns=('name', 'class', 'max_speed'))
>>> df
     name   class  max_speed
0  falcon    bird      389.0
1  parrot    bird       24.0
2    lion  mammal       80.5
3  monkey  mammal

>>> df.pop('class')
0      bird
1      bird
2    mammal
3    mammal
Name: class, dtype: object

>>> df
     name  max_speed
0  falcon      389.0
1  parrot       24.0
2    lion       80.5
3  monkey        NaN

请使用df.pop（c）。

2019-01-29 05:37:50

列名（字符串）无法按您尝试的方式进行切片。

这里有两个选项。如果您从上下文中知道要分割哪些变量，只需通过将列表传递到__getitem_语法（[]）中，即可返回这些列的视图。

df1 = df[['a', 'b']]

或者，如果重要的是对它们进行数字索引，而不是按它们的名称进行索引（假设您的代码应该在不知道前两列的名称的情况下自动进行索引），那么您可以改为这样做：

df1 = df.iloc[:, 0:2] # Remember that Python does not slice inclusive of the ending index.

此外，您应该熟悉Pandas对象视图与该对象副本的概念。上述第一个方法将在内存中返回所需子对象（所需切片）的新副本。

然而，有时Pandas中有一些索引约定不这样做，而是给你一个新变量，它只引用与原始对象中的子对象或切片相同的内存块。这将发生在第二种索引方式中，因此您可以使用.copy（）方法对其进行修改以获得常规副本。当发生这种情况时，更改您认为的切片对象有时会更改原始对象。时刻注意这一点总是很好的。

df1 = df.iloc[0, 0:2].copy() # To avoid the case where changing df1 also changes df

要使用iloc，您需要知道列位置（或索引）。由于列位置可能会改变，您可以使用iloc和dataframe对象的columns方法的get_loc函数来获取列索引，而不是硬编码索引。

{df.columns.get_loc(c): c for idx, c in enumerate(df.columns)}

现在，您可以使用此字典通过名称和iloc访问列。

2012-07-02 02:43:02

In [39]: df
Out[39]: 
   index  a  b  c
0      1  2  3  4
1      2  3  4  5

In [40]: df1 = df[['b', 'c']]

In [41]: df1
Out[41]: 
   b  c
0  3  4
1  4  5

2012-07-08 17:55:12

对于Pandas，

具有列名称

dataframe[['column1','column2']]

要通过iloc和带有索引编号的特定列进行选择，请执行以下操作：

dataframe.iloc[:,[1,2]]

带有loc的列名可以使用如下

dataframe.loc[:,['column1','column2']]

2018-11-21 15:32:56

要选择多个列，请提取并查看它们：df是先前命名的数据帧。然后创建一个新的数据帧df1，并选择要提取和查看的列a到D。

df1 = pd.DataFrame(data_frame, columns=['Column A', 'Column B', 'Column C', 'Column D'])
df1

将显示所有必需的列！

2020-10-11 10:40:52

在Pandas数据帧中选择多个列

推荐文章

最新文章

标签