标记数据错误

我试图使用熊猫操作.csv文件，但我得到这个错误:

pandas.parser.CParserError:标记数据错误。C错误:第3行有2个字段，见12

我试着读过熊猫的文件，但一无所获。

我的代码很简单:

path = 'GOOG Key Ratios.csv'
#print(open(path).read())
data = pd.read_csv(path)

我该如何解决这个问题?我应该使用csv模块还是其他语言?

文件来自晨星公司

当前回答

我有一个类似的情况

train = pd.read_csv('input.csv' , encoding='latin1',engine='python')

工作

2018-11-20 02:08:07

其他回答

虽然这个问题并非如此，但压缩数据也可能出现此错误。显式地设置kwarg压缩值解决了我的问题。

result = pandas.read_csv(data_source, compression='gzip')

2016-10-03 15:45:19

这就是我所做的。

Sep ='::'解决了我的问题:

data=pd.read_csv('C:\\Users\\HP\\Downloads\\NPL ASSINGMENT 2 imdb_labelled\\imdb_labelled.txt',engine='python',header=None,sep='::')

2018-10-21 13:04:24

据我所知，在查看了您的文件后，问题是您试图加载的csv文件有多个表。有空行，或者包含表标题的行。试着看看这个Stackoverflow的答案。它展示了如何以编程方式实现这一点。

另一种动态方法是使用csv模块，一次读取每一行，并进行健全检查/正则表达式，以推断该行是否为(title/header/values/blank)。使用这种方法还有一个优点，你可以根据需要在python对象中分割/追加/收集数据。

最简单的方法是在手动选择表格并将其复制到剪贴板后使用pandas函数pd.read_clipboard()，以防您可以在excel或其他工具中打开csv。

无关:

此外，与您的问题无关，但因为没有人提到这一点:我在从UCI加载一些数据集(如seeds_dataset.txt)时遇到了同样的问题。在我的例子中，发生错误是因为一些分隔符的空格比真正的制表符多。例如，请参见下面的第3行

14.38   14.21   0.8951  5.386   3.312   2.462   4.956   1
14.69   14.49   0.8799  5.563   3.259   3.586   5.219   1
14.11   14.1    0.8911  5.42    3.302   2.7     5       1

因此，在分隔符模式中使用\t+而不是\t。

data = pd.read_csv(path, sep='\t+`, header=None)

2019-11-03 09:35:50

在我的例子中，分隔符不是默认的“，”，而是Tab。

pd.read_csv(file_name.csv, sep='\\t',lineterminator='\\r', engine='python', header='infer')

注意:“\t”并不像某些来源所建议的那样有效。“\\t”是必需的。

2020-05-04 18:27:09

我有同样的问题，当read_csv: ParserError:错误标记数据。我只是把旧的csv文件保存为一个新的csv文件。问题解决了!

2018-11-26 13:32:41

标记数据错误

推荐文章

最新文章

标签