标记数据错误

我试图使用熊猫操作.csv文件，但我得到这个错误:

pandas.parser.CParserError:标记数据错误。C错误:第3行有2个字段，见12

我试着读过熊猫的文件，但一无所获。

我的代码很简单:

path = 'GOOG Key Ratios.csv'
#print(open(path).read())
data = pd.read_csv(path)

我该如何解决这个问题?我应该使用csv模块还是其他语言?

文件来自晨星公司

当前回答

问题可能与文件问题，在我的情况下，问题在重命名文件后得到解决。还没弄清楚原因。

2018-10-28 12:46:45

其他回答

有时候问题不在于如何使用python，而在于如何处理原始数据。我得到了这个错误信息

Error tokenizing data. C error: Expected 18 fields in line 72, saw 19.

结果发现，在列描述中有时会有逗号。这意味着需要清理CSV文件或使用另一个分隔符。

2017-11-15 10:59:33

在我的例子中，这是因为csv文件的第一行和最后两行格式与文件的中间内容不同。

因此，我所做的是将csv文件作为字符串打开，解析字符串的内容，然后使用read_csv获取数据帧。

import io
import pandas as pd

file = open(f'{file_path}/{file_name}', 'r')
content = file.read()

# change new line character from '\r\n' to '\n'
lines = content.replace('\r', '').split('\n')

# Remove the first and last 2 lines of the file
# StringIO can be considered as a file stored in memory
df = pd.read_csv(StringIO("\n".join(lines[2:-2])), header=None)

2019-11-27 01:13:44

我遇到过这样的错误，一个丢失的引号。我使用映射软件，当导出以逗号分隔的文件时，它会在文本项周围加上引号。使用引号的文本(例如:“=英尺”和“=英寸”)可能会有问题。考虑下面这个例子，5英寸的测井曲线打印很差:

UWI_key,经度,纬度,备注 US42051316890000, 30.4386484, -96.4330734,“可怜的5””

用5英寸作为5英寸的简写，最终会给工作带来麻烦。Excel会简单地去掉额外的引号，但是Pandas没有上面提到的error_bad_lines=False参数就会失效。

一旦你知道了错误的本质，在导入之前，从文本编辑器(例如Sublime text 3或notepad++)中进行查找-替换可能是最简单的。

2019-04-30 02:20:32

我相信解决方案，

,engine='python'
, error_bad_lines = False

如果它是虚拟列并且你想要删除它，这将是很好的。在我的例子中，第二行确实有更多的列，我希望这些列被积分，并且有列数= MAX(列)。

请参考下面我无法阅读的解决方案:

try:
    df_data = pd.read_csv(PATH, header = bl_header, sep = str_sep)
except pd.errors.ParserError as err:
    str_find = 'saw '
    int_position = int(str(err).find(str_find)) + len(str_find)
    str_nbCol = str(err)[int_position:]
    l_col = range(int(str_nbCol))
    df_data = pd.read_csv(PATH, header = bl_header, sep = str_sep, names = l_col)

2020-05-13 06:41:07

在我的例子中，分隔符不是默认的“，”，而是Tab。

pd.read_csv(file_name.csv, sep='\\t',lineterminator='\\r', engine='python', header='infer')

注意:“\t”并不像某些来源所建议的那样有效。“\\t”是必需的。

2020-05-04 18:27:09

标记数据错误

推荐文章

最新文章

标签