使用多个单词边界分隔符将字符串拆分为单词

我想我想做的是一项相当常见的任务，但我在网上找不到任何参考资料。我有带标点符号的文本，我想要一个单词列表。

"Hey, you - what are you doing here!?"

应该是

['hey', 'you', 'what', 'are', 'you', 'doing', 'here']

但Python的str.split（）只对一个参数有效，所以在用空格拆分后，所有单词都带有标点符号。有什么想法吗？

当前回答

如果需要可逆操作（保留分隔符），可以使用此函数：

def tokenizeSentence_Reversible(sentence):
    setOfDelimiters = ['.', ' ', ',', '*', ';', '!']
    listOfTokens = [sentence]

    for delimiter in setOfDelimiters:
        newListOfTokens = []
        for ind, token in enumerate(listOfTokens):
            ll = [([delimiter, w] if ind > 0 else [w]) for ind, w in enumerate(token.split(delimiter))]
            listOfTokens = [item for sublist in ll for item in sublist] # flattens.
            listOfTokens = filter(None, listOfTokens) # Removes empty tokens: ''
            newListOfTokens.extend(listOfTokens)

        listOfTokens = newListOfTokens

    return listOfTokens

2018-01-22 08:25:18

其他回答

创建一个函数，将两个字符串（要拆分的源字符串和分隔符的拆分列表字符串）作为输入，并输出拆分单词列表：

def split_string(source, splitlist):
    output = []  # output list of cleaned words
    atsplit = True
    for char in source:
        if char in splitlist:
            atsplit = True
        else:
            if atsplit:
                output.append(char)  # append new word after split
                atsplit = False
            else: 
                output[-1] = output[-1] + char  # continue copying characters until next split
    return output

2017-05-10 00:58:57

在Python3中，您可以使用PY4E-PythonforEveryone中的方法。

我们可以通过使用字符串方法lower、标点符号和translate来解决这两个问题。翻译是最微妙的方法。以下是翻译文档：

your_string.translate（your_string.maketrans（fromstr，tostr，deletestr））

将fromstr中的字符替换为tostr中相同位置的字符，并删除deletestr中的所有字符。fromstr和tostr可以是空字符串，并且可以省略deletestr参数。

您可以看到“标点符号”：

In [10]: import string

In [11]: string.punctuation
Out[11]: '!"#$%&\'()*+,-./:;<=>?@[\\]^_`{|}~'

例如：

In [12]: your_str = "Hey, you - what are you doing here!?"

In [13]: line = your_str.translate(your_str.maketrans('', '', string.punctuation))

In [14]: line = line.lower()

In [15]: words = line.split()

In [16]: print(words)
['hey', 'you', 'what', 'are', 'you', 'doing', 'here']

有关详细信息，请参阅：

PY4E-面向每个人的Python字符串转换str.maketransPython字符串maketrans（）方法

2018-07-15 15:09:06

使用panda的series.str.split方法可以获得相同的结果，而不是使用re-module函数re.split。

首先，使用上述字符串创建一个系列，然后将该方法应用于该系列。

thestring=pd.Series（“嘿，你-你在这里干什么！？”）thestring.str.split（pat='，|-'）

参数pat接受分隔符并将拆分字符串作为数组返回。这里，使用|（或运算符）传递两个分隔符。输出如下：

[嘿，你，你在这里干什么！？]

2018-09-10 15:32:40

我遇到了类似的困境，不想使用“re”模块。

def my_split(s, seps):
    res = [s]
    for sep in seps:
        s, res = res, []
        for seq in s:
            res += seq.split(sep)
    return res

print my_split('1111  2222 3333;4444,5555;6666', [' ', ';', ','])
['1111', '', '2222', '3333', '4444', '5555', '6666']

2010-05-26 09:31:24

遇到与@ooboo相同的问题并找到此主题@ghostdog74启发了我，也许有人觉得我的解决方案很有用

str1='adj:sg:nom:m1.m2.m3:pos'
splitat=':.'
''.join([ s if s not in splitat else ' ' for s in str1]).split()

在空格处输入内容，如果不想在空格处拆分，请使用相同的字符进行拆分。

2011-03-15 10:12:20

使用多个单词边界分隔符将字符串拆分为单词

推荐文章

最新文章

标签