非贪婪(不情愿)正则匹配sed?

我试图使用sed来清理url行来提取域。

所以从:

http://www.suepearson.co.uk/product/174/71/3816/

我想要:

http://www.suepearson.co.uk/

(不管后面有没有斜杠，都没有关系)

我试过:

 sed 's|\(http:\/\/.*?\/\).*|\1|'

And(转义非贪婪量词)

sed 's|\(http:\/\/.*\?\/\).*|\1|'

但我似乎不能让非贪婪量词(?)工作，所以它总是匹配整个字符串。

当前回答

使用纯(GNU) sed仍然有希望解决这个问题。尽管这不是一个通用的解决方案，在某些情况下，你可以使用“循环”来消除字符串中所有不必要的部分，就像这样:

sed -r -e ":loop" -e 's|(http://.+)/.*|\1|' -e "t loop"

-r:使用扩展的正则表达式(用于+和未转义的括号) 定义一个名为"loop"的新标签 -e:在sed中添加命令 "t loop":如果有成功的替换，则跳回标记"loop"

这里唯一的问题是它也会切掉最后一个分隔符('/')，但如果你真的需要它，你仍然可以在“循环”结束后简单地把它放回去，只需要在前面的命令行末尾追加这个额外的命令:

-e "s,$,/,"

其他回答

Sed不支持“非贪婪”操作符。

你必须使用“[]”操作符来排除“/”匹配。

sed 's,\(http://[^/]*\)/.*,\1,'

附注:不需要反斜杠"/"。

sed -r -e ":loop" -e 's|(http://.+)/.*|\1|' -e "t loop"

-r:使用扩展的正则表达式(用于+和未转义的括号) 定义一个名为"loop"的新标签 -e:在sed中添加命令 "t loop":如果有成功的替换，则跳回标记"loop"

-e "s,$,/,"

另一种方法，不使用正则表达式，是使用字段/分隔符方法，如

string="http://www.suepearson.co.uk/product/174/71/3816/"
echo $string | awk -F"/" '{print $1,$2,$3}' OFS="/"

sed 's|(http:\/\/[^\/]+\/).*|\1|'

不幸的是，如前所述，sed不支持这一点。为了克服这个问题，我建议使用次优方法(实际上甚至更好)，使用类似vim sed的功能。

在.bash-profile中定义

vimdo() { vim $2 --not-a-term -c "$1"  -es +"w >> /dev/stdout" -cq!  ; }

这将创建无头vim来执行命令。

现在你可以这样做:

回声路径美元| vimdo“% s_ \ c: [a-zA-Z0-9 \ \ /] python (a-zA-Z0-9 \ {-} \\/]\{-}:__ g”,

过滤掉$PATH中的python。

使用-在vimdo中从管道中输入。

而大多数语法是相同的。Vim具有更高级的特性，并且使用\{-}是非贪婪匹配的标准。参见帮助regexp。

推荐文章