非贪婪(不情愿)正则匹配sed?

我试图使用sed来清理url行来提取域。

所以从:

http://www.suepearson.co.uk/product/174/71/3816/

我想要:

http://www.suepearson.co.uk/

(不管后面有没有斜杠，都没有关系)

我试过:

 sed 's|\(http:\/\/.*?\/\).*|\1|'

And(转义非贪婪量词)

sed 's|\(http:\/\/.*\?\/\).*|\1|'

但我似乎不能让非贪婪量词(?)工作，所以它总是匹配整个字符串。

当前回答

另一种方法，不使用正则表达式，是使用字段/分隔符方法，如

string="http://www.suepearson.co.uk/product/174/71/3816/"
echo $string | awk -F"/" '{print $1,$2,$3}' OFS="/"

2009-07-09 10:59:12

其他回答

使用纯(GNU) sed仍然有希望解决这个问题。尽管这不是一个通用的解决方案，在某些情况下，你可以使用“循环”来消除字符串中所有不必要的部分，就像这样:

sed -r -e ":loop" -e 's|(http://.+)/.*|\1|' -e "t loop"

-r:使用扩展的正则表达式(用于+和未转义的括号) 定义一个名为"loop"的新标签 -e:在sed中添加命令 "t loop":如果有成功的替换，则跳回标记"loop"

这里唯一的问题是它也会切掉最后一个分隔符('/')，但如果你真的需要它，你仍然可以在“循环”结束后简单地把它放回去，只需要在前面的命令行末尾追加这个额外的命令:

-e "s,$,/,"

2016-08-01 12:52:19

echo "/home/one/two/three/myfile.txt" | sed 's|\(.*\)/.*|\1|'

别麻烦了，我在另一个论坛上看到的:)

2010-12-10 01:20:36

如果你有gnu grep，那么可以使用perl regex:

grep -Po '^https?://([^/]+)(?=)' <<< 'http://www.suepearson.co.uk/product/174/71/3816/'
http://www.suepearson.co.uk

或者，在域名使用后获取一切

grep -Po '^https?://([^/]+)\K.*' <<< 'http://www.suepearson.co.uk/product/174/71/3816/'
/product/174/71/3816/

2021-06-19 13:12:08

Sed当然有它的位置，但这不是其中之一!

正如迪伊所指出的:用切就可以了。在这种情况下，它要简单得多，也安全得多。下面是一个使用Bash语法从URL中提取各种组件的示例:

url="http://www.suepearson.co.uk/product/174/71/3816/"

protocol=$(echo "$url" | cut -d':' -f1)
host=$(echo "$url" | cut -d'/' -f3)
urlhost=$(echo "$url" | cut -d'/' -f1-3)
urlpath=$(echo "$url" | cut -d'/' -f4-)

给你:

protocol = "http"
host = "www.suepearson.co.uk"
urlhost = "http://www.suepearson.co.uk"
urlpath = "product/174/71/3816/"

正如你所看到的，这是一个更加灵活的方法。

(全部归功于Dee)

2013-08-30 14:41:15

在这种特定情况下，您可以在不使用非贪婪正则表达式的情况下完成工作。

试试这个非贪婪的正则表达式[^/]*来代替。*?：

sed 's|\(http://[^/]*/\).*|\1|g'

2009-07-09 10:51:34

非贪婪(不情愿)正则匹配sed?

推荐文章

最新文章

标签