在Bash中提取子字符串

给定someletters_12345_moreleters形式的文件名。ext，我想提取5位数字，并将它们放入一个变量。

为了强调这一点，我有一个x个字符的文件名，然后是一个5位数字序列，两边都有一个下划线，然后是另一组x个字符。我想把这个5位数代入一个变量。

我对实现这一目标的多种不同方式非常感兴趣。

当前回答

bash解决方案:

IFS="_" read -r x digs x <<<'someletters_12345_moreleters.ext'

这将破坏一个名为x的变量。var x可以被更改为var _。

input='someletters_12345_moreleters.ext'
IFS="_" read -r _ digs _ <<<"$input"

其他回答

这里是纯参数替换，一个空字符串。注意，我只将一些字母和更多字母定义为字符。如果它们是字母数字，这将无法正常工作。

filename=someletters_12345_moreletters.ext
substring=${filename//@(+([a-z])_|_+([a-z]).*)}
echo $substring
12345

试着用cut -c startindex - stopindx

通用解决方案，其中数字可以在文件名中的任何位置，使用这样的序列中的第一个:

number=$(echo $filename | egrep -o '[[:digit:]]{5}' | head -n1)

另一个精确提取变量一部分的解决方案:

number=${filename:offset:length}

如果你的文件名总是使用stuff_digits_…你可以使用awk:

number=$(echo $filename | awk -F _ '{ print $2 }')

还有一种方法可以删除除数字以外的所有内容，使用

number=$(echo $filename | tr -cd '[[:digit:]]')

减少使用:

echo 'someletters_12345_moreleters.ext' | cut -d'_' -f 2

更通用的:

INPUT='someletters_12345_moreleters.ext'
SUBSTRING=$(echo $INPUT| cut -d'_' -f 2)
echo $SUBSTRING

您可以使用参数展开来做到这一点。

如果a为常数，则下面的参数展开执行子字符串提取:

b=${a:12:5}

12是偏移量(从零开始)，5是长度

如果数字周围的下划线是输入中唯一的下划线，您可以分两步分别去掉前缀和后缀:

tmp=${a#*_}   # remove prefix ending in "_"
b=${tmp%_*}   # remove suffix starting with "_"

如果有其他下划线，那么无论如何都可能是可行的，尽管比较棘手。如果有人知道如何在一个表达式中执行两个展开，我也想知道。

提出的两个解决方案都是纯bash，不涉及进程生成，因此非常快。

推荐文章