如何从另一个文件A中删除文件B中出现的行?

我有一个很大的文件a(由电子邮件组成)，每封邮件一行。我还有另一个文件B，其中包含另一组邮件。

我将使用哪个命令从文件A中删除文件B中出现的所有地址。

因此，如果文件A包含:

A
B
C

文件B包含:

B    
D
E

那么文件A应该剩下:

A
C

现在我知道这是一个可能经常被问到的问题，但我只在网上找到一个命令，它给我一个错误的分隔符。

任何帮助都将不胜感激!肯定有人会想出一个聪明的俏皮话，但我不是shell专家。

当前回答

grep -Fvxf <删除行> <所有行>

适用于未排序的文件(与comm不同) 维护秩序是POSIX

例子:

cat <<EOF > A
b
1
a
0
01
b
1
EOF

cat <<EOF > B
0
1
EOF

grep -Fvxf B A

输出:

b
a
01
b

解释:

-F:使用文字字符串而不是默认的BRE -x:只考虑匹配整行的匹配 -v:打印不匹配 -f file:从给定文件中获取模式

这种方法在预排序文件上比其他方法慢，因为它更通用。如果速度也很重要，请参阅:查找一个文件中不在另一个文件中的行的快速方法?

下面是一个用于内联操作的快速bash自动化:

remove-lines() (
  remove_lines="$1"
  all_lines="$2"
  tmp_file="$(mktemp)"
  grep -Fvxf "$remove_lines" "$all_lines" > "$tmp_file"
  mv "$tmp_file" "$all_lines"
)

GitHub上游。

用法:

remove-lines lines-to-remove remove-from-this-file

参见:https://unix.stackexchange.com/questions/28158/is-there-a-tool-to-get-the-lines-in-one-file-that-are-not-in-another

2015-08-28 09:37:52

其他回答

如果文件已经排序(在你的例子中):

comm -23 file1 file2

-23抑制两个文件中的行，或仅在文件2中。如果文件没有排序，那么首先将它们通过sort管道…

点击这里查看手册页

2010-12-06 12:53:24

另一种方法来做同样的事情(也需要排序输入):

join -v 1 fileA fileB

在Bash中，如果文件没有预先排序:

join -v 1 <(sort fileA) <(sort fileB)

2010-12-06 16:37:44

对于非常大的文件，@karakfa的答案的改进可能会明显更快。与这个答案一样，两个文件都不需要排序，但是由于awk的关联数组，速度得到了保证。只有查找文件保存在内存中。

这个公式还允许在比较中只使用输入文件中的一个特定字段($N)。

# Print lines in the input unless the value in column $N
# appears in a lookup file, $LOOKUP;
# if $N is 0, then the entire line is used for comparison.

awk -v N=$N -v lookup="$LOOKUP" '
  BEGIN { while ( getline < lookup ) { dictionary[$0]=$0 } }
  !($N in dictionary) {print}'

(这种方法的另一个优点是很容易修改比较标准，例如，修剪开头和结尾的空白。)

2015-12-29 05:26:52

grep -Fvxf <删除行> <所有行>

适用于未排序的文件(与comm不同) 维护秩序是POSIX

例子:

cat <<EOF > A
b
1
a
0
01
b
1
EOF

cat <<EOF > B
0
1
EOF

grep -Fvxf B A

输出:

b
a
01
b

解释:

-F:使用文字字符串而不是默认的BRE -x:只考虑匹配整行的匹配 -v:打印不匹配 -f file:从给定文件中获取模式

这种方法在预排序文件上比其他方法慢，因为它更通用。如果速度也很重要，请参阅:查找一个文件中不在另一个文件中的行的快速方法?

下面是一个用于内联操作的快速bash自动化:

remove-lines() (
  remove_lines="$1"
  all_lines="$2"
  tmp_file="$(mktemp)"
  grep -Fvxf "$remove_lines" "$all_lines" > "$tmp_file"
  mv "$tmp_file" "$all_lines"
)

GitHub上游。

用法:

remove-lines lines-to-remove remove-from-this-file

参见:https://unix.stackexchange.com/questions/28158/is-there-a-tool-to-get-the-lines-in-one-file-that-are-not-in-another

2015-08-28 09:37:52

删除出现在另一个文件上的行后获取该文件

comm -23 <(sort bigFile.txt) <(sort smallfile.txt) > diff.txt . com

2021-05-11 01:42:44

如何从另一个文件A中删除文件B中出现的行?

推荐文章

最新文章

标签