如何搜索多个pdf文件的内容?

如何在目录/子目录中搜索PDF文件的内容?我在找一些命令行工具。grep似乎不能搜索PDF文件。

当前回答

首先将所有pdf文件转换为文本文件:

for file in *.pdf;do pdftotext "$file"; done

然后像往常一样使用grep。这是特别好的，因为当您有多个查询和许多PDF文件时，它是快速的。

2016-01-02 22:07:10

其他回答

Recoll是一个很棒的Unix/Linux全文GUI搜索应用程序，支持几十种不同的格式，包括PDF。它甚至可以将查询的确切页码和搜索词传递给文档查看器，从而允许您直接从它的GUI跳转到结果。

Recoll还提供了一个可行的命令行界面和一个web浏览器界面。

2013-05-29 11:59:04

使用pdfgrep:

pdfgrep -HinR 'FWCOSP' DatenModel/

在这个命令中，我在DatenModel/文件夹中搜索单词FWCOSP。

正如你在输出中看到的，你可以有文件名和行号:

我使用的选项是:

-i : Ignores, case for matching
-H : print the file name for each match
-n : prefix each match with the number of the page where it is found
-R : same as -r, but it also follows all symlinks.

2022-02-17 16:22:29

试着在一个简单的脚本中使用'acroread'，就像上面那样

2011-01-10 09:09:49

我的实际版本的pdfgrep(1.3.0)允许以下:

pdfgrep -HiR 'pattern' /path

当执行pdfgrep——help时:

H:打印每个匹配项的文件名。 i:忽略大小写区别。 R:递归搜索目录。

它在我的Ubuntu上运行得很好。

2014-05-22 04:40:01

还有pdfgrep，它做的正是它的名字所暗示的。

pdfgrep -R 'a pattern to search recursively from path' /some/path

我用它做过简单的搜索，效果很好。

(Debian、Ubuntu和Fedora中都有软件包。)

从1.3.0版本开始，pdfgrep支持递归搜索。这个版本从Ubuntu 12.10 (Quantal)开始在Ubuntu中可用。

2011-03-25 15:42:11

如何搜索多个pdf文件的内容?

推荐文章

最新文章

标签