我们公司有成千上万的PDF文档。如何使用Lucene、Solr或Nutch创建一个简单的搜索引擎?我们将提供一个基本的Java/JSP网页,人们可以在其中键入单词并执行基本和/或查询,然后向他们显示所有匹配PDF的文档链接。
发布于 2008-12-17 02:39:03
Lucene家族中没有一个项目可以原生处理PDF,但是有一些实用程序可以让您随意使用,还有一些写得很好的例子可以告诉您如何滚动自己的PDF文件。
Lucene会做你需要它做的任何事情,但就你的时间而言,正如Tony上面所说的那样,这是有开销的。数千个文档真的不是很多,所以您也许能够使用一个更轻量级的替代方案。
也就是说,我仍然推荐使用Solr -它比Lucene更容易设置,支持备份、复制等,还有一个非常适合您的用例的漂亮的JSON接口:http://wiki.apache.org/solr/SolJSON
发布于 2008-10-21 22:06:44
我用lucene很幸运,但它不是点击,安装和搜索,它确实需要一些工作。
如果你需要一些你可以在10分钟内下载和安装并进行搜索的东西,看看免费的Ominifind雅虎版http://omnifind.ibm.yahoo.net/,它使用Lucene,但经过打包,它已经配置好,可以在安装时运行,这是一种更简单的尝试Lucene的方式。
发布于 2009-06-12 18:22:52
在Nutch中启用Nutch + Lucene + Pdf插件就是您的解决方案。Nutch允许您通过启用pdf插件来解析pdf。
Lucene将允许您索引爬行和解析的数据,而Nutch具有servelet,它为您提供了一个搜索界面。
我们在内部lans中也使用相同的方法。
https://stackoverflow.com/questions/223536
复制相似问题