我完全是一个初学者,现在正在尝试实现一个简单的search engine in python。
我用NLTK中的函数把tokenizer做得很好。但是我现在对存储记号赋予器的结果感到困惑。我需要保留它们以供进一步索引。
执行此操作的常用方法是什么?我应该使用哪种数据库?
发布于 2012-10-08 22:27:00
曼宁、Raghavan和Schütze的专门用了几章来介绍索引构建和存储;Baeza-Yates和Ribeiro-Neto的也是如此。
但是,对于一个简单的业余爱好/学习项目,SQLite将足以用于索引存储。您需要一个包含(term,document-id,frequency)三元组的表来计算tf,另一个表存储(term,df)对,这两个表都有一个术语索引;这足以计算tf-idf。
https://stackoverflow.com/questions/12783582
复制相似问题