关于nutch1.7的url过滤规则,一般都是在regex-urlfilter.txt当中进行配置,当想要进行动态抓取的时候
+[?=&]
我们可能会在配置文件中加入上述一行配置,也正是这一行配置的加入,困扰了自己很长时间。在抓取的过程当中,自己还配置了其他的url正则表达式,如:
+^http://www\.sdioi\.com/nshow\.aspx\?id=\d+$
在抓取的过程,发现总会抓取到不符合该正则表达式的链接,最后,把上面的+[?=&]这一行注释掉之后,功能实现。
应该是只要符合+开头的所有的url,nutch都会抓取回来!很多url都符合+[?=&]这个正则表达式,所以也被抓取回来。

335

被折叠的 条评论
为什么被折叠?



