nutch二次开发环境搭建

首页 > 代码库 > nutch二次开发环境搭建

2024-10-19 19:47:39 212人阅读

开发环境: ubuntu14.04 + jdk1.7 + eclispe +nutch1.7

1:解压下好nutch1.7 src 源码(wget http://archive.apache.org/dist/nutch/1.7/apache-nutch-1.7-src.tar.gz)

2:新建一个java project 后导入(我将nutch1.7 源码解压在/home/hadoop/nutch1.7-src)

技术分享

２:编辑 conf/nutch-site.xml 文件添加如下

<property>　　　　<name>http.agent.name</name>　　　　<value>mynutch spider</value>　　</property>

３：在conf文件下的regex-urlfilter.txt　文件将＋. 注释掉新增"+^http://(\.*)*"　如下

#+."+^http://(\.*)*"

４：运行抓取数据测试：org.apache.nutch.crawl.Crawl　

技术分享

运行结果：

rootUrlDir = urls
threads = 5
depth = 5
solrUrl=null
topN = 100
Injector: starting at 2014-12-31 15:33:09
Injector: crawlDb: crawl/crawldb
Injector: urlDir: urls
Injector: Converting injected urls to crawl db entries

如果是在win7 下搭建环境可以参考这篇文章：http://www.cnblogs.com/xia520pi/p/3695617.html

nutch二次开发环境搭建

声明：以上内容来自用户投稿及互联网公开渠道收集整理发布，本网站不拥有所有权，未作人工编辑处理，也不承担相关法律责任，若内容有误或涉及侵权可进行投诉：投诉/举报工作人员会在5个工作日内联系你，一经查实，本站将立刻删除涉嫌侵权内容。

联系
我们

首页 > 代码库 > nutch二次开发环境搭建

nutch二次开发环境搭建

看完仍有疑问？有类似问题直接问程序猿