• 技术文章 >代理ip

    Nutch为什么不能用在分布式爬虫抓取中?

    鸡爪君鸡爪君2021-08-28 16:35:11原创729

    1、Nutch依靠hadoop运行,hadoop本身就会花费大量的时间。

    若集群机数量较少,爬行速度反而不如单机爬虫快。

    2、Nutch是为搜索引擎设计的爬虫,不精确。

    大多数用户需要一个爬虫来爬取准确的数据(提取精确)。在Nutch运行的一整套过程中,三分之二是为搜索引擎设计的,对精选没有多大意义。也就是说,用Nutch做数据抽取,会浪费很多的时间在不必要的计算上。并且,通过二次开发Nutch,使其适用于精选业务,基本上破坏Nutch的框架,使Nutch的脸完全不同,具有修正Nutch的能力,与其自己重写分布式爬虫框架相比。

    3、Nutch可以提供提取功能。

    但开发Nutch插件的人都知道Nutch插件系统有多糟糕。使用反射机制装入和调用插件,使程序的编写和调试变得非常困难,更别提在上面开发一套复杂的精提取系统了。

    4、用Nutch爬虫的编写和调试所需的时间长

    通常是单机爬虫的十倍以上。学习Nutch源代码的成本很高,在调试过程中会出现各种问题,除了程序本身。

    因此,如果你不想做搜索引擎,尽量不要选择Nutch作为爬虫。爬虫需要使用代理IP,能够有效的防止IP被禁止访问的情况。向大家推荐太阳HTTP代理,独享IP池,适合各种爬虫项目。

    (推荐操作系统:windows7系统、Internet Explorer 11,DELL G3电脑。)

    专题推荐:爬虫 换ip http代理
    品易云
    上一篇:IP池具有哪些特征? 下一篇:静态独享IP代理的优势是什么?

    相关文章推荐

    • 笔记本如何查看电脑配置• 如何设置路由器密码• 如何设置路由器不让别人蹭网• 如何设置路由器连接设备的数量• 1

    全部评论我要评论

    © 2021 Python学习网 苏ICP备2021003149号-1

  • 取消发布评论
  • 

    Python学习网