c/c++写的爬虫多么?

一段汇编 发布于 2010/03/17 18:00
阅读 3K+
收藏 0

需要一个linux下运行的c写的爬虫,工作模式是命令行的,并且是增量式的,有大侠知道这样的爬虫么?推荐下

感觉larbin只是把网页的连接给镜像了以下,似乎不算真正意义上(我所理解的)的爬虫。。。。

加载中
0
一段汇编

引用来自“红薯”的帖子

都在这呢,看看

http://www.oschina.net/project/tag/64/spider?sort=view&lang=21

 似乎没有合适的,谢谢你的回复

0
大数据专家

从一个专业C++程序猿的角度说,网上流传的各种Java爬虫,Python爬虫,Java需要运行于C++开发的虚拟机上,Python只是脚本语言,采集效率和性能如何能与强大的C++相提并论?C++直接控制系统的底层,对内存空间的控制和节省都是其他语言无法竞争的。首先,forespider的开发语言是C++,而且C++几乎没有现成的框架可以用,而火车采集器是用的C#。先从业界水平和良心来说,这个软件可以做到从底层到上层都是他们的技术人员自己写的,而非运用现成的框架结构。

其次,因为抓取金融行业的数据,数据量大,动态性强,而采集对象一般反爬虫策略又很严格。所以,专门建立团队开发不现实。请外包人员开发太贵。买现成的软件,要考虑性价比。因为很多数据需要登录,需要验证码,是JS生成的数据,是ajax,是https协议,有加密的key,有层层的验证机制等等,分析市面上所有找得到的爬虫软件,没有找到其他一家可以完全把我们列表上的网站采集下来的软件。forespider功能强大,这是很重要的一点。

第三,forespider在台式机上运行一天可以采400万条数据,在服务器上一天可以采8000万条数据。这样一来,数据更新速度明显比以前快了几十倍。从前抓一个7500万的网站需要好几个月,等抓完数据早都变化的不成样子了,这是很多爬虫的痛处。但是现在的更新速度只有两三天。forespider的性能强大,这也是非常好的一点。

第四,其实完全可视化的采集也不需要计算机专业的。大致学习了之后就可以上手采。而且forespider关于数据的管理做的很好。一是软件可以集成数据库,在采集之前就可以建表。二是数据可以自动排重,对于金融这样数据更新要求很高的行业,就特别合适。

第五,是关于免费的问题,我觉得免费的东西同时还能兼顾好用,只能是中国的盗版软件和手机APP。大概是大家都习惯了在软件上不花钱,所以都想找到免费的。forespider有免费版的,功能倒是不限制,但是采集数目每天有限制。

0
Yjiokm
Yjiokm

可以使用c++std::regex, boost::regex来做

0
tecsai
tecsai

有一些开源库,你可以借鉴一下。

DataparkSearch C++ Cross-platform

 

GNU Wget C

Linux

 

等......

0
tecsai
tecsai

http://www.open-open.com/lib/view/open1422112155796.html

返回顶部
顶部