WebMagic 0.7.3 版本发布,Java 爬虫框架 - 开源中国社区
WebMagic 0.7.3 版本发布,Java 爬虫框架
黄亿华 2017年07月31日

WebMagic 0.7.3 版本发布,Java 爬虫框架

黄亿华 黄亿华 发布于2017年07月31日 收藏 69

【腾讯云】如何快速搭建微信小程序?>>>  

WebMagic是一个简单灵活的Java爬虫框架。基于WebMagic,你可以快速开发出一个高效、易维护的爬虫。

本次更新增加了Downloader模块的一些功能。

  • #609 修复HttpRequestBody没有默认构造函数导致无法反序列化的bug。

  • #631 HttpRequestBody的静态构造函数不再抛出UnsupportedEncodingException受检异常。

  • #571 Page对象增加bytes属性,用于获取二进制数据。下载纯二进制页面时,请设置request.setBinarayContent(true),这样对于二进制内容不会尝试转换为String,减小开销。

  • #629 在HttpUriRequestConverter中会自动对一些导致URI异常的字符进行转移或过滤。

  • #610 自动识别编码时,可以识别Content-Type中charset为大写的情况。

  • #627 支持为Request单独设置页面编码,兼容同一站点多种编码方式的情况。

  • #613 Page对象增加charset属性,其值为request/site中设置的charset,或者为自动检测的charset(未定义时)。

  • #606 升级jsonpath到2.4.0

  • #608 升级jsoup到1.10.3

本站文章除注明转载外,均为本站原创或编译。欢迎任何形式的转载,但请务必注明出处,尊重他人劳动共创开源社区。
转载请注明:文章转载自 开源中国社区 [http://www.oschina.net]
本文标题:WebMagic 0.7.3 版本发布,Java 爬虫框架
分享
评论(6)
最新评论
0
很棒
0
给力!
0
++++
0
不错啊
0
又更新了,支持下,用了这么多爬虫,感觉您的这个最顺手。
0
好东西,以前用的时候感觉设计的特别好,学习到很多,感谢大神的分享
顶部