WebMagic是java上面经常的需要的一款爬虫类型的工具了,现在就可以试试最新的0.7.3版本,功能以及使用上面都是完全的免费的,欢迎大家试试!

WebMagic中文版功能
WebMagic是一个简单灵活的Java爬虫框架。基于WebMagic,你可以快速开发出一个高效、易维护的爬虫。webmagic采用完全模块化的设计,功能覆盖整个爬虫的生命周期(链接提取、页面下载、内容抽取、持久化),支持多线程抓取,分布式抓取,并支持自动重试、自定义UA/cookie等功能。
WebMagic0.7.3更新内容
本次更新增加了Downloader模块的一些功能。
#609修复HttpRequestBody没有默认构造函数导致无法反序列化的bug。
#631HttpRequestBody的静态构造函数不再抛出UnsupportedEncodingException受检异常。
#571Page对象增加bytes属性,用于获取二进制数据。下载纯二进制页面时,请设置request.setBinarayContent(true),这样对于二进制内容不会尝试转换为String,减小开销。
#629在HttpUriRequestConverter中会自动对一些导致URI异常的字符进行转移或过滤。
#610自动识别编码时,可以识别Content-Type中charset为大写的情况。
#627支持为Request单独设置页面编码,兼容同一站点多种编码方式的情况。
#613Page对象增加charset属性,其值为request/site中设置的charset,或者为自动检测的charset(未定义时)。
#606升级jsonpath到2.4.0
#608升级jsoup到1.10.3
WebMagic常见问题
(1)由于我这个爬虫的抓取有分页,而且它的分页通过js跳转的,抽取出来感觉有点麻烦,我想直接得到所有的信息,发现可以通过输入url地址请求得到所有的信息(这是网站的一个小问题,它没有设置每页数据记录条数的范围),但是需要登录才可以进行url地址的访问,就要使用cookie模拟登录。拉力竞标赛下载-Rally Championship(拉力竞标赛手游版)1.0.39 正版
(2)下面分析有关登录信息的cookie,我使用的是chrome,点击如图位置,会看到此网站的cookie,(如果已经访问了一段时间了,可以清除所有cookie然后重新登录再访问,否则可能会有很多的cookie,分析起来不方便),由于只有5个cookie,直接加上就可以访问了
展开

换肤收集大师app下载免费领皮肤-换肤收集大师3.1.0 安卓版
氧气瑜伽电视版-氧气瑜伽app1.2.6 安卓正版
有道词典禁止弹窗验证补丁v1.0 绿色免费版
易结网-医界(易结)1.1.0官方安卓版【婚礼】
金城办app下载-金城办app1.4.0 安卓版
家长会ppt模板-小学五年级家长会演示ppt课件免费版【班主任必备】
方块圆形无尽的战争游戏-Square vs Circle The Endless War1.01 安卓版
思优视频转换器绿色免费版下载-思优视频格式转换器1.0.1.0最新专业版
废品回收合同范本合集下载-废品回收合同范本合集3篇绿色免费版
王牌播放器(wplayer)下载-王牌播放器1.0.0.6官方版
行星之谜手游下载-行星之谜游戏1.0.4 最新版
WeChat最新版下载安装-WeChat微信APP8.0.64 国际版
蛋业大亨从零开始的养鸡传奇下载-蛋业大亨从零开始的养鸡传奇小游戏1.3 安卓版
游戏皮肤助手下载-游戏皮肤助手app1.0.1官方安卓版
神爸母婴app下载-神爸母婴1.7.0安卓免费版
压缩软件官方下载-饼干压缩软件1.0.0.1 官方免费版 【2015最高效的压缩工具】
YY漫画APP下载安装官方版-YY漫画下拉式免费阅读软件1.0.0 最新版
RelaxFinger安卓悬浮虚拟按键助手免root版1.1.1 专业清爽版
梦舞遮天2.5.5正式版下载-梦舞遮天2.5.5正式版【隐藏英雄密码】
求生之路2联机工具,求生之路2联机工具下载,增强版求生之路2联机工具-增强版求生之路2联机工具1.1 中文绿色版