PiFlow是一个基于分布式计算框架Spark开发的大数据流水线系统。该系统将数据的采集、清洗、计算、存储等各个环节封装成组件,以所见即所得方式进行流水线配置。简单易用,功能强大。本次版本更新如下特性:
Gitee地址: https://gitee.com/opensci/piflow GitHub地址: https://github.com/cas-bigdatalab/piflow
1)可视化分析
2)可编程+多语言
3)Spark jar包管理
评论删除后,数据将无法恢复
开源大数据流水线系统 PiFlow V0.9 发布
PiFlow是一个基于分布式计算框架Spark开发的大数据流水线系统。该系统将数据的采集、清洗、计算、存储等各个环节封装成组件,以所见即所得方式进行流水线配置。简单易用,功能强大。本次版本更新如下特性:
Gitee地址: https://gitee.com/opensci/piflow
GitHub地址: https://github.com/cas-bigdatalab/piflow
1)可视化分析
2)可编程+多语言
3)Spark jar包管理