Advanced Search
Search Results
536 total results found
概述
本系统云ETL web端基于B/S结构。
概述
模型开发 主要包括以下模块:①创建表 ②数据源管理 数据集成 主要包括以下模块:①数据同步 ②批量数据同 ③实时数据同步 ④数据爬虫 数据开发 主要包括以下模块:①作业流 ②SQL任务 ③Spark任务 ④SparlShell任务 任务管理 主要包括以下模块:①任务设置 ②调度计划 ③公共设置 ④任务发布
概述
(此页面暂无内容)
概述
(此页面暂无内容)
3.1.1.创建表
3.1.1.1.功能入口 在左侧资源目录树下,选中表管理节点或其子目录新建数据源,或是在主界面点击快捷方式新建表。如图3-1-1-1-1所示: 图3-1-1-1-1 新建表操作入口 3.1.1.2.新建表 创建表是指在所选数据源类型和数据源内创建一张表,给定指定的字段名称和类型后即可保存在定制资源的项目中使用。如图3-1-1-2-1所示: 图3-1-1-2-1 创建表 点击【查看DDL】按钮,可查看创建表的Sql命令。如图:3-1-1-2-2所示: 图3-1-1-2-2 查看DDL
3.1.2.数据源管理
数据源是指创建业务库和产品应用服务器的连接,拿到数据进行分析。 3.1.2.1.功能入口 在左侧资源目录树下,选中数据源管理节点或其子目录新建数据源,或是在主界面点击快捷方式新建数据源。如图3-1-2-1-1所示: 图3-1-2-1-1 新建数据源 在新建数据源或是打开数据源,可以看到数据源页面,如图3-1-2-1-2的连接信息。 图3-1-2-1-2 新建数据源页面 点击测试连接按钮后如出现【测试连接成功】提示,如图:3-1-2-1-3所示。 则可点击保存按钮保存此数据源在左侧资源目录树>公共设置>数据源管理...
概述
数据同步和批量数据同步相当于把数据从一个数据源拷贝一个完全一样的数据到另一个数据源。所配置的数据源可以是默认的,也可以是创建的自有数据源。新建完成后的数据同步和批量数据同步都会保存在定制资源>项目名称>数据同步下。
3.2.1.数据同步
数据同步需要给源头表和目标表选定一个数据源、模式和数据表。如图3-2-1-1所示。字段校对处则需要根据【同名映射】、【同行映射】和【手动连线】三种方式来同步字段数据。如图3-2-1-2所示。新建完成的数据同步保存后,点击【执行】按钮,出现“执行成功”提示,则数据同步成功。在执行的过程中可以点击【取消执行】以及查看执行日志。在执行过程中如点击取消执行,则在日志中会有‘任务已经停止’字样,如图3-2-1-3所示。 同步成功后源头数据源源头表中的数据会根据配置同步到目标数据源中的目标表中。 图3-2-1-1 配置数据同...
3.2.2.批量数据同步
批量数据同步需要给源库和目标库选择数据源类型、数据源以及模式,根据添加的配置规则批量同步数据。 添加规则后,需点击【执行规则】按钮,如图3-2-2-1所示。 根据所添加的规则,会出现相应的选择同步表,如图:3-2-2-2所示。 配置完成的批量数据同步需先点击最下方【提交任务】按钮,保存在相应的项目下,此时提交的任务会在表管理和数据库创建相应的任务并且在页面数据执行结果处显示“创建成功”,如图:3-2-2-3所示。 任务创建成功后,可以点击最下方【批量执行】按钮,对数据进行批量数据同步,数据在批量执行的过程中,可以点...
3.2.3.实时数据同步
3.2.3.1.创建kafka数据源连接 在公共设置-数据源管理右键新建即可 partNum、repeetNum为整形 Bootstrap-servers:kafka地址 用户可自定义参数配置 3.2.3.2.实时数据同步配置 源头数据源默认选择kafka数据源 字段分隔符不能与hive导出表分隔符一致 字段配置:根据json文件的配置,例如使用RWH,则字段配置为:before,RWH 目标数据源为hive 导入前准备语句可自定义编辑 更新频次为秒表示每间隔多少秒,从kafka中读取一次数据 导出的hive...
3.2.4.数据爬虫
打开数据爬虫页面,共有几个区域,分别是资源树、工具栏、代码编辑区、存储配置区以及运行日志区。 资源树区域可以选择已有的数据爬虫资源双击打开进行编辑。 工具栏包括保存、执行、停止执行、清空以及预览5个操作按钮,分别对爬虫脚本执行对应的操作,脚本必须先保存才能执行或预览。 代码编辑区用于编写爬虫代码,需按照python语言规范进行编写。 存储配置主要用于配置爬虫结果数据保存的目标表,需从支持的数据源中选择一个并选择要存数据的数据库,此处可供选择的数据库必须在资源树公共设置-数据源管理下线创建好。选择库中的表后表字段自...
概述
(此页面暂无内容)
3.3.1.作业流
新建作业流是指从左侧节点树拖动节点或双击节点到工作区,根据配置形成一条完整的工作流,通过输入、转换、输出节点对数据随意操作。如图:3-3-1-1所示。 输入节点中的表输入节点选择的是数据源管理中配置的数据源。 图3-3-1-1 作业流配置执行
3.3.2.Sql任务
3.3.2.1.操作入口 在左侧资源目录树下,选中数据开发节点或其子节点新建Sql任务,或是在主界面点击快捷方式新建Sql任务。如图3-3-2-1-1所示: 图3-3-2-1-1 新建sql任务操作入口 3.3.2.2.新建sql任务 新建Sql任务需先选择数据源,在工作区对数据进行操作。Sql任务主要功能:支持使用公共参数、执行、清除、格式化、预览、保存当前版本、hive数据源模式选择(hivesql、sparksql)。 3.3.2.2.1.支持使用公共参数 新建sql任务支持使用公共参数作为过滤条件,如图3...
3.3.3.Spark任务
3.3.3.1.操作入口 在左侧资源目录树下,选中数据开发节点或其子节点新建Spark任务,或是在主界面点击快捷方式新建Spark任务,如图3-3-3-1-1所示: 图3-3-3-1-1 新建spark任务操作入口 3.3.3.2.新建spark任务 新建一个sqark任务,选择一个spark的jar包及其他配置,保存后可供后续使用,如图:3-3-3-2-1所示。 Spark任务配置说明: jar包文件:spark任务依赖jar包 主jar包: spark任务主类所在jar包 运行Class: spark任务主函...
3.3.4.SparkShell开发
3.3.4.1.操作入口 在左侧资源目录树下,选中数据开发节点或其子节点新建SparkShell任务,或是在主界面点击快捷方式新建SparkShell任务,如图3-3-4-1-1所示: 图3-3-4-1-1 新建SparkShell任务操作入口 3.3.4.2.新建SparkShell任务 SparkShell开发可以实现大数据分析过程中的脚本编辑、脚本执行、版本管理、控制台执行结果。支持多种语言,默认是Scala(背后是Spark shell),SparkSql。支持脚本定时调度,支持脚本任务与ETL其他任务混...
概述
(此页面暂无内容)
3.4.1.任务设置
任务表示调度执行的具体内容。任务类型:定制任务、计算元数据、数据预警、SFTP同步任务、工作流任务、作业组任务、数据同步任务、作业流任务、sql任务、spark任务、SparkShell任务。 3.4.1.1.功能入口 在左侧资源目录树下,选中任务节点或是其子目录节点右键选择新建任务,或是在主界面点击快捷方式新建任务,如图:3-4-1-1-1所示。 图3-4-1-1-1 新建任务入口 点击新建任务后,则进入任务定义区域,在任务类型处可选择定制、计算元数据、报表导出、数据预警、页面导出五个类型,如图:3-4-1-1...