Advanced Search
Search Results
672 total results found
3.2.1.数据同步
数据同步需要给源头表和目标表选定一个数据源、模式和数据表。如图3-2-1-1所示。字段校对处则需要根据【同名映射】、【同行映射】和【手动连线】三种方式来同步字段数据。如图3-2-1-2所示。新建完成的数据同步保存后,点击【执行】按钮,出现“执行成功”提示,则数据同步成功。在执行的过程中可以点击【取消执行】以及查看执行日志。在执行过程中如点击取消执行,则在日志中会有‘任务已经停止’字样,如图3-2-1-3所示。 同步成功后源头数据源源头表中的数据会根据配置同步到目标数据源中的目标表中。 图3-2-1-1 配置数据同...
3.2.2.批量数据同步
批量数据同步需要给源库和目标库选择数据源类型、数据源以及模式,根据添加的配置规则批量同步数据。 添加规则后,需点击【执行规则】按钮,如图3-2-2-1所示。 根据所添加的规则,会出现相应的选择同步表,如图:3-2-2-2所示。 配置完成的批量数据同步需先点击最下方【提交任务】按钮,保存在相应的项目下,此时提交的任务会在表管理和数据库创建相应的任务并且在页面数据执行结果处显示“创建成功”,如图:3-2-2-3所示。 任务创建成功后,可以点击最下方【批量执行】按钮,对数据进行批量数据同步,数据在批量执行的过程中,可以点...
3.2.3.实时数据同步
3.2.3.1.创建kafka数据源连接 在公共设置-数据源管理右键新建即可 partNum、repeetNum为整形 Bootstrap-servers:kafka地址 用户可自定义参数配置 3.2.3.2.实时数据同步配置 源头数据源默认选择kafka数据源 字段分隔符不能与hive导出表分隔符一致 字段配置:根据json文件的配置,例如使用RWH,则字段配置为:before,RWH 目标数据源为hive 导入前准备语句可自定义编辑 更新频次为秒表示每间隔多少秒,从kafka中读取一次数据 导出的hive...
3.2.4.数据爬虫
打开数据爬虫页面,共有几个区域,分别是资源树、工具栏、代码编辑区、存储配置区以及运行日志区。 资源树区域可以选择已有的数据爬虫资源双击打开进行编辑。 工具栏包括保存、执行、停止执行、清空以及预览5个操作按钮,分别对爬虫脚本执行对应的操作,脚本必须先保存才能执行或预览。 代码编辑区用于编写爬虫代码,需按照python语言规范进行编写。 存储配置主要用于配置爬虫结果数据保存的目标表,需从支持的数据源中选择一个并选择要存数据的数据库,此处可供选择的数据库必须在资源树公共设置-数据源管理下线创建好。选择库中的表后表字段自...
3.3.数据开发
概述
(此页面暂无内容)
3.3.1.作业流
新建作业流是指从左侧节点树拖动节点或双击节点到工作区,根据配置形成一条完整的工作流,通过输入、转换、输出节点对数据随意操作。如图:3-3-1-1所示。 输入节点中的表输入节点选择的是数据源管理中配置的数据源。 图3-3-1-1 作业流配置执行
3.3.2.Sql任务
3.3.2.1.操作入口 在左侧资源目录树下,选中数据开发节点或其子节点新建Sql任务,或是在主界面点击快捷方式新建Sql任务。如图3-3-2-1-1所示: 图3-3-2-1-1 新建sql任务操作入口 3.3.2.2.新建sql任务 新建Sql任务需先选择数据源,在工作区对数据进行操作。Sql任务主要功能:支持使用公共参数、执行、清除、格式化、预览、保存当前版本、hive数据源模式选择(hivesql、sparksql)。 3.3.2.2.1.支持使用公共参数 新建sql任务支持使用公共参数作为过滤条件,如图3...
3.3.3.Spark任务
3.3.3.1.操作入口 在左侧资源目录树下,选中数据开发节点或其子节点新建Spark任务,或是在主界面点击快捷方式新建Spark任务,如图3-3-3-1-1所示: 图3-3-3-1-1 新建spark任务操作入口 3.3.3.2.新建spark任务 新建一个sqark任务,选择一个spark的jar包及其他配置,保存后可供后续使用,如图:3-3-3-2-1所示。 Spark任务配置说明: jar包文件:spark任务依赖jar包 主jar包: spark任务主类所在jar包 运行Class: spark任务主函...
3.3.4.SparkShell开发
3.3.4.1.操作入口 在左侧资源目录树下,选中数据开发节点或其子节点新建SparkShell任务,或是在主界面点击快捷方式新建SparkShell任务,如图3-3-4-1-1所示: 图3-3-4-1-1 新建SparkShell任务操作入口 3.3.4.2.新建SparkShell任务 SparkShell开发可以实现大数据分析过程中的脚本编辑、脚本执行、版本管理、控制台执行结果。支持多种语言,默认是Scala(背后是Spark shell),SparkSql。支持脚本定时调度,支持脚本任务与ETL其他任务混...
3.4.任务管理
概述
(此页面暂无内容)
3.4.1.任务设置
任务表示调度执行的具体内容。任务类型:定制任务、计算元数据、数据预警、SFTP同步任务、工作流任务、作业组任务、数据同步任务、作业流任务、sql任务、spark任务、SparkShell任务。 3.4.1.1.功能入口 在左侧资源目录树下,选中任务节点或是其子目录节点右键选择新建任务,或是在主界面点击快捷方式新建任务,如图:3-4-1-1-1所示。 图3-4-1-1-1 新建任务入口 点击新建任务后,则进入任务定义区域,在任务类型处可选择定制、计算元数据、报表导出、数据预警、页面导出五个类型,如图:3-4-1-1...
3.4.2.数据增量
操作说明: 1)在定制资源下找到创建的任务,点击右键-属性获取此任务的ID; 2)向数据库表x_task_adddata_trigger中插入数据,sql模板为: INSERT INTO x_task_adddata_trigger (c_id,c_task_id,c_task_name) VALUES ('c_id不能重复','替换为任务id','cbw_test'); 3)配置文件可以修改调度时间,不设置时,默认每30s执行一次;扫描触发后的任务c_is_trigger会从非空变为1(0待触发,1已触发),c...
3.4.3.调度计划
计划是指定制执行任务的方式或时间等。一个计划支持调度多项任务。 在调度计划中支持选择定制任务、计算元数据、数据预警、SFTP导出任务、工作流任务、作业组任务、数据同步任务、作业流任务、sql任务、spark任务。新建的调度计划可通过手动执行和任务发布两种方式执行。 3.4.3.1.新建计划 3.4.3.1.1.操作入口 在菜单栏中选择【工具商城】,进入“工具商城”界面。在左侧资源目录树下,选中计划节点或其子目录节点,右键选择新建计划,或是在主界面点击快捷方式新建计划,如图: 新建计划入口 3.4.3.1.2.新建...
3.4.4.公共设置
3.4.4.1.频度 3.4.4.1.1.操作入口 在菜单栏中选择【工具商城】进入主页面后,在左侧资源树形区打开【公共设置】 ,单击【频度】右键菜单中选择【新建频度】,或者在右侧面板中的快捷入口选择新建频度,如图所示: 频度操作入口 3.4.4.1.2.新建频度 新建频度配置窗口介绍,如图所示: 新建频度配置界面 频度方案类型主要包含:一次性、每分、每时、每日、每周、每旬、每月、每季。 一次性:表示计划只执行一次。执行完计划后,计划的启用状态变为停止,即计划的"是否启用"选项的勾选状态变为不勾选。 每分:表示计...
3.4.5.任务发布
在任务管理模块完成任务的执行计划的配置后,该任务并不会开始执行,如果需要启动该计划,则需要将该任务的执行计划发布到产品库才能开始执行。 3.4.5.1.操作入口 操作入口在我的工作台>发布管理模块实现。如图所示。 任务发布操作入口 3.4.5.2.任务发布配置 第一步,点击任务发布选项,会弹出任务发布的配置窗口,如图所示: 任务发布配置窗口 第二步,选择要发布的任务执行计划,单点【选择】按钮,弹出如下选择框,如图所示: 选择任务页面 第三步,在计划配置下选中一个要发布的一个已配置好的任务执行计划,然后点击确定...