数据源
概述
(此页面暂无内容)
数据库
节点用途:数据库节点用于读取关系数据库中的数据
说明:
- 该节点通过JDBC驱动的方式连接到数据库
- 指定要读取的数据内容:一是通过加载读取出数据库中的所有表,选中目标数据表;二是通过SQL查询进行读取。
前提条件:
- 正确的数据库URL、用户名和密码
- 系统默认包含常见数据库的JDBC驱动,如MySQL、Oracle等
操作步骤:
1.选择配置选项卡,如下图所示:

配置选项卡:
说明:
- 数据源:选择要分析的数据源所在数据库,如果列表中没有可选数据库,选择其他。
- **数据库驱动:**选择数据库的JDBC驱动程序。当数据源为系统自带的常用数据源时,数据库驱动为默认驱动,不可选。当数据源为其他时,可以在下拉框中选择驱动。
- **数据库URL:**输入数据库URL,或者从下拉列表中选择一个历史URL。指定数据源后会自动生成该数据库的URL模板示例,可根据模板示例配置数据库的服务器IP、端口和数据库名称等参数。
- 用户名: 输入登录数据库的用户名。
- 密码: 输入登录数据库的密码。
- **表/SQL查询:**选择指定读取内容方式,两个可选项:表, SQL查询。
- **选择模式:**选择/输入数据库模式, 点击“加载”。
- **表名称:**选择需要读取的数据表。
- **SQL:**输入有效的SQL语句,进行数据读取。
过滤选项卡
过滤选项卡的功能如同过滤节点,用于精简数据表字段,方便过滤字段并配置字段的属性信息。
类型选项卡
类型选项卡的功能如同类型节点,用于指定字段的测量类型、角色以及计算元数据。
- 确定界面配置**,预览**数据
- 右键点击预览也可以预览数据结果
- 右键启用缓存,右键点击执行,执行成功之后,可以在右键的数据库表中查看所有读取的数据信息。
HDFS
**节点用途:**HDFS(Hadoop分布式文件系统)读取节点,用于连接HDFS文件系统,读取HDFS文件系统中的数据。

配置选项卡
说明:
- **文件地址:**输入或列表中选择要访问文件的地址
- **分隔符:**选择读取文件的分隔符。可以同时选择多个分隔符。
操作示例:
工作流中的第一个节点,数据读取,节点配置:
- 右键点击节点,在配置选项卡键入文件地址,勾选对应的分隔符,点击确定
- 右键点击节点,选择执行,
- 右键单击节点,选择预览,可以查看数据表
Hive
**节点用途:**连接Hive数据仓库,并读取Hive中的数据表。
操作步骤:
选择配置选项卡,如下图所示:

配置选项卡
说明:
- **数据库URL:**输入或者列表中选择URL。默认地址仅为URL模板示例,按照模板示例,配置Hive所在服务器IP、端口和数据库的名称。
- **数据库驱动:**选择Hive的JDBC驱动程序。
- **用户名:**输入连接Hive的用户名。
- **密码:**输入连接Hive的密码。:
- **表/SQL查询:**选择指定数据读取内容的方式,有两个可选项:表或者SQL查询。
- **加载数据表:**点击”加载数据表”按钮获取Hive中的所有表名称并加载到左侧表名称的下拉列表中。如果点击加载后,表名称下拉列表仍为空,请检查配置信息是否正确或者数据库中是否有数据表。
- **表名称:**选择需要读取的数据表,在输入框中直接输入表名称可以对下拉框的选项进行模糊筛选。
- **SQL:**输入有效的SQL语句,进行数据读取。
操作示例:
- 节点配置,如上图:
- 确定后,并执行。
将系统自动生成的数据库URL中的
、
和
分别替换为主机名或IP地址、端口和数据库名称,点击加载数据表选择表名称,点击确定即可完成配置。右键单击Hive节点选择预览可以查看数据表
HBase
**节点用途:**连接HBase数据库,并读取HBase中的数据表。
操作步骤:
1.选择配置选项卡,如下图:

配置选项卡
说明:
- **zookeeper.znode.parent:**输入ZooKeeper中的HBase的根ZNode,或者从下拉列表中选择一个历史路径
- **zookeeper端口:**输入zookeeper使用的端口。
- zookeeper集群:输入集群的地址列表,用逗号分割。
- **加载数据表:**点击“加载数据表”按钮,获取Hbase中的所有表,并加载到左侧表名称的下拉列表中。如果点击加载后,表名称下拉列表仍为空,请检查配置信息是否正确或者数据库中是否有数据表。
- **表名称:**选择需要读取的数据表,在输入框中直接输入表名称可以对下拉框的选项进行模糊筛选。
2.选择字段选项卡,如下图:

**字段选项卡:**对从HBase中读取的字段信息进行配置。
说明:
- **按照字符型读取(**默认勾选)
- 勾选此项,则按照String类型从HBase中读取,然后转成指定的字段类型,
- 不勾选此项,则根据下面配置框中用户指定的类型读取。
- **RowKey:**配置RowKey字段的字段类型和字段名。字段类型可选String、Int、Long、Double,默认为String。字段名默认为RowKey,不能输入特殊字符,不能和其他字段重名。
- 字段列表
- 通过右侧的按钮:添加
, 删除
,进行添加或移除字段。 - 列族:用于选择列族字段,下拉列表为从HBase中加载的列族列表,默认选择第一个;
- 列名:用于输入HBase中的列名;
- 字段类型:指定所选字段的输出类型,可选String、Int、Long、Double,默认为String;
- 输出字段名:指定所选字段在输出表中的字段名,默认为列族_列名,可在文本框中进行编辑修改。
SmartDI
**节点用途:**SmartDI节点用于读取数据管理模块配置的数据源或者大数据工具下创建的数据集中的数据,可以实现对数据权限更全面的控制。
前提条件: 需要先在数据管理模块连接好数据源或者在大数据工具下创建好数据集查询
操作步骤:
1.选择配置选项卡,如下图:

配置选项卡
说明:
- **数据源/数据集:**选择使用SmartDI节点读取数据源中的表还是读取已创建的数据集。如果选择数据源,则展示数据源资源树,如果选择数据集,则将展示数据集资源树。从资源树中可以选择要读取的数据。
- **选中数据表:**用于显示在资源树中选定的数据资源的路径。
操作示例:
案例需求:读取数据管理模块下数据源demo中credit数据表,配置如下:

- 选择数据源方式
- 在数据源资源树中找到demo数据库中的credit数据表,选中数据
- 点击右上角预览按钮可以预览数据表,结果如下

- 点击确定关闭配置界面
- 查看数据
- 右键点击预览也可以预览数据结果
- 右键启用缓存然后点击执行,执行成功之后,可以在右键的SmartDI表中查看所有读取的数据信息。
用户输入
节点用途: 用户输入节点用于手动创建一个数据表。
操作方法:
- 直接在单元格中输入数据创建数据表,类似于Excel表,如下图:

- 双击列标题,在弹出的字段属性窗口,配置字段名称、存储类型以及定义该字段的缺失值,缺失值在输出表中用“?“表示,如下图:

配置选项卡
说明:
**列属性窗口:**编辑修改字段名称、选择字段的存储类型,定义该字段的缺失值。
操作示例:
**案例需求:**用户手动创建一个成绩单数据表,登记每个学生的语文、数学、英文成绩。过程如下:
- 在字段属性窗口定义各个字段名称和类型,学生姓名的字段类型为String,各科目成绩的类型为Double;如下图:

- 配置完成后,点击“确定”按钮,表的字段信息就配置完成了。双击单元格可以直接键入数据,如下图:

- 输入完成后点击“确定”按钮,右键启用缓存并执行,便可以在右键菜单中通过用户输入表查看该表结果,如下图:

PMML
**节点用途:**读取已有的PMML格式的模型,通常用于模型的部署应用,比如将训练好的模型导出成PMML格式的文件
说明:
- 该节点输出端口为模型输出端口,可以连接到模型应用节点,如分类预测器节点、类分配器节点、序列预测器节点等。
- 在应用部署的时候,使用该节点读取PMML文件,然后使用模型应用节点(如分类预测器)自动解析模型文件的参数用于后期的预测。
操作步骤:
选择配置选项卡,如下图:

配置选项卡
说明:
- **PMML文件:**选择需要读取的PMML文件
操作示例:
读取已有的PMML格式的决策树模型。节点配置如下:

点击浏览按钮,找到pmml文件,点击确定。右键启用缓存并执行后,在右键单击PMML模型,可以查看模型内容。
