敏捷挖掘节点手册
- 数据源
- 数据准备
- 概述
- Java代码段
- Java选择器
- 自定义算法
- 名义值过滤
- 抽样
- 汇总
- 排序
- 分区
- 合并
- 追加
- 选择
- 转置
- 参考行过滤
- 设为标志
- 重新结构化
- 时间选择
- 自定义选择
- 去重
- 提取字段名
- 插入字段名
- 平衡
- RMF汇总
- 类型
- 过滤
- 分列
- 类型转换
- 缺失填充
- 参考列过滤
- 填充
- 自定义填充
- 组合
- 近似处理
- 标准化
- 延迟
- 字段重排
- RFM分级
- 分箱
- 日期时间提取
- 时间偏移
- 时间差
- 时间区间
- 派生
- 2.43 重新编码
- 2.44 大小写转换
- 2.26 序列缺失填充
- 可视化探索
- 统计学习
- 机器学习
- 文本挖掘
- 社会网络
- SmartR
- 数据导出
数据源
概述
(此页面暂无内容)
数据库
节点用途:数据库节点用于读取关系数据库中的数据
说明:
- 该节点通过JDBC驱动的方式连接到数据库
- 指定要读取的数据内容:一是通过加载读取出数据库中的所有表,选中目标数据表;二是通过SQL查询进行读取。
前提条件:
- 正确的数据库URL、用户名和密码
- 系统默认包含常见数据库的JDBC驱动,如MySQL、Oracle等
操作步骤:
1.选择配置选项卡,如下图所示:

配置选项卡:
说明:
- 数据源:选择要分析的数据源所在数据库,如果列表中没有可选数据库,选择其他。
- **数据库驱动:**选择数据库的JDBC驱动程序。当数据源为系统自带的常用数据源时,数据库驱动为默认驱动,不可选。当数据源为其他时,可以在下拉框中选择驱动。
- **数据库URL:**输入数据库URL,或者从下拉列表中选择一个历史URL。指定数据源后会自动生成该数据库的URL模板示例,可根据模板示例配置数据库的服务器IP、端口和数据库名称等参数。
- 用户名: 输入登录数据库的用户名。
- 密码: 输入登录数据库的密码。
- **表/SQL查询:**选择指定读取内容方式,两个可选项:表, SQL查询。
- **选择模式:**选择/输入数据库模式, 点击“加载”。
- **表名称:**选择需要读取的数据表。
- **SQL:**输入有效的SQL语句,进行数据读取。
过滤选项卡
过滤选项卡的功能如同过滤节点,用于精简数据表字段,方便过滤字段并配置字段的属性信息。
类型选项卡
类型选项卡的功能如同类型节点,用于指定字段的测量类型、角色以及计算元数据。
- 确定界面配置**,预览**数据
- 右键点击预览也可以预览数据结果
- 右键启用缓存,右键点击执行,执行成功之后,可以在右键的数据库表中查看所有读取的数据信息。
HDFS
**节点用途:**HDFS(Hadoop分布式文件系统)读取节点,用于连接HDFS文件系统,读取HDFS文件系统中的数据。

配置选项卡
说明:
- **文件地址:**输入或列表中选择要访问文件的地址
- **分隔符:**选择读取文件的分隔符。可以同时选择多个分隔符。
操作示例:
工作流中的第一个节点,数据读取,节点配置:
- 右键点击节点,在配置选项卡键入文件地址,勾选对应的分隔符,点击确定
- 右键点击节点,选择执行,
- 右键单击节点,选择预览,可以查看数据表
Hive
**节点用途:**连接Hive数据仓库,并读取Hive中的数据表。
操作步骤:
选择配置选项卡,如下图所示:

配置选项卡
说明:
- **数据库URL:**输入或者列表中选择URL。默认地址仅为URL模板示例,按照模板示例,配置Hive所在服务器IP、端口和数据库的名称。
- **数据库驱动:**选择Hive的JDBC驱动程序。
- **用户名:**输入连接Hive的用户名。
- **密码:**输入连接Hive的密码。:
- **表/SQL查询:**选择指定数据读取内容的方式,有两个可选项:表或者SQL查询。
- **加载数据表:**点击”加载数据表”按钮获取Hive中的所有表名称并加载到左侧表名称的下拉列表中。如果点击加载后,表名称下拉列表仍为空,请检查配置信息是否正确或者数据库中是否有数据表。
- **表名称:**选择需要读取的数据表,在输入框中直接输入表名称可以对下拉框的选项进行模糊筛选。
- **SQL:**输入有效的SQL语句,进行数据读取。
操作示例:
- 节点配置,如上图:
- 确定后,并执行。
将系统自动生成的数据库URL中的
、
和
分别替换为主机名或IP地址、端口和数据库名称,点击加载数据表选择表名称,点击确定即可完成配置。右键单击Hive节点选择预览可以查看数据表
HBase
**节点用途:**连接HBase数据库,并读取HBase中的数据表。
操作步骤:
1.选择配置选项卡,如下图:

配置选项卡
说明:
- **zookeeper.znode.parent:**输入ZooKeeper中的HBase的根ZNode,或者从下拉列表中选择一个历史路径
- **zookeeper端口:**输入zookeeper使用的端口。
- zookeeper集群:输入集群的地址列表,用逗号分割。
- **加载数据表:**点击“加载数据表”按钮,获取Hbase中的所有表,并加载到左侧表名称的下拉列表中。如果点击加载后,表名称下拉列表仍为空,请检查配置信息是否正确或者数据库中是否有数据表。
- **表名称:**选择需要读取的数据表,在输入框中直接输入表名称可以对下拉框的选项进行模糊筛选。
2.选择字段选项卡,如下图:

**字段选项卡:**对从HBase中读取的字段信息进行配置。
说明:
- **按照字符型读取(**默认勾选)
- 勾选此项,则按照String类型从HBase中读取,然后转成指定的字段类型,
- 不勾选此项,则根据下面配置框中用户指定的类型读取。
- **RowKey:**配置RowKey字段的字段类型和字段名。字段类型可选String、Int、Long、Double,默认为String。字段名默认为RowKey,不能输入特殊字符,不能和其他字段重名。
- 字段列表
- 通过右侧的按钮:添加
, 删除
,进行添加或移除字段。 - 列族:用于选择列族字段,下拉列表为从HBase中加载的列族列表,默认选择第一个;
- 列名:用于输入HBase中的列名;
- 字段类型:指定所选字段的输出类型,可选String、Int、Long、Double,默认为String;
- 输出字段名:指定所选字段在输出表中的字段名,默认为列族_列名,可在文本框中进行编辑修改。
SmartDI
**节点用途:**SmartDI节点用于读取数据管理模块配置的数据源或者大数据工具下创建的数据集中的数据,可以实现对数据权限更全面的控制。
前提条件: 需要先在数据管理模块连接好数据源或者在大数据工具下创建好数据集查询
操作步骤:
1.选择配置选项卡,如下图:

配置选项卡
说明:
- **数据源/数据集:**选择使用SmartDI节点读取数据源中的表还是读取已创建的数据集。如果选择数据源,则展示数据源资源树,如果选择数据集,则将展示数据集资源树。从资源树中可以选择要读取的数据。
- **选中数据表:**用于显示在资源树中选定的数据资源的路径。
操作示例:
案例需求:读取数据管理模块下数据源demo中credit数据表,配置如下:

- 选择数据源方式
- 在数据源资源树中找到demo数据库中的credit数据表,选中数据
- 点击右上角预览按钮可以预览数据表,结果如下

- 点击确定关闭配置界面
- 查看数据
- 右键点击预览也可以预览数据结果
- 右键启用缓存然后点击执行,执行成功之后,可以在右键的SmartDI表中查看所有读取的数据信息。
用户输入
节点用途: 用户输入节点用于手动创建一个数据表。
操作方法:
- 直接在单元格中输入数据创建数据表,类似于Excel表,如下图:

- 双击列标题,在弹出的字段属性窗口,配置字段名称、存储类型以及定义该字段的缺失值,缺失值在输出表中用“?“表示,如下图:

配置选项卡
说明:
**列属性窗口:**编辑修改字段名称、选择字段的存储类型,定义该字段的缺失值。
操作示例:
**案例需求:**用户手动创建一个成绩单数据表,登记每个学生的语文、数学、英文成绩。过程如下:
- 在字段属性窗口定义各个字段名称和类型,学生姓名的字段类型为String,各科目成绩的类型为Double;如下图:

- 配置完成后,点击“确定”按钮,表的字段信息就配置完成了。双击单元格可以直接键入数据,如下图:

- 输入完成后点击“确定”按钮,右键启用缓存并执行,便可以在右键菜单中通过用户输入表查看该表结果,如下图:

PMML
**节点用途:**读取已有的PMML格式的模型,通常用于模型的部署应用,比如将训练好的模型导出成PMML格式的文件
说明:
- 该节点输出端口为模型输出端口,可以连接到模型应用节点,如分类预测器节点、类分配器节点、序列预测器节点等。
- 在应用部署的时候,使用该节点读取PMML文件,然后使用模型应用节点(如分类预测器)自动解析模型文件的参数用于后期的预测。
操作步骤:
选择配置选项卡,如下图:

配置选项卡
说明:
- **PMML文件:**选择需要读取的PMML文件
操作示例:
读取已有的PMML格式的决策树模型。节点配置如下:

点击浏览按钮,找到pmml文件,点击确定。右键启用缓存并执行后,在右键单击PMML模型,可以查看模型内容。

数据准备
概述
(此页面暂无内容)
Java代码段
(此页面暂无内容)
Java选择器
(此页面暂无内容)
自定义算法
(此页面暂无内容)
名义值过滤
**节点用途:**筛选目标字段的取值等于选择的一个或者多个名义值的记录。
说明: 该节点只适用于测量类型为分类型的字段,配置过程中需使用元数据
前提条件:选取的目标字段的类型为分类型字段
操作步骤:
选择配置选项卡,如下图:

配置选项卡
说明:
- **选择字段:**选择作为过滤条件的字段,可选字段为测量类型为名义型、标志型、有序型的字段,默认选择最后一个。
- **选择名义值:**选择要输出的名义值列表。选中一个字段后,左侧的可用名义值列表会从元数据获取该字段的所有名义值,可以通过”添加”和”移除”按钮将要输出的名义值选择到右侧,选中字段的取值不在已选名义值列表中的记录将从数据集中删除。
操作示例:
示例工作流中的统计案例用到了这一功能,原始数据如下:
员工基础信息表:

使用名义值过滤节点,过滤出所有工作类型为“State-gov”的记录,配置如下:

执行后,数据转换为,工作类型是“State-gov”的数据,如下图:

抽样
节点用途: 从输入数据中抽取一个样本
**操作方法:**在配置对话框中可以指定抽样方法

定义抽取样本量
选取抽样方式
配置选项卡
说明:
- **定义样本数量:**设定本次抽样所需样本数量,有以下两种方式
- 样本量**:**指定本次抽样所需样本数量
- 样本比例:按照总样本的一定比例抽取样本
- **抽样方式:**抽样的方法有很多种,常用的有下几种方法:
- **前n个:**抽取前n条记录作为样本。如果现有的行数比指定的数小,则使用所有行。
- **等距抽样:**先将总体按照一定顺序排列,采用简单随机抽样,抽取第一个样本 (或称为随机起点),再顺序抽取其余的样本
- **简单随机:**指定样本量占总记录数的百分比。该值必须处在1到100之间
- **分层抽样:**是从一个可以分成不同子总体(或称为层)的总体中,按规定的比例从不同层中随机抽取样本的方法
- **等量抽样:**此方法总是包含第一和最后的行,对于剩余的记录,每隔一定间隔抽取一条记录,例如每隔三行。
- **固定随机数种子:**如果希望每次执行的结果不变,只需要勾选随机数种子即可。如果不勾选,每次执行会使用一个新的随机种子,多次执行的结果可能有所不同。
操作示例:
案例:员工基础信息表,含有总样本32,561条记录,现在按照员工性别,分层抽样,抽取10%的样本。
- 配置节点,如下:

- 执行后,右键点击本节点,会有两个输出表,一个是样本表(按指定规则抽取的样本,3,257条数据),一个是过滤表(总样本-抽取样本, 29,304条数据)。

汇总
节点用途:基于选中字段的唯一值对表中的行进行分组计算,生成汇总表。
说明:
- 汇总表的行,是由组合选项卡中每个选中字段的唯一值确定的,每一行是由组合选项卡中每个选中字段的唯一值确定的分组。
- 每个分组的汇总值基于聚合选项卡中指定的字段及定义的方法进行聚合得到。
操作方法:
- 在配置对话框中可以指定汇总方式,如下图:


配置选项卡
说明:
- **分组选项卡:**可以选择一个或者多个字段作为分组字段。根据每个选中字段的唯一值确 定分组,一个分组作为生成汇总表的一条记录。只支持“整型”或者“字符型”字段。
- 汇总选项卡:可以选择一个或多个字段基于分组进行汇总计算。可以在高级设置中批量设定各类型字段的汇总方法,然后添加到汇总表中;也先添加的目标字段,单独指定汇总方法。
汇总方式:
- 高级设置,为各类型字段进行批量定义汇总方法,在各类型字段对应的汇总方式列表中,勾选所需要的汇总方法(可多选)。
- **汇总方法:**单独为所选变量指定汇总方法,如下图位置中设定:

单独设定
- 执行后输出汇总表
汇总表展示汇总结果,但是为了能清晰看到汇总结果,建议对汇总结果的分组变量进行排序。
操作示例 如下:
案例:对员工基础信息表进行汇总,汇总方式为:按照教育程度,国籍,进行分组后,按照列表汇总收入,按照总和,平均值汇总每周工时。
- 配置节点,如下图:


- 启用缓存,执行后,生成的**汇总表,**如下图:

排序
节点用途: 按照用户指定字段,对数据进行升序或者降序排列。
操作方法:
- 在配置对话框中可以指定汇总方式,如下图

配置选项卡
说明:
- **主要关键字:**选择一个字段作为第一排序关键字
- **添加条件:**添加新的字段,作为后续排序关键字
- **删除条件:**删除不需要的排序字段
- **上移/下移:**重新定义要排序的关键字的次序
- **排序方式:**按照升序或者降序对关键字进行排序
- 执行后,输出排序表
操作示例如下:
案例:对员工基础信息表进行排序,方式为:按照国籍降序,教育程度升序对数据排序
- 配置节点,如下图:

- 启动缓存,执行后,生成的排序表如下:
可以看到,国籍按照字段降序,教育程度按照升序进行排序的数据。

分区
节点用途: 将数据表随机分为训练集和测试集,训练集用于生成模型,测试集用于测试已经生成的模型。可以预判此模型对新数据的拟合优劣。
说明:
- 分区节点会生成一个名义字段,其角色默认设置为分区
- 如果数据中已经存在相应的字段,可以使用”类型”节点将其角色指定为分区
- 一个工作流中只能定义一个分区字段, 且一旦有了分区字段,则默认启用分区功能。
- 如果想禁用分区功能,只需要在类型节点中分区字段的角色改为无即可。
操作方法 如下:

配置选项卡
说明:
- **分区字段:**定义作为分区字段而新生成的字段名
- **训练分区大小:**指定训练样本占总样本的比例,该值必须是0到100之间的,默认训练占 80%的比例。
- **测试分区大小:**指定测试样本占总样本的比例,该值必须是0到100之间的,默认为测试占20%的比例。
- 训练分区大小和测试分区大小的和必须等于100。
- **固定随机数种子:**如果希望每次执行的结果不变,只需要勾选随机数种子即可。如果不勾选,每次执行会使用一个新的随机种子,多次执行的结果可能有所不同。
操作示例 如下:
通过配置选项卡,数据表得到新变量“分区”,将数据表随机分为训练数据和测试数据,执行后,右键查看分区表,训练集如下:

合并
**节点用途:**将两个或多个数据表,合并到一张数据表中,使生成的数据包含更多字段信息。当您要合并来源不同的数据(如客户基本信息和客户消费信息)时,此操作非常有用。有以下两种合并数据的方式:
说明:
- 按**顺序合并:**会按照输入的顺序连接来自所有源的相应记录,直到穷尽最小的数据源。如果使用此选项,务必确保两个表中的记录是按照位置索引一一对应的。这种合并方式就像将Excel一个工作表中的几列直接复制粘贴到另外一个工作表中一样,按照行的序号一一对应。
- 关键字段合并(如客户编码),使用此方法指定如何将来自一个数据源的记录与来自其他数据源的记录相匹配。连接的类型有许多,其中包括内部连接、左连接、右连接和全部外连接。
操作方法如下:
配置节点,如下图:

输入选项卡:
说明:
- 显示需要合并的数据表,以及每个表中所含有的字段数
- 上移/下移,调整数据合并过程中的次序,默认最上面一行显示的数据表为主数据表

配置选项卡:
说明:
- 合并方式:按照顺序或者关键字段
- 如果选择关键字合并,那么需要选择列表中字段作为关键字段
- 仅包含匹配的记录(内部链接)
- 包含匹配和不匹配的记录(完全外部链接)
- 包含匹配记录和第一个输入表的不匹配记录(左链接)
数据链接案例解释:
要合并第一个数据表(语文成绩表)和第二个数据表(数学成绩表)。
输入表:
语文成绩表: id 姓名 语文成绩
001 张三 85
002 李四 70
数学成绩表:id 姓名 数学成绩
001 张三 90
003 王二 80
内链接合并后:id 姓名 语文成绩 数学成绩
新表: 001 张三 85 90
外部链接合并后:id 姓名 语文成绩 数学成绩
新表: 001 张三 85 90
002 李四 70 -
003 王二 - 70
左链接合并后:id 姓名 语文成绩 数学成绩
新表: 001 张三 85 90
002 李四 70 -
过滤选项卡:
该选项卡的功能是过滤左表和右表中,对于建模分析不需要的字段。通过点击“过滤”列的 ,合并后的表,将不再输出不需要的字段。

操作示例 如下:
案例: 合并学生的语文成绩表和数学成绩表。输入表如下图,合并为一个表


通过配置该节点,选择“关键字”合并,选择好关键字字段以后,点击“左链接”。确认后查看合并表
追加
节点用途: 用于将多个表追加到一张表中
说明:
- 一次最多可以追加多个表。自上而下,第一个链接的表为主数据表
- 该节点通过识别连接的输入表的字段名进行识别,会将字段名相同的列追加到一起。字段名不相同的列可以保留也可以剔除,在配置窗口中可以指定。
操作方法如下:
输入选项卡:
说明:
- 显示需要追加的数据表,以及每个表中所含有的字段数
- 上移/下移,调整数据追加过程中的次序,默认最上面一行显示的数据表为主数据表
配置选项卡:
说明:
- 字段配置依据: 以依据位置或名称对字段进行匹配
- **字段匹配和结构的预览:**预览生成表的字段以及结构
- 包含字段来源,是仅主数据集还是所有数据集
配置好节点后,就执行,启用缓存,就可以查看追加表。
操作示例如下:
案例:追加两个表,1班同学的数据成绩(4个学生)和2班的数学成绩(5个学生),配置追加节点如下图:

执行后,查看生成的**追加表,**数据表有9个学生,如下图

选择
**节点用途:**将输入表的数据拆分成两部分,一部分为符合指定条件的数据记录,可以在第一个输出端口中查看,另一部分为过滤掉的数据记录,可以在第二个输出端口中查看。
操作方法 如下图:

配置选项卡:
说明:2种数据选择方式
- 行属性:通过选取的字段值来设置条件,但是只能对单一字段进行过滤选择。
- 类型变量,可以选择**模式匹配,**进行多项选取
- 数值型变量,可以选择范围匹配,定义数据选择的上限下限
- 仅匹配缺失值,按照字段是否是缺失值,来分组数据。
- **行号范围:**通过指定记录的行位置,设置条件
**输出端口:**选择表和过滤表
操作示例 如下:
案例:选择出员工信息表中所有婚姻状况是“Divorced”的数据。
员工信息表中有32,561条数据记录。
配置选择节点,选择“行属性”,选择匹配条件字段为“婚姻状况”,在模式匹配中,选择“Divorced”。

执行后,右键查看选择表如下图,仅有4443条记录。

转置
**节点用途:**用于转换数据的行列显示方式,新生成的数据表,可以用新的字名,或者延用数据转置前的字段名
**端口:**数据收入端口;转置数据输出端口
操作方法:
配置节点,如下图:


图2-12-1
配置选项卡:
说明:
- 新字段名称:定义转置后新字段的名称,有两种方式,从字段读取,或者通过使用前缀,自定义新字段名,生成_新字段名+后缀数字_。
- **转置:**选择要转置的字段。如果转置后数据的字段名,是从数据字段中读取的,那么要转置的可选字段就不包含已被读取为新数据表字段名的变量。
**操作示例:**将数据-数学成绩表进行转置。
1 配置节点如图2-12-1,选择从字段读取后**,点击“读取值”,**在转置中
添加所有变量。
2启用缓存,并执行后,查看转置表 ,如下图

参考行过滤
节点用途: 将第一个输入表,按照第二个输入表中所选字段的条件,对数据进行过滤。
**前提条件:**第一个输入表,与作为参考表的第二个输入表对比时,需要有相同字段,这样两个数据才可以对比。
**端口:**2个数据收入端口;1个输出端口(参考行过滤表)
操作方法:
配置节点,如下图

图2-13-1
配置选项卡:
说明:
- 指定过滤方式,包含/排除参考表中记录
- 指定参考表中的过滤字段,第一个输入表的相应字段将于参考表中的本字段对比
- 选择要进行对比的数据表字段,参考表字段
操作示例 如下:
案例:参考表(收入<=50k),将员工信息表按照收入字段进行参考行过滤。
1 按照图2-13-1的方式配置节点
2 执行后,右键参考行过滤表,结果如下图:
进行过滤前,基础表含有数据32,561条记录,过滤后,输出表仅为收入<=50K的数据,记录为24,720条

设为标志
**节点用途:**简化数据,为一个或多个名义字段值,派生的标志字段。
这个节点将选中字段的每个可能的取值分别转化为一个标志字段并将取值定义为新字段的名字,根据初始字段在每行的取值,相对应的新字段在同行单元格的取值为T,否则取值为F。这个节点添加的字段数等于选中字段定义的可能取值数。
操作方法:配置节点,如下图

图2-14-1
配置选项卡**:**
说明:
- **集字段:**选择一个或多个集字段,用于创建新字段的标识,将以集字段的值生成新的字段。
- 添加要为名义型字段值进行标记的值。
- 默认真值为“T”;假值为“F”
操作示例:
案例:用设为标志节点对教育程度字段中博士,硕士,本科进行标志
1 节点的配置如图2-14-1:
2启用缓存,执行后,生成的数据表如下:

重新结构化
**节点用途:**根据名义字段或标志字段的值生成多个字段。
新生成的字段可包含来自另一个字段或布尔型(0和1)的值。通过本节点,可以借助另一个字段的值,创建任意类型的字段(包括标志字段)。而设为标志节点,只针对名义字段或标志字段的值生成多个标志字段,因此如果要创建标志字段,使用设为标志节点更为方便。
**操作方法,**如下图

配置选项卡**:**
说明:
- **分组选项和汇总选项:**参考汇总节点
- 集合选项
- **集字段:**选择一个或多个集字段,用于创建新字段的标识,将以集字段的值生成新的字段,而新字段取值基于汇总字段计算得到。
- 集字段选项卡中原则上也应该只支持整型或字符型字段。而且如果集字段中的取值越多则生成的字段越多,计算成本越高。
操作示例 如下:
配置节点如图:

原始数据如下:
在员工基础信息表中,分别查看不同收入,不同性别的员工平均年龄:
- 配置节点,分组,选择“收入”;
- **集合,**选择“性别”,添加字段值
- 汇总,选择“年龄”,汇总方式选择平均值
- 确定配置,右键启用缓存,并执行,查看生成的重新结构化表
执行后生成的数据表如下:

时间选择
**节点用途:**对数据中的时间字段选择指定时间区间的所有记录。时间区间由一个起始日期和结束日期指定。
前提条件:数据中含有日期型数据,如果含有的时间数据不是日期型,需要进行字段的类型转换
操作方法:

配置选项卡:
设定所需要数据的起止时间点
自定义选择
**节点用途:**自定义条件,过滤数据。
支持用户自定义函数表达式的方法设定选择条件,根据某个特定的条件(如 年龄>50)将输入表拆分成选择表和过滤表。
操作方法:

图2-17-1
配置选项卡
说明:
- **字段列表:**可用的字段,可以作为条件表达式的变量。
- **函数库:**编辑条件表达式可用的函数。
- **操作符:**编辑条件表达式可用的操作符。
- **表达式:**使用选择的变量,函数,运算符编辑条件表达式。
配置节点信息后,启用缓存,执行,右键查看输出:“选择表”和“过滤表”
操作示例如下:
案例:查看员工信息表中年龄为15-35岁的员工信息
配置节点,如图2-17-1,
步骤:
- 在函数库中找到“between( , , )”
- 在表达式第一个输入项中,双击变量“年龄”
- 在第二个输入项中,输入年龄下限:15
- 在第三个输入项中,输入年龄上限:35
执行后,查看选择表,结果仅为15-35岁年龄的数据,14,925条记录。如下图:

去重
节点用途: 将数据表中,重复出现的记录剔除。
配置选项卡**:**
说明:
- **模式:**这里有两种模式可供选择,包含首个记录和丢弃首个记录
- **关键字:**可以选择一个或者多个列作为排序字段。根据每个选中列 的唯一值确定分组,一个分组作为生成排序表的一条记录。
- **组内排序:**可以选择一个或多个字段基于分组进行排序。升序或者降序
操作示例 如下:
案例:将员工信息表,按照国籍进行去重。
配置去重节点,如下图:

图2-18-1
执行后生成的预览表如下,预览表中的数据已由原先的32,561条记录变成42条,重复记录已被去除,如下图。

图2-18-2
提取字段名
**节点用途:**用于提前数据表中所含字段名称
本节点较为简单,不需要赘述。
节点配置图,以及结果输出表,参看图2-19-1


图2-19-1
插入字段名
**节点用途:**使用第二个输入表(字典表)对第一个输入表的字段进行重命名字典表至少要包含两个列,一列为原有字段名,用来对第一个输入表的字段进行查找匹配,另一列为将要替换的新字段名。
节点配置:

配置选项卡:
说明:
- **原字段名列:**从字典表中选择包含原字段名的字段
- **新字段名列:**从字典表中选择包含新原字段名的字段
平衡
**节点用途:**使用平衡节点修正数据集中的不平衡,以便它们符合指定的检验标准。
说明:
若某个数据集只有两个值(T和F),并且 90% 的观测值为F,而只有 10% 的观测值为T,这类现象成为样本失衡。
很多建模技术处理此类失衡数据都有困难,因为它们倾向于只学习这些F的结果,而忽略T的结果(因为这些结果少的可怜)。如果数据平衡很好,T和F结果具有大致相同的数量,那么模型将更有可能找出分辨这两个组的模型。
这种情况下,平衡节点对于创建平衡指令,从而减少带有F结果的观测值数量非常有用。
操作方法:

配置选项卡:
说明:
- **选择字段:**选择样本失衡的字段。一般处理的都是目标字段。且一定是分类型字段。
- 值域:
- 名义值:显示的是所选分类字段的取值。
- 倍数是样本平衡处理的指数,这个需要用户指定。
如果值小于1,则为欠抽样,即随机去掉一定比例样本,使其减少。
如果值大于1,则为过抽样,即多次有放回的抽取类样本,使其增加。
如果值都是1,则执行后不发生任何改变。
- **固定随机数种子:**如果希望每次执行的结果不变,只需要在这里输入固定的随机种子即可。如果不指定,每次执行会使用一个新的随机种子,多次执行的结果可能有所不同。
RMF汇总
**节点用途:**根据指定的用户ID, 对其交易金额、交易频次、时间间隔进行汇总, 输出用户ID的交易总金额、交易频次、最近一次交易时间间隔。

配置选项卡:
说明:
- 固定日期 :用于计算最近一次用户交易的交易间隔。
- **用户ID:**指定用户的ID号
- **交易日期:**对应用户每次交易的交易日期
- **交易金额:**对应用户每次交易的交易金额
类型
节点用途: 主要是为了计算或更新字段的元数据,包字段测量类型、值域和缺失,以及指定字段的角色。
比如,分类预测类模型都需要指定一个目标变量,所以必须通过类型节点的角色功能。首先指定一个字段的角色为目标,指定影响因素的角色为输入,这样模型节点就可以自动识别目标字段,并将其作为目标变量,而输入字段被作为自变量,参与训练模型。

配置选项卡:
说明:
- **字段:**显示的是输入表中所有的字段名称。
- **测量:**这是测量级别,用于描述某个给定字段中数据的特征。最大的作用是为了放宽对字段存储类型的限制。
比如说,通常条形图的分类字段必须为字符型,但是对于一个取值不是很多的整型字段作为分类,统计该字段每个整数值的计数并可视化展现有时也是很合理的,所以通过类型节点无需转换字段的存储类型,只要将该字段的测量类型改为名义型即可以使用条形图进行展现。
注意:字段的测量级别与字段的存储类型不同,后者表明数据是以字符串、整数、实数、日期、时间还是时间戳存储。
- 值:显示所有字段的值域。另外,点击字段相应值域可以弹出选择框(可选列表:当前,读取,指定),如果将该字段的默认值设置为”读取”,类型节点再次执行时将重新计算该字段的元数据,该功能主要用于更新部分字段的元数据。不更新全部字段的元数据,而只更新指定的部分字段可以减少不必要的计算资源浪费。如果您想更新全部字段的元数据,请使用”清除所有值”按钮,这样可以重置读入该节点所有字段的值。此选项可以有效地将所有字段的值设置为读取。
- **缺失:**用于统计并展示该字段中缺失的计数。这样可以保证模型运算时的数据质量。
如果在类型节点中已经统计出字段中是否有缺失值,模型运算时可以提前获知数据集中是否有缺失值,并根据已经指定的缺失值处理方法,快速做出响应。
- **角色:**字段的角色共分为目标、输入、记录ID和无。
- 角色为目标,表示该字段为目标变量;
- 角色为输入,表示该字段为自变量;
- 角色为记录ID,表示该字段为标识型字段,不参与建模;
- 角色为无,表示该字段不参与建模,但是模型预测表中仍保留该字段,这是将字段的角色设置为无与直接使用过滤节点将该字段过滤掉的区别,对于标识分析对象的字段(如客户编码)来说,这个功能特别有用。
操作示例 如下:
工作流中的“平稳时间序列模型”案例中使用了这一功能,
为了构建平稳时间序列模型,需要把利润字段设为目标,日期,销量字段均设置为**输入,**配置如下:

这样就可以进行后续的时间序列建模操作了。
过滤
节点用途: 用于过滤不需要的字段,或者对字段进行重命名。
操作方法:
- 配置节点

图2-24-1
配置选项卡:
说明:
- 原始字段:输入数据表中所包含的字段列表。
- **过滤:**点击想要过滤掉的字段的箭头,箭头上将会显示一个叉号,该字段在接下来的分析中会被过滤掉。也可以通过”反选”按钮来批量反向过滤字段,这在字段特别多时很有用。
- **输出字段:**如果想要重命名字段,可以在这里双击显示字段名,可以更改此字段名。新字段名会出现在节点输出表中。
- 配置好节点好,启用缓存,执行
- 查看过滤表
分列
**节点用途:**将数据字段中的值,按照某种统一规则进行拆分。与excel中的数据分列用途,方法基本一样。
操作方法 如下:
- 配置节点

图2-25-1
配置选项卡:
说明:
- 拆分目标:选择输入数据中要进行拆分的字段。
- 拆分方式:拆分字段的规则有两种,基于分隔符或者固定宽度。
- **基于分隔符:**选择或输入分隔符号
- **固定宽度:**定义划分的数据宽度
- 数据预览:定义好数据值拆分规则后,可以使用预览功能查看,分列后的数据是否达到预期,以便调整数据分列的规则。
- 确定配置,启用缓存,执行。
- 查看输出表-分列表
操作示例:
案例:在员工基础表中,收入字段的值为“<=50K”和“>50K”,为了下一步建模分析,希望把字段值中“K”去掉。
首先,引入数据-“员工基础表”,按照图2-25-1,配置分列节点:
- 使用“基于分隔符”
- 选择“其他”,输入“K”
- 预览后,确定
- 启用缓存,执行后,结果如下图:
结果中,原收入字段保留,新生成分列好的字段。

类型转换
节点用途: 将一个字段或一组字段从一种数据类型转换为另一种数据类型。
在数据挖掘过程中,不同类型的字段的处理方式是不一样的,所以有时需要对字段的类型进行一下转换,再进行下一步的分析。例如,将字符型转换为数值型、数值型转换为字符型等。
操作方法 如下:
- 配置节点

配置选项卡:
说明:
- 类型选择:数据类型转换方式
- **字符串到数值:**将字符型的字段转换为数值型。一次可以处理多个字段
- **数值到字符串:**将数值型(整型和浮点型)字段转换为字符型字段。一次可以处理多个字段。
- 浮点到整型:将浮点型字段转换为整数型字段。浮点数转换为整数时,有四舍五入、取整、向上取整三种方式,其中取整表示只取整数部分,小数部分忽略,向上取整表示整数部分加1。一次可以处理多个字段。
- **字符串到日期:**将存储为字符型的日期字段转换为日期型。一次只能以处理一个字段。从可用列框中选择一个要转换的字段。并选择该字段中日期值的格式,也可以手动输入日期值的格式,程序将根据指定的日期值格式来解析该字段并生成日期字段。
- **日期到字符串:**将日期型字段转换为字符型字段。此处字段选择框只能选择日期型的字段。另外,必须正确的指定该日期字段的格式。
- **集合到字符串:**将集合类型字段转换为字符型字段。
- **字符串到集合:**将字符串型字段转换为集合型字段。
- **详细配置:**定义类型转换后的字段名,是否替代转换前字段,已经新字段类型的格式。
操作示例:
案例:在时间序列分析中,原始数据中日期字段是字符串形式,但是为了做时间序列预测,需要对日期进行类型转换,从字符串类型转换到日期类型。
- 配置节点,选择:“字符串到日期”
观察日期字段中,数值为“12/31/1979”,在日期格式中选择“MM/dd/yyyy”
- 确认配置,启用缓存后,执行。
执行后生成的数据表规格如下图,日期字段,已经被转换成日期类型。

缺失填充
节点用途: 用来处理输入表中的缺失值。
操作方法:
- 配置节点,如下图:

配置选项卡:
说明:分为两类——整型字段和字符型字段
- **无操作:**仍保留缺失值,这个选项对所有类型的字段都适用。
- **现在删除:**删除所有包含缺失值的记录,这个选项对所有类型的字段都适用。
- **最小、最大、平均,众数:**用字段的最小值、最大值,平均值或者众数来填充缺失值。这个选项只适用于数值型字段,即浮点型或整型。整型字段的均值取近似值。
- **固定值:**使用用户指定的值来填充缺失值,这个选项适用于浮点型、整数型和字符串型字段。
如果需要对数据中相同类型的不同字段,进行差异化的缺失值填充,那么可以使用高级选项卡,选定数据表中的字段,制定缺失值填充方法。
操作示例如下:
案例:员工基础信息表中,字段国籍中,含有缺失值,现在对这一字段进行缺失值填充。
由于字段国籍,目前是字符串类型,故在配置时:
- 选择高级选项卡,选中国籍,并添加
- 进行“删除”操作
执行后生成的缺失填充表中,国籍字段中,不在有缺失值。
参考列过滤
**节点用途:**可以参照第二个输入表(参考表)过滤掉第一个输入表中的字段。根据对话框的设置,在输出表中,参考表的字段被包含或排除。
操作方法:
节点配置,如下图

配置选项卡:
说明:
- **包含/排除:**指定从第一个输入表中包含/排除所有参考表中的列到输出表中。
- **确保字段类型一致:**即保证匹配列不仅有同样的名字,而且字段类型也要相同。如果勾选,必须是字段名称和类型都相同才算相同。如果不勾选,只需要字段名称相同即可。
案例:参考表2,将表1中多余变量删除,简化数据,提升系统效率。
表1与表2中相同字段有“学号”“姓名”。
如图2-28-1,配置该节点后,执行后的参考列过滤表中,仅为表1中去除学号,姓名后的数据。
填充
**节点用途:**功能是基于第二个输入表(字典表)某个字段的值来替换第一个输入表某个字段的值。
从字典表中选择一字段(或者行ID)作为匹配查询的依据,再选择另外一个包含新值的字段作为替换字段。所有目标字段中与查找值匹配的项都将被替换为替换字段中对应的值。
操作方法:
节点配置,如下图

配置选项卡:
说明:
- **输入表:**目标字段,从第一个输入表中选择要替换值的字段
- 字典表:
- 输入(查询):从字典表中选择的查询字段,将会基于该字段与目标字段中的值进行匹配,如果相等,第一个输入表中该字段的值将会替换字段相应的值替换。
- 输出(替换):从字典表中选择的替换字段。
- **追加/替换结果:**追加字段:如果勾选此项,第一个输入表中被替换后的字段将作为一个新字段追加到输出表中,否则将会覆盖原字段。
- **未匹配元素:**此处用于指定未匹配元素的处理方案。“原始值”表示不更改这个值,保持不变;“缺失”表示将该值替换为缺失值。
自定义填充
**节点用途:**基于通配符或者正则表达式来实现替换字段取值的功能。
操作方法:
- 配置节点,如下图:

配置选项卡:
说明:
- **字段列表:**数据表中可用的字段,可以作为条件表达式的变量。
- **函数:**编辑条件表达式可用的函数。
- **操作符:**编辑条件表达式可用的操作符。
- **描述:**函数或者运算符的介绍。
- **表达式:**根据所选择的的函数,显示要计算的表达式
- **填入字段:**需要进行填充的字段,通过双击左侧字段列表中的字段进行选择。
- **替换:**这里可以指定替换的方案来选择要替换的内容。有“根据以下条件”、“始终”、“空值”、“无效值”、“空值与无效值”五种选项。
- **条件:**您可以使用左侧的变量和上面的函数及运算符编辑条件表达式。
- **替换为:**希望替换成的目标值,可以使用左侧的变量和上面的函数及运算符编辑条件表达式,也可以输入固定值。
注意:引用变量,需要在变量上加上引用符号“$”, 例如:用 $年龄$+1 替换年龄字段
操作示例 如下:
案例:由于成绩计算错误,所有学生的数学成绩都比实际高出了10分,现在要通过自定义填充节点减去这10分。
配置如下:

配置好节点后,启用缓存,并执行。
生成年龄数据已被全部改正,数学成绩比之前的数据表中少了10。
组合
节点用途: 组合节点的功能与分列节点刚好相反,它是将多个字段的内容结合到一起,并生成一个新的字段。

配置选项卡
说明:
- **分隔符:**在此处输入分隔符,用于将新字段中的内容隔离开
- **引用字符:**在此处输入引用字符,用于将原字段中的值括起来
- **替换原分隔符:**可以在此处输入一个分隔符替代原有字段中的分隔符
- **新字段名称:**指定新字段的名称
近似处理
节点用途: 根据指定的小数点位数或者有效数字使用指定的舍入方式对浮点型数据近似处理。只可以对指定的浮点型数据列执行此操作。
说明:
- 近似值可以添加为一个新的列,或者替换原始列。 如果添加为新列,需要指定新列名字的后缀。有7种不同的舍入模式可供选择:远离,靠近,向上,向下,半向上,半向下,偶数。
- 输出格式也可以使用不同的类型,可以参看下面的例子。将1.23501, 0.00000035239 和 -3.123103E9近似(半向上)保留3位有效数字的结果如下表。
| 输入 | 浮点型(*) | 标准字符 | 简单字符 | 工程字符 |
|---|---|---|---|---|
| 1.23501 | 1.24 | “1.24” | “1.24” | “1.24” |
| 0.00000035239 | 0.000000352 | “3.52E-7” | “0.000000352” | “352E-9” |
| -3.123103001 | -3120000000 | “-3.12E+9” | “-3120000000” | “-3.12E+9” |
(*)注意由于”浮点型”输出选项在表示浮点数时的数值精度问题,可能会出现意料之外的结果。如0.1可能表示为0.09999999999999999。
操作方法:
1 配置节点,如下图:

图2-32-1
配置选项卡
说明:
- **可用字段:**显示所有可以进行近似处理的字段,浮点型或整型字段。
- 搜索:当数据中字段较多时,输入要查找字段名称中包含的字符,进行模糊查找。重复点击搜索按钮,可以逐一标记下一个包含搜索字符的字段。
- **近似设置:**浮点型的格式将按照这个标签下的选项进行设置。
- **追加新字段:**勾选此项,近似处理后的值将被保存到新的字段中。选中的每个字段都会分别生成一个表示近似值的字段。新生成字段的名字由原始字段的名字和指定的后缀组成。如果不勾选,近似处理后的值将覆盖原字段的值。
- 输出格式:指定输出数据的显示方式。对于数值0.00000035239,选择标准字符,则显示为3.52E-7; 选择简单字符,则显示为0.000000352;选择工程字符, 则显示为352E-9。
- **精确位数:**指定浮点型数据需要保留的位数,如果位数小于实际的小数部分的长度,将应用指定的舍入方式。
- **精确模式:**近似值的精度类型。小数点位数是默认选项,默认按指定小数点位数近似计算。而有效数字选项可以按有效数字进行近似计算,对于一个近似数,从左边第一个不是0的数字起,到精确到的位数止,所有的数字都叫做这个数的有效数字。
- **舍入模式:**定义近似计算浮点型数据时使用的舍入模式。
有7种不同的模式可供选择:
- 向上舍入:如果该值为正,则往远离0的方向近似的舍入模式。如果该值为为负,则向上舍入。如果是2.5取整后等于3,如是-2.5取整后等于-2。
- 负向舍入:向负方向舍入。如果是2.5取整后等于2,如是-2.5取整后等于-3。
- 远离0取整:向远离0的方向取整。如果是2.5取整后等于3,如是-2.5取整后等于-3。
- 向0取整:往小于该值的方向近似的舍入模式。如果是2.5取整后等于2,如是-2.5取整后等于-2。
- 四舍五入:四舍五入的舍入模式。如果是2.5取整后等于3,如是2.4取整后等于2。
- 五舍六入:五舍六入的舍入模式(类似四舍五入,差别在于对于5选择向下近似)。如果是2.5取整后等于2,如是2.6取整后等于3。
- 四舍六入:四舍六入,如果等于五,则选择近似值为偶数的舍入模式。如果是2.4取整后等于2,如是2.6取整后等于3,2.5取整后等于2,3.55取整后等于4。
操作示例 如下:
案例:将数据中利润字段做近似处理
操作:节点配置,如图2-32-1,
确定后执行节点,生成的近似处理表为:

标准化
**节点用途:**标准化节点的功能是对数值型字段进行标准化。
在设置对话框中可以选择要标准化的字段,有三种标准化方法。
操作方法:
配置节点,如图:

图2-33-1
配置选项卡:
说明:
- Min-max 标准化
Min-max标准化方法是对原始数据进行线性变换。设minA和maxA分别为属性A的最小值和最大值,默认最小值为0.0,最大值为1.0。将A的一个原始值x通过min-max标准化映射成在区间[0,1]中的值x',其公式为:
x'=(x –min(x))/(max(x)- min(x))
- Z-score 标准化
这种方法基于原始数据的均值和标准差进行数据的标准化。将A的原始值x使用z-score标准化到x'。z-score标准化方法适用于属性A的最大值和最小值未知的情况,或有超出取值范围的离群数据的情况。
x'=(x –mean(x))/stdev(x)
z-score标准化方法可以回答这样一个问题:”一个给定值距离平均数多少个标准差”。在平均数之上的值会得到一个正的标准值,在平均数之下的分数会得到一个负的标准值,标准化后的变量值围绕0上下波动,大于0说明高于平均水平,小于0说明低于平均水平。这是一种可以看出某值在分布中相对位置的方法。标准值能够真实的反应一个值距离平均数的相对标准距离。
- 小数定标标准化
通过移动数据的小数点位置来进行标准化。小数点移动的位数取决于字段的最大绝对值,直到变换后的最大绝对值小于等于1。然后所有的其他值移动相同的位数。
操作示例如下:
为了比较数据表中的权重字段,要进行标准化处理,配置如图2-33-1:
按照Min-Max方法进行标准化
执行后生成的数据表中,权重的数值已经是从0-1的数,如下图

延迟
节点用途: 根据指定的延迟和延迟间隔从前面的记录中将字段的值复制到当前记录。一般都是按周期性复制。
说明:
根据指定的延迟_L_确定要生成多少个所选字段的副本,根据延迟间隔_I_确定延迟几条记录。生成延迟字段名称由原字段名加编号组成,编号根据延迟_L_和延迟间隔_I_确定,每个延迟字段的编号为_I_, 2*I, 3*I, ...L*I。例如,如果_L=3_,I=1,则字段的编号为1,2,3;L=3,I=2,则字段的编号为2,4,6。编号也表示该字段第一个不为空的起始行。
延迟节点在做时间序列预测时特别有用,尤其可以和线性回归算法一起使用,可以建立基于线性回归算法的时间序列预测模型。通过该节点可以计算预测序列的同期值:延迟为1则表示生成一个同期序列,当前记录的值就等于一个周期_I_之前的数据,_I=1_则新生成延迟字段的值都等于它原字段上一条记录的值,_I=12_则新生成延迟字段的值都等于原字段往前数第十二条记录的值;延迟为2,则表示生成两个同期序列,生成的第一个延迟字段当前记录的值就等于一个周期_I_之前的数据,_I=1_则新生成延迟字段的值都等于它原字段上一条记录的值,_I=12_则新生成延迟字段的值都等于原字段往前数第十二条记录的值。而第二个延迟字段当前记录的值就等于上一个延迟字段之前的数据,_I=1_则新生成延迟字段的值都等于上一个延迟字段上一条记录的值,_I=12_则新生成延迟字段的值都等于上一个延迟字段往前数第十二条记录的值。

图2-34-1
配置选项卡:
说明:
- **延迟字段:**选择需要延迟的字段
- 延迟阶数:L 延迟,定义要生成多少个字段副本。例如,如果_L=3_,则会生成三个字段副本
- 延迟间隔:I (有时也称为周期性或季节性) 定义从第几条记录开始移位。例如,如果_L=3_,I=1,则会生成三个字段副本,记录的起始位置分别是第二条记录、第三条记录和第四条记录,之前的记录都以缺失值填充;如果_L=3_,I=2,则会生成三个字段副本,记录的起始位置分别是第三条记录、第五条记录和第七条记录,之前的记录都以缺失值填充
- **新字段名:**为新生成的延迟字段定义名称
- **跳过最初不完整的行:**字段延迟后开始的几条记录是以缺失值填充的,因此这些行并不完整。我们可以通过勾选此项,跳过这些不完整的记录,输出表中将不会显示
- **跳过最后不完整的行:**字段延迟后最后的几条记录将会按照延迟间隔下移,这样虽然新生成的最后一个延迟字段在尾部是有值的,但是旧的字段都只能以缺失填充。我们可以通过勾选此项,跳过这些尾部不完整的记录,输出表中将不会显示。注意,如果只勾选这两项中的一项,输出表中总的记录数与输入表相等;如果两项都不勾选,输出表中的记录比输入表增加_L*I_条记录;如果两项都选中,输出表中的记录比输入表减少_L*I_条记录。
**案例:**生成时间序列数据中销量字段的延迟数据
建立工作流如下:

按照图2-34-1对节点进行配置,执行后生成数据如下图:

字段重排
节点用途: 字段重排节点的功能是基于用户定义的设置改变输入表中字段的顺序。
**操作方法:**节点配置如下图:

配置选项卡:
将选中的字段,进行位置上的操作。向上或向下移动一个位置等等。如果选中字段已经移动到了列表的最顶端或最底端,再移动就会移到列表的另一端。
RFM分级
**节点用途:**根据指定的用户最近一次交易间隔、交易频次及交易总金额来得到用户分级。

配置选项卡:
说明:
- **最近一次交易间隔:**最近一次交易时间间隔,以天为单位
- **交易频次:**用户交易的总次数
- **交易总金额:**用户交易的总金额
分箱
**节点用途:**这个节点对数值型数据按一定间距进行分组,称为分箱。
节点配置:

配置选项卡:
说明:
- **选择分箱字段:**列表中显示的是需要进行分箱的字段
- **搜索:**字段较多时,可以通过输入要查找字段名称中包含的字符进行模糊查找。重复点击搜索按钮可以逐一标记下一个包含搜索字符的字段。也可以勾选复选框“选中所有匹配字段”选中所有符合条件的字段
- 分箱的方法:
- **固定箱数:**通过调整箱数大小,确定自动分箱的数量
- **固定宽度:**确定分箱的宽度。程序将根据指定的宽度进行分箱并确定分箱的箱数
- **分位数:**使用分位数进行分箱,可以选择的有“四分位数”、“十分位数”、“二十分位数”,还可以自定义分位数
- 分箱取值:
- 编号,则以“Bin”为前缀进行依次编号命名,如 Bin 1,Bin 2等
- 边界,则以分箱区间为分箱名,如“(a,b]”
- 中点,则以分箱区间的中点为分箱名。
日期时间提取
节点用途: 从已有的日期时间字段中提取日期(年、季度、月、周、日)、时间(时、分、秒)等生成可用的字段。例如,生成年份字段、月份字段、日字段等。
**前提条件:**目标数据中需要有日期类型的字段。,如果日期字段是其他类型数据,则需要提前将该字段进行类型转换。
操作方法 如下:
1 节点配置,如图:

图2-38-1
配置选项卡
说明:
- **提取日期属性:**可供选择提取年,季度,月,日,星期,天,周
- **提取时间属性:**可供选择提取时,分,秒
- **提取日期时间:**提取日期时间数据后,定义新字段名称。
2 配置好节点后,启用缓存,执行后,可查看输出表
时间偏移
**节点用途:**对一个日期字段,按照指定的偏移量,做偏移。您首先需要选择一个日期字段,然后指定一个偏移量,偏移量可以是一个整型的字段,也可能是一个常量。
操作方法 :
- 配置节点,如下图

图2-39-1
配置选项卡:
说明:
- 选择偏移字段:选择一个日期类型字段作为偏移的基准值。
- **选择偏移粒度:**选择时间粒度(年,月,周,日,时,分,秒)。例如,如果选择了日,就表示指定的字段或者常量的单位就是日,偏移值若等于10,日期字段偏移10天。
- **偏移新字段名:**在此处为新生成的偏移字段定义名称。默认名称为”新字段”
- **使用字段作为偏移量:**选中该项,就可以通过选择一个整型字段作为偏移量。
- **使用常量作为偏移量:**选中此项,可以指定一个常量作为偏移量。
- **输出选项:**选择输出日期、时间的模式。
- 确认配置后,启用缓存,并执行,查看时间偏移表。
操作示例 如下:
案例:表中数据有误,记录年份都比实际年份早一年,可以使用时间偏移节点进行修改,节点配置,如图2-39-1:
执行后生成的数据表,偏移时间比源数据日期推迟了一年,如下图:

时间差
节点用途: 计算连个时间点的间隔。
可以用于计算该选择的日期时间字段与当前执行时间的间隔,或者计算与一个指定的固定时间的间隔,也可以计算该字段与另外一个日期的差,还可以计算该字段每一行与上一行的差。
操作方法:
1 配置节点,如图:

配置选项卡:
说明:
- **计算类型:**选择计算日期差的对标方式。
- **执行时间:**计算指定日期与执行时间的差。
- **固定时间:**计算指定日期与固定时间的差,在对应位置填入时间
- **前一行:**计算指定日期字段中,本行日期与上一行日期的差,第一个 单元格为缺失值。
- **第二字段:**计算第一个指定日期与数据中第二个日期的时间差,在对应位置设定第一个时间字段,第二个时间字段。
- **选择时间粒度:**指定生成的时间差粒度,比如年、季度、月、周、天、时和分。
- **新字段名:**指定新生成的时间差字段的名称。
操作示例 如下:
案例:计算数据表中的时间,与当前时间的时差,插入时间差节点,配置如图2-40-1:
当前时间为2018-09-19
执行后生成的数据中“时间间隔”显示,一些数据距今39年,过早。可以考虑是否删除过早的历史数据。

时间区间
**节点用途:**为用于时间序列建模节点或时间散点图节点的时间序列数据指定间隔并生成标签,以便于估计或预测。
说明:
- 目前支持的时间间隔包括年、季、月和日。例如,如果某个序列的日测量开始于 2005 年 1 月 3 日,则可以为从该日期开始的记录添加标签,第二行为 1 月 4 日,依此类推
- 可根据需要填充或汇总值,以确保对各种字段类型按照指定间隔进行汇总的方法,以及对缺失值的处理策略。
- 时间区间节点假定每个序列各占一个字段或列,每个测量各占一行。如有必要,可以将数据转置以满足此要求。
- 对于不等度间隔的序列,可以指定一个字段,用于标识每个测量的日期或时间。请注意,这需要具有适当格式的日期、时间或时间戳字段,以用作输入。如有必要,可以使用类型转换节点将现有字段(如字符型字段)转换为这种格式。
操作方法 如下:
- 节点配置 如下图:

图2-41-1
配置选项卡:
说明:
- **时间区间:**在选择框中指定用于构建或标注序列的间隔和周期性,目前支持的时间间隔包括年、季、月,日,时,分,秒。
- 从第一个记录开始附加标签:指定标注连续记录的起始时间。例如,如果选择的时间间隔是月,应指定第一条记录是某年和某月,之后的记录按照 “月+1”添加字段值, 数据。除添加标签以外,此方法不会更改原始数据。它会假定记录已是等间隔,每个测量之间的间隔一致。在数据中,必须使用空行表示所有缺失的测量。
- 从数据构建:对于不等间隔的序列,可以指定一个字段,用于标识每个测量的日期或时间。请注意,这需要具有适当格式的日期、时间或时间戳字段,以用作输入。例如,如果某个字符串字段具有 Jan 2000、Feb 2000 等类似值,则可以使用类型转换节点将其转换为日期字段。从数据构建选项也会根据需要通过填充或汇总记录对数据进行转换以满足指定的间隔,例如,通过将日累计为月,或通过将缺失记录替换为空值。可以在”汇总设置”中指定用于填充或汇总记录的函数。
这种方式,可以用”汇总设置”,指定数据汇总方式。
汇总设置
- **汇总函数。**分不同类型的字段进行汇总
- 数值型:用于连续字段的可用函数包括总和、均值、最小值和最大值。
- 字符型:选项包括模式、第一个。”第一个”表示汇总组中的第一个非 Null 值(按日期排序)。
- 布尔型:选项包括任一值为真则为真和全部为真则为真。
- **填充函数。**不同类型的数据,可选择不同的填充函数进行数据填充。
- **名义值最大类别数:**设定为默认值
- **最大填充间隔:**设定为默认值
- **结果数据集的中最大记录数:**指定输出表记录数的上限,如果不指定,该数字值会很大,尤其在以日为间隔的情况下可能会超出指定的最大值。如果超出指定的最大值,系统将停止处理并显示警告消息。
- 配置好节点后,启用缓存,并执行。
操作示例 如下:
案例: 对以后的85年-95年历史数据进行时间序列进行年度预测,在建立模型之前,需要把历史数据按照年度汇总好。此时,需要时间区间节点,将数据重新加标签。
1 时间区间节点配置如图2-41-1:
- 时间区间从数据中构建
- 选择时间区间为“年”
- 本数据中需要汇总的都是数值型变量,因此选择“总和”
2 确认,执行后生成的数据表如下,数据已经按照年度时间序列整理好,可以进行之后的时间序列预测的建模分析。

派生
字段用途: 可以根据一个或多个现有字段创建四种类型的新字段
- **公式:**新字段是基于任意函数表达式计算的结果。
- **标志:**新字段是代表指定条件的标志型字段。
- **名义:**新字段是名义的,表示其成员是一组指定值。
- **条件:**新字段根据某个条件表达式,从两个表达式中择选其一用作字段值。
*请注意,表达式区分大小写。
操作方法 如下:
- 节点配置 如下图:

图2-42-1
配置选项卡:
说明:
- **派生的新字段:**定义派生的新字段的名称。默认为”新字段”
- **导出为:**列表中选择派生字段的方式,如”公式”、 “标志”、”名义”或”条件”。根据选定的类型和在该类型特定的对话框中指定的条件创建新字段。每种类型的编辑对话框也不同,选择不同的类型时,下面的编辑对话框也会跟着做相应变化。
- **字段类型:**为新派生的字段选择测量级别,如“默认类型”、”整型”、”浮点型”、”字符型”或“布尔型”。”默认类型”表示程序将根据表达式自动判断新生成字段的测量类型。
- **字段列表:**显示可用的字段,双击这些字段可以添加到左侧的表达式编辑框中,用作表达式中的变量。其中“行ID”、“行索引”、“记录数”三个字段是系统自动生成的。
- **函数:**可用的函数库,使用函数可以帮您更加容易的编写表达式。
- **表达式:**编辑表达式。选中这里,双击左侧的字段名称或函数名称将会把字段或者函数添加到此处
- **操作符:**可用的操作符,用于编写表达式。
派生新字段通常需要使用特殊的函数或数学表达式。所有类型的派生对话框中都提供了函数库,用于帮助创建这些表达式,节点也会对编辑的表达式做检查。
注意:
- 选择以公式派生新字段时,此表达式不能是条件表达式。要根据条件表达式派生值,请使用标志或条件类型的派生节点。
- 要返回空字符串,应键入一对引号,之间不包含任何内容,如 ““。例如,空字符串通常可用作假值,以使真值在表中更为明显。类似地,如果希望某个字符串值在其他情况下被视为数值,应使用引号。
- 配置好节点后,启用缓存,并执行。
操作示例如下:
案例: 销量利润数据表中,仅有日期,销量,利润三个字段,但是想看当时是简单产品的单价。这时候就要用派生节点。
1 按照图2-42-1,配置节点。单价=利润/销量
2 执行后生成的派生表如下,可以看到每个时间点的产品单价。

2.43 重新编码
**节点用途:**重新编码节点将名义型字段的每一个类别映射为一个整数。这个节点可以同时处理多个字段。
操作方法 如下:
- 节点配置 如下图:

图2-43-1
配置选项卡:
说明:
- **可用字段:**包含需要处理的字段。只能选择名义型字段。可以通过中间选择框中的按钮进行选择。
- **追加新字段:**勾选此项,重新编码后的字段将会追加到输出表中。否则,重新编码后的字段会覆盖原始字段。
- **后缀:**重新编码后新生成的字段名称为原始字段名称加上这个指定的后缀,默认为“_code”
- **起始编号:**指定第一个名义值的编码,默认为0。
- **步进:**第i个名义值映射到的值为i * 增量 + 起始值,即连续两个名义值编码直接的间隔长度,默认为1。
- **缺失值编号:**缺失值将映射为这个数值。可以输入任意的整数。如果空着,缺失值仍然为缺失值。
- 配置好节点后,启用缓存,并执行。
操作示例 如下:
案例:员工基础信息表中,字段收入的值为“<=50K”和“>50K”。为了方便做分析,需要对其进行重新编码。
- 配置节点,如图2-43-1.
- 确定配置,并执行后,生成的数据如下图,经过重新编码,“<=50K”编码为1,“>50K”编码为2.

2.44 大小写转换
节点用途: 大小写转换节点的功能是将所有的字母字符都转换为小写或大写。
仅对字符型字段可用。
操作方法 如下:
- 节点配置 如下图:

配置选项卡:
说明:
- 转换为大写:选中字段的值全部转换为大写。
- 转换为小写:选中字段的值全部转换为小写。
- **搜索:**字段较多时,可通过输入要查找字段名称中包含的字符进行模糊查找。重复点击搜索按钮可以逐一标记下一个包含搜索字符的字段。
- 配置好节点后,启用缓存,并执行。
本节点功能简单,易于理解,不做案例展示。
2.26 序列缺失填充
节点用途: 用来处理输入表中的缺失值,但是填补缺失值的方法跟数据相关,用下一个、上一个记录来填充,或者用线性序列,平均值等填充缺失值。
操作方法:
- 配置节点,如下图:

配置选项卡:
说明:分为两类——连续字段和分类字段
- **无操作:**仍保留缺失值,这个选项对所有类型的字段都适用。
- **下一个/上一个:**数据表中,上一个或者下一个不为空的记录值来填充缺失值。
- **平均值:**用字段的平均值来填充缺失值。这个选项只适用于连续型字段
- **线性:**针对连续性字段值,按照线性拟合的算法,填充缺失值。
如果需要对数据中相同类型的不同字段,进行差异化的缺失值填充,那么可以使用高级选项卡,选定数据表中的字段,制定缺失值填充方法。
操作示例如下:
案例:员工基础信息表中,字段国籍中,含有缺失值,现在对这一字段进行缺失值填充。
由于字段国籍,目前是字符串类型,故在配置时:
- 选择高级选项卡,选中国籍,并添加
- 选择“下一个”填充方法
执行后生成的缺失填充表中,国籍字段中,不在有缺失值。
可视化探索
概述
连接到新数据源时,Edata将该数据源中的每个字段分配给数据窗格的“维度”区域或“度量”区域,具体情况视字段包含的数据类型而定。如果字段包含分类数据(例如名称、日期或地理数据),SM将其分配给“维度”区域;同理如果字段包含数字,SM则会将其分配给“度量”部分。
那么,可不可以说维度就是包含分类数据(例如名称、日期或地理数据)的字段,度量就是包含数字的字段?以这些断言作为出发点是足够准确的,但当您在 SM可视化中工作时,请记住您可以控制视图中字段的定义。根据用户的要求,大多数字段都可用作维度或用作度量,并且可以为连续或离散。 SM将字段分配给“维度”区域或“度量”区域进行初始分配时建立了默认值。当您单击并将字段从“数据”窗格拖到视图时,SM将继续提供该字段的默认定义。如果从“维度”区域中拖动字段,视图中生成的字段将为离散字段;如果从“度量”区域中拖动字段,生成的字段将为连续字段。
条形图
节点用途: 以条形图,可视化所选择的名义字段的每一个取值的统计。统计的方式有计数,最大值,最小值等。
操作方法:
- 配置节点,如下图:

图3-1-1
配置选项卡:
说明:
- **分类字段:**所要分类的目标字段选择,一般选择离散数值的变量。
- **度量:**按照分类字段的定义,通过度量字段形成数据的交叉表。通常需要对此字段做一些统计汇总,统计的方式:计数,最大值,最小值。
- **颜色:**类似于分类字段,SM为字段每个值分配一种颜色,区分数据。
- 大小:通过图形的大小,展示对应字段数据值的大小。
- **文本:**图表中对应数据的详细信息,如图3-1-2中,显示数据标签
- **详细信息:**用于解释图表中对应数据的详细信息,如图3-1-3中,红色圈中的信息。

图3-1-2

图3-1-3
操作示例:
案例:统计诊病数据表中药物的使用具有重要的意义,我们可以根据药物的使用多少的信息,为下一阶段药物的储备做参考依据。原数据表如下图:

按照图3-1-1,配置条形图节点,执行后,可视化条形图结果为:

散点图
节点用途: 对两个选中的变量绘制散点图,易于了解数据分布形态,判断两变量之间是否存在某种关联或总结坐标点的分布模式
说明:所有的数据点将作为点显示在相应的位置。只有有效域的列,才可以显示在这个视图中。确保前面的节点已执行,或者通过域计算器节点定义域。
操作方法:
- 配置节点,如下图:

图3-2-1
配置选项卡:
说明:
- **X轴:**选择要显示在x轴的字段
- **Y轴:**选择要显示在y轴的字段
- **颜色:**类似于分类字段,SM为字段每个值分配一种颜色,区分数据。。
- 大小:通过图形的大小,展示对应字段数据值的大小。
- **文本:**图表中对应数据的详细信息,如下图3-1-2中,显示数据标签
- **详细信息:**用于解释图表中对应数据的详细信息,如下图3-1-3中,红色圈中的信息。
2 确认配置节点,执行并查看散点图
案例:销售利润表中,查看销售量与利润之间的关系。
配置节点如图3-2-1:
节点运行后,执行结果:

直方图
节点用途: 展示字段数据值的分布状况。对分类字段,选择直方图展示数据。选取分类的字段,汇总则以选取的汇总字段来汇总,同一分类下不同的汇总,软件自动以不同的颜色显示。
操作方法:
- 配置节点,如下图:

图3-3-1
配置选项卡:
说明:
- **分箱:**所要分类的目标字段选择,一般选择离散数值的变量。
- **度量:**按照分类字段的定义,通过度量字段形成数据的交叉表。通常需要对此字段做一些统计汇总,统计的方式:计数,最大值,最小值。
- **颜色:**类似于分类字段,SM为字段每个值分配一种颜色,区分数据。
- 大小:通过图形的大小,展示对应字段数据值的大小。
- **文本:**图表中对应数据的详细信息,如图3-1-2中,显示数据标签
- **详细信息:**用于解释图表中对应数据的详细信息,如图3-1-3中,红色圈中的信息。
2 配置好节点后,执行并查看视图
案例如下:
查看销量利润表中的,销量数据的分布
节点配置如图3-3-1,选择销量作为分箱,度量变量,度量选择计数,并执行。
执行结果为下图:

箱线图
**节点用途:**箱线图(Box-plot),是一种用作显示一组数据分散情况资料的统计图。因形状如箱子而得名。它主要用于反映原始数据分布的特征,还可以进行多组数据分布特征的比较。
节点配置:

图3-4-1
配置选项卡:
说明:
- **聚合度量:**所要分类的目标字段选择,一般选择离散数值的变量。
- **度量:**按照分类字段的定义,通过度量字段形成数据的交叉表。通常需要对此字段做一些统计汇总,统计的方式:计数,最大值,最小值。
- **颜色:**类似于分类字段,SM为字段每个值分配一种颜色,区分数据。
- 大小:通过图形的大小,展示对应字段数据值的大小。
- **文本:**图表中对应数据的详细信息,如图3-1-2中,显示数据标签
- **详细信息:**用于解释图表中对应数据的详细信息,如图3-1-3中,红色圈中的信息。
**案例:**按照图3-4-1进行节点配置,执行后查看视图,如下图:

饼图
节点用途: 通过饼图,展示数据的分布比例。如果要突出显示或者动态的更改饼图列或者汇总列,需要在交互饼图中实现。
操作方法:
- 配置节点,如下图:

图3-5-1
配置选项卡:
说明:
- **颜色:**类似于分类字段,SM为字段每个值分配一种颜色,区分数据。
- 大小:通过图形的大小,展示对应字段数据值的大小。
- **文本:**图表中对应数据的详细信息,如图3-1-2中,显示数据标签
- **详细信息:**用于解释图表中对应数据的详细信息,如图3-1-3中,红色圈中的信息。
2. 配置好节点后,执行并查看视图
案例如下:通过饼图看下数据中性别比例
配置节点,如图
执行结果:

词云
**节点用途:**选择一个词汇字段,一个词频字段,绘图展示词汇出现的频次大小。
操作方法:
- 配置节点,如下图:

图3-6-1
配置选项卡:
说明:
- **颜色:**类似于分类字段,SM为字段每个值分配一种颜色,区分数据。
- 大小:通过图形的大小,展示对应字段数据值的大小。
- **文本:**图表中对应数据的详细信息,如图3-1-2中,显示数据标签
- **详细信息:**用于解释图表中对应数据的详细信息,如图3-1-3中,红色圈中的信息。
2. 配置好节点后,执行并查看视图
案例: 将度假关键词频数,做成词云。
配置词云节点,如图3-6-1,执行后的词云如下:

趋势图
节点用途: 将数值在坐标的纵轴中体现,绘制成一条线,以便数据变化规律的趋势。列的值在图中对应为y轴坐标, 如果列中值的差异非常大可以会使视图扭曲。
操作方法:
- 节点配置,如下图:

图3-8-1
配置选项卡:
说明:
- **分类字段:**所要分类的目标字段选择,一般选择离散数值的变量。
- **度量:**按照分类字段的定义,通过度量字段形成数据的交叉表。通常需要对此字段做一些统计汇总,统计的方式:计数,求和,求平均,最大值,最小值。
- **颜色:**类似于分类字段,SM为字段每个值分配一种颜色,区分数据。
- 大小:通过图形的大小,展示对应字段数据值的大小。
- **文本:**图表中对应数据的详细信息,如图3-1-2中,显示数据标签
- **详细信息:**用于解释图表中对应数据的详细信息,如图3-1-3中,红色圈中的信息。
2. 配置好节点后,执行并查看视图
案例: 在85-95年的销售利润表中,将销售量按照年度展示
线图节点配置如图3-8-1,
执行结果如下:

地图
节点用途:用于在地图中展示位置或区域的特征表现,提供指定地理字段、度量字段及统计的方式,然后将最后的结果展示到地图上。

对话框选项
经度/纬度
如果有经度和纬度字段,拖入这两个配置框。
颜色
拖入一个字段可以渲染地图的颜色。
大小
拖入一个字段可以渲染点地图的点的大小。
文本
拖字段进入文本框,将会增加标记的标签显示。
详细信息
拖入字段进入详细信息,如果是维度字段将会分割标记,如果是度量字段会添加到标记的悬停信息中。
端口
输入端口
| 0 | 输入需要展示的数据。 |
|---|
视图
地图
按照所选显示参数,显示最后图形,同时可以交互修改字段及配置信息。
雷达图
节点用途: 这个节点为每一行添加一个雷达图。每一个这样的图总结了两个值之间的关系。它还显示一个选择范围,简化了在给定的范围内识别值。值被描绘成一个丝带连接轴。丝带的颜色、范围、和背景是完全可自定义的。
操作方法:
- 配置节点,如下图:

图3-9-1
配置选项卡:
说明:
- **分类:**所要分类的目标字段选择,一般选择离散数值的变量。
- **度量:**按照分类字段的定义,通过度量字段形成数据的交叉表。通常需要对此字段做一些统计汇总,统计的方式:计数,总计,最大值,最小值。
- **颜色:**类似于分类字段,SM为字段每个值分配一种颜色,区分数据。
- 大小:通过图形的大小,展示对应字段数据值的大小。
- **文本:**图表中对应数据的详细信息,如图3-1-2中,显示数据标签
- **详细信息:**用于解释图表中对应数据的详细信息,如图3-1-3中,红色圈中的信息。
案例如下:
将诊断数据中按照药物的种类进行钠,钾总量汇总进行可视化对比
雷达图节点配置如图3-9-1:
药物作为分类字段,钠,钾作为度量字段,按照求和汇总。
执行结果如下:

自助可视化
节点用途: 自助可视化节点囊括了之前所有的可视化探索的图形显示节点的功能,如同一个工具箱,可以根据需要再图形推荐板里选取适合的图形显示数据。

使用方法类似大数据工具下的自助可视化。
表
节点用途: 在表格视图展示数据。如果行数未知,视图会在打开时计算行数。
节点配置如图:

该节点配置很简单,可在最大显示记录数中设置显示的数据数,如果超出数目设置则只显示设置数目,如果未超出则显示现有数据
统计学习
概述
(此页面暂无内容)
数据审核
节点用途: 通过数据审核,可以大致了解数据内容,还可以审核数据质量。描述一列数据的特征,可以计算出最大值、最小值、平均数、总数、众数、中位数、方差等数据来进行描述。
操作方法:
- 配置节点,如下图:

图4-1-1
配置选项卡:
说明:
- **默认值:**系统默认所有字典被选定,作为描述统计字段。
- **自定义字段:**用户可以自行选择需要了解字段,查看数据特征。
- 颜色交互字段:在自定义字段选择中,可以使用本选项,按照颜色分类查看要考察字段的数据特征
- **基本统计量:**输出最大值,最小值,平均值,标准差,偏度,有效值,测量值,分布图形等基本的描述特征
- **高级统计量:**输出值方差,峰度等描述特征
- 确认配置后,执行并查看视图
操作示例:
将员工信息表中数据字段,按照图4-1-1配置后,执行,并查看视图

相关分析
**节点用途:**研究两个或两个以上处于同等地位的随机变量间的相关关系,变量之间是否有关系,以及有关系的程度。
操作方法:
- 配置节点,如下图:

图4-2-1
- 确认配置后,执行并查看视图
操作示例:
将员工信息表中数据字段,按照图4-2-1配置后,执行,并查看视图,性别,收入之间,相关系数为0.216,相关性小,性别于教育程度的相关系数近0.096,相关性也很小,教育程度于收入的相关系数为0.369,相关性较高一点。

单样本T检验
**节点用途:**检验单个字段的均值与指定的常数检验值的差异是否显著。对于每个检验字段,均可输出该字段的描述性统计量(均值、标准差和均值的标准误)和T检验结果(如P值、置信区间等)。
例如:某生产商可以用此方法检验一批生产线的平均日产量是否等于100。
节点配置:

配置选项卡:
说明:
- **检验值:**指定一个常数作为检验值,每个检验字段的均值将与此值做比较
- 置信度(%): 指定一个1到99之间的值作为置信度,用来计算检验字段均值和假设的检验值之差的置信区间,默认是95
- 检验字段: 选择一个或多个字段。分别为每个字段在同一假设下进行单样本T检验。
机器学习
概述
(此页面暂无内容)
分类预测
线性回归
**节点用途:**线性回归可以用来研究一个或多个自变量对一个目标字段的影响重要程度,或者对目标字段进行预测。
使用条件:
- 该节点的目标字段必须为数值型字段。
- 使用该节点前需要先用一个类型节点指定参与分析的字段的角色,目标字段的角色定义为目标,其他自变量的角色定义为输入。
节点输出:
- 通过训练, 节点可以输出预测结果、模型的参数估计以及PMML格式的模型
- 在该节点之后配合使用分类预测器节点,可以得出未知目标字段的预测结果。通过评估节点还可以评估预测效果。
操作方法:
- 在配置对话框中可以指定汇总方式,如下图:

图5-1-1-1
配置选项卡:
说明:
- **正则化方法:**预防机器学习过程中,因模型参数过多,导致过拟合现象。SM中,正则化方法综合了Lasso回归和Ridge回归,这里设定的数值用于调节这两种方法之间的比例。
- **正则化系数:**允许模型在拟合过程中存在偏差的程度,系数越大,对模型拟合的约束越松。
- **模型中包含常数:**设置回归模型中是否需要有截距
- 最优算法:求最优解时所用的算法,可以选择正规方程或L-BFGS(变量数量多数据量大时建议使用),也可由节点根据数据自动选择
- **最大迭代次数:**设置线性回归模型中求最优解的迭代次数,最好用默认值,因为过少容易导致模型准确度低,过多容易导致系统运行效率太低。
- **收敛条件:**设置模型收敛条件,符合条件,迭代计算将停止。一般用默认值。
- **使用标准化数据:**如果自变量数据量纲差异大,则勾选此项。
- **名义值最大类别数:**在模型训练期间,名义型字段的取值不能超过这里所定义的最大类别数,取值过多的话容易造成系统运算效率低,默认值5
- 缺失值: 模型数据中,若有缺失值,模型可选择终止执行,停止建模,或者模型仅使用完整记录进行建模。
- **散点图:**选取生成散点图的记录,起始行以及总行数
- 确认配置后,执行并查看视图,以及预测表
- 线性回归结果:模型中线性回归系数,方差分析,R方
- 散点图:展示自变量于目标变量之间的关系
- 变量重要性图:显示各个参与建模字段对目标的影响程度
- PMML模型\PMML导出
- 预测数据表
线性回归结果
显示估计的系数和模型评估结果。
散点图
散点图用于展示输入数据点和回归线。Y轴为目标字段,X轴为其中一个数值型自变量。 注意:如果有多个自变量,此视图只是一个近似的图。 图中将没有显示在视图中的变量设为平均水平,因此,这个视图在仅有少数自变量时比较准确。
案例如下:
以1952-1988年中国农业实际国民收入指数序列为数据创建如下工作流:

连接线性回归模型配置节点如下:
执行结果如下:
利用表节点输出结果如下:


逻辑回归
节点用途: 测量一个分类型目标变量与一个或多个自变量之间的关系。
目标字段可以是二分类,也可以是多分类的;自变量可以是数值型的,也可以是分类型的,当自变量为分类型时将转化为多个哑变量进行分析。 逻辑回归可用于研究影响目标字段的因素的重要性、预测和判别。
在流行病学中有着广泛的应用,如探索某疾病的危险因素,根据危险因素预测该疾病发生的概率。
前提条件:
- 该节点的目标字段必须为名义型字段。
- 使用该节点前需要先用一个类型节点指定参与分析的字段的角色,目标字段的角色定义为目标,其他自变量的角色定义为输入。在配置界面选择目标字段的其中一个类别作为参考类别(该类别不参与建模,但可以通过其他类别计算得出该类的预测结果)。
节点输出:
- 节点可以输出模型的参数估计结果,以及PMML格式的模型。
- 在该节点之后配合使用回归预测器节点,可以得出目标字段的预测结果以及目标字段每个类别的预测概率。
- 通过分类评估节点还可以评估预测结果的准确度。
操作方法:
- 在配置对话框中可以指定汇总方式,如下图:

图5-1-2-1
配置选项卡:
说明:
- **模型:**定义模型中识别目标变量分类方式
- 自动:模型自动识别目标变量的分类数;
- 二分类目标:用户指定目标变量是二分类的;
- 多分类目标:用户指定目标变量是多分类的;
- **正则化方法:**预防机器学习过程中,因模型参数过多,导致过拟合现象。SM中,正则化方法综合了Lasso回归和Ridge回归,这里设定的数值用于调节这两种方法之间的比例。
- **正则化系数:**允许模型在拟合过程中存在偏差的程度,系数越大,对模型拟合的约束越松。
- **模型中包含常数:**设置回归模型中是否需要有截距
- 最优算法:求最优解时所用的算法,可以选择正规方程或L-BFGS(变量数量多数据量大时建议使用),也可由节点根据数据自动选择
- **最大迭代次数:**设置线性回归模型中求最优解的迭代次数,最好用默认值,因为过少容易导致模型准确度低,过多容易导致系统运行效率太低。
- **收敛条件:**设置模型收敛条件,符合条件,迭代计算将停止。一般用默认值。
- **使用标准化数据:**如果自变量数据量纲差异大,则勾选此项。
- **名义值最大类别数:**在模型训练期间,名义型字段的取值不能超过这里所定义的最大类别数,取值过多的话容易造成系统运算效率低,默认值5
- **追加所有概率:**在输出的预测数据中增加字段,输出模型预测的每条记录的流失/不流失的概率
- $LP_0表示模型预测的该记录不流失的概率
- $LP_1表示模型预测的该记录流失的概率
- 其中$LP_0+$LP_1=1
- 默认勾选
- 缺失值: 模型数据中,若有缺失值,模型可选择终止执行,停止建模,或者模型仅使用完整记录进行建模。
- 确认配置后,执行并查看视图,以及预测表
- 变量重要性图:显示各个参与建模字段对目标的影响程度
- **逻辑回归结果:**展示预测模型中每个自变量的系数
- PMML模型\PMML导出
- 预测数据表
案例如下:
在软件自带案例“客户流失分析模型”中使用了该节点,工作流如下:

该节点配置如图5-1-2-1。
执行结果如下:



朴素贝叶斯
**节点用途:**使用给定的训练数据创建一个贝叶斯模型, 进行分类预测。 它为名义型字段计算其所有值的记录数,为数值型字段计算高斯分布概率。
前提条件:
- 该节点的目标字段必须为名义型字段。
- 使用该节点前需要先用一个类型节点指定参与分析的字段的角色,目标字段的角色定义为目标,其他自变量的角色定义为输入。在配置界面选择目标字段的其中一个类别作为参考类别(该类别不参与建模,但可以通过其他类别计算得出该类的预测结果)。
节点输出:
- 节点可以输出模型的参数估计结果,以及PMML格式的模型。
- 在该节点之后配合使用分类预测器节点,可以得出目标字段的预测结果以及目标字段每个类别的预测概率。
- 通过分类评估节点还可以评估预测结果的准确度。
操作方法:
- 在配置对话框中可以指定汇总方式,如下图:

图5-1-3-1
配置选项卡:
说明:
- **平滑指数:**朴素贝叶斯模型进行平滑时所采用的参数lambda,默认为0(没进行平滑)
- **名义值最大类别数:**在模型训练期间,名义型字段的取值不能超过这里所定义的最大类别数,取值过多的话容易造成系统运算效率低,默认值为20
- **追加所有概率:**在输出的预测数据中增加字段,输出模型预测的每条记录的流失/不流失的概率
- $NBP_0表示模型预测的该记录不流失的概率
- $NBP_1表示模型预测的该记录流失的概率
- 其中$NBP_0+$NBP_1=1
- 默认勾选
- 确认执行后,查看输出结果:
- 变量重要性图:显示各个参与建模字段对目标的影响程度
- 统计表:展示各个参与建模字段的基本统计量
- PMML模型\PMML导出
- 预测数据表
案例如下:
将朴素贝叶斯算法应用到信用评分模型,该案例的工作流分为三个部分:数据理解与探索、建模和应用,该部分的工作流图如下:

其他节点不在这里赘述了,本节点配置如图5-1-3-1,执行后查看结果:
执行结果:
- 输入变量的重要性,如下图所示

- 输入变量统计表,即在预测结果的各个类别下,输入变量的统计指标。

- 预测数据,也就是针对每条记录的预测结果和针对预测结果的概率,如果在设置中已勾选,还会输出模型预测的每条记录的流失/不流失的概率。

- 输出PMML模型结果并提供PMML模型导出功能,可在其他节点或者其他软件中调用已建好的模型。
一般,朴素贝叶斯模型生成后,使用评估节点,进行评估。结果如下图所示,对于测试集的预测准确度达到76.3%,是个不错的预测水平。

图 朴素贝叶斯算法评估结果图
还可以针对流失用户和非流失用户分别评估模型结果,以进一步保证模型的有效性。
分类预测器
**节点用途:**使用一个训练好的分类预测模型对新数据进行预测。
输入模型,输入数据,默认配置执行,就可以查看数据的分类结果。
C4.5
节点用途: 该节点包含可以进行分类预测的决策树算法。决策树(Decision Tree)是在已知各种情况发生概率的基础上,通过构成决策树来求取净现值的期望值大于等于零的概率,评价项目风险,判断其可行性的决策分析方法,是直观运用概率分析的一种图解法。由于这种决策分支画成图形很像一棵树的枝干,故称决策树。
说明:
- 目标字段必须是名义型字段。
- 输入字段可以是名义型的,也可以是数值型的。
- 数值型字段通常进行二元分割, 根据确定的分割点将数据分成两个分区。
- 名义型字段可以是二元分割也可以是多元分割,甚至是每一个名义值为一个分割点
- 该模型该提供了两个计算分割质量的算法
- 包含减少决策树大小,提升预测精度的后修剪算法,该算法是基于最小描述长度原则。
这个算法可以基于多处理器或者开启多个线程进行并行执行,这样可以提高性能。
节点输出:
- 节点可以输出模型的分类视图,分类规则,以及PMML格式的模型。
- 在该节点之后配合使用分类预测器节点,可以得出目标字段的预测结果以及目标字段每个类别的预测概率。
- 通过分类评估节点还可以评估预测结果的准确度。
操作方法:
- 在配置对话框中可以指定汇总方式,如下图:

图5-1-5-1
配置选项卡:
说明:
- **树的最大深度:**定义树的最大节点数
- **最小信息增益:**分裂时最小的信息增益,如果小于此阈值则停止分裂
- **分支最小记录数:**为了防止分支中包含过少的记录,防止由于噪声造成的过度拟合,确定每个子节点中所包含的最小记录数,如果记录数小于或等于该值,则树不再进一步生长。这相当于预修剪。
- **连续字段最大分箱数:**基于连续性字段分裂时需要将其分箱转化为分类字段,为了控制执行成本和效率,需要限制连续性字段的最大
- **名义值最大类别数:**在模型训练期间,名义型字段的取值不能超过这里所定义的最大类别数,取值过多的话容易造成系统运算效率低,默认值10
- 追加所有概率:在输出的预测数据中增加预测字段,表示每条记录的属于每种分类的概率和最终预测的分类和相应的概率。默认勾选
- 缺失值: 模型数据中,若有缺失值,模型可选择终止执行,停止建模,或者模型仅使用完整记录进行建模。
- **固定随机种子:**如果希望每次执行的结果不变,勾选此选项。如果不勾选,每次执行会使用一个新的随机种子,多次执行的结果可能有所不同。
- 确认配置后,执行并查看视图,以及预测表
- **决策树视图:**以视图形式显示决策树的分类,图中加减号可以进行收缩分支节点
- **决策树规则:**以文件目录的形式显示决策树的分类
- 变量重要性图:显示各个参与建模字段对目标的影响程度
- PMML模型\PMML导出
案例如下:
该节点的使用在软件中自带案例“信用评价模型”案例中的工作流如下:

该节点配置如图5-1-5-1,设置为默认值。
执行结果如下:

预测数据中显示了每条记录的分类预测值,同时输出分类规则,可使用分类预测器节点,将决策树的规则用来对同源但未知分类的数据进行预测。
LSVM
节点用途: 该节点使用输入的数据建立支持向量机训练模型。它支持许多不同的内核(双曲正切函数 、多项式和径向基函数)。支持向量机训练模型支持分类型字段(通过计算每一个类值和其余类值的双曲正切函数),不过这会增加执行时间。
操作方法:
- 在配置对话框,如下图:

图5-1-6-1
配置选项卡:
说明:
- **正则化系数:**允许模型在拟合过程中存在偏差的程度,系数越大,对模型拟合的约束越松。
- **模型中包含常数:**模型中含有固定截距
- **最大迭代次数:**设置线性回归模型中求最优解的迭代次数,最好用默认值,因为过少容易导致模型准确度低,过多容易导致系统运行效率太低。
- **收敛条件:**设置模型收敛条件,符合条件,迭代计算将停止。一般用默认值。
- **使用标准化数据:**如果自变量数据量纲差异大,则勾选此项。
- 追加所有概率:在输出的预测数据中增加预测字段,表示每条记录的属于每种分类的概率和最终预测的分类和相应的概率。默认勾选
- 缺失值: 模型数据中,若有缺失值,模型可选择终止执行,停止建模,或者模型仅使用完整记录进行建模。
- 确认配置后,执行并查看视图,以及预测表
- 变量重要性图:显示各个参与建模字段对目标的影响程度
- PMML模型\PMML导出
- 预测数据表
案例如下:
以“信用卡违约数据”建立如下工作流:

节点配置如图5-1-6-1,确认配置后,执行节点。
结果如下图,通过LSVM算法预测,对客户进行是否违约预测:

多项式回归
节点用途: 与线性回归一样,多项式回归模型可以研究一个或多个自变量对一个目标字段的影响重要程度,或者对目标字段进行预测。不同的是,多项式回归用来研究非线性关系,如种植密集度对粮食产量的影响。
该节点的目标字段必须为数值型字段。使用该节点前需要先用一个类型节点指定参与分析的字段的角色,目标字段的角色定义为目标,其他自变量的角色定义为输入。在配置界面指定多项式的最大阶数,系统默认执行二次多项式。 通过训练, 估计得出使得离差平方和最小的系数。节点可以输出预测结果、模型的参数估计以及PMML格式的模型,在有新的数据输入时,可以使用得到的PMML模型配合使用分类预测器节点对新的输入的目标字段进行预测。通过评估节点还可以评估预测效果。
操作方法:
- 在配置对话框,如下图:

图5-1-7-1
配置选项卡:
说明:
- **多项式最大阶:**多项式回归模型的最高阶数
- **散点图:**用于作散点图的数据,选取总样本的前多少行数
- 缺失值: 模型数据中,若有缺失值,模型可选择终止执行,停止建模,或者模型仅使用完整记录进行建模。
- 确认配置后,执行并查看视图,以及预测表
- **多项式回归结果:**多项式回归预测计算后的值
- **散点图:**用图显示数据的分布
- 变量重要性图:显示各个参与建模字段对目标的影响程度
- PMML模型\PMML导出
- **系数与统计量:**显示回归模型中各参数的回归系数
- 预测数据
随机森林
节点用途: 随机森林利用随机的方式将许多决策树组合成一个森林,每个决策树在分类的时候投票决定测试样本的最终类别
随机森林同时训练多个决策树,模型的结果由多个决策树基于投票策略决定。相比与决策树,随机森林模型更为稳定。
使用条件:
- 该节点的目标字段必须为名义型字段。
- 使用该节点前需要先用一个类型节点指定参与分析的字段的角色,目标字段的角色定义为目标,其他自变量的角色定义为输入。
操作方法:
- 在配置对话框,如下图:

图5-1-8-1
配置选项卡:
说明:
- 树棵数: 最终决策树的个数
- **树的最大深度:**定义树的最大节点数
- **最小信息增益:**分裂时最小的信息增益,如果小于此阈值则停止分裂
- **分支最小记录数:**为了防止分支中包含过少的记录,防止由于噪声造成的过度拟合,确定每个子节点中所包含的最小记录数,如果记录数小于或等于该值,则树不再进一步生长。这相当于预修剪。
- **连续字段最大分箱数:**基于连续性字段分裂时需要将其分箱转化为分类字段,为了控制执行成本和效率,需要限制连续性字段的最大
- **名义值最大类别数:**在模型训练期间,名义型字段的取值不能超过这里所定义的最大类别数,取值过多的话容易造成系统运算效率低,默认值10
- 追加所有概率:在输出的预测数据中增加预测字段,表示每条记录的属于每种分类的概率和最终预测的分类和相应的概率。默认勾选
- 缺失值: 模型数据中,若有缺失值,模型可选择终止执行,停止建模,或者模型仅使用完整记录进行建模。
- **固定随机种子:**如果希望每次执行的结果不变,勾选此选项。如果不勾选,每次执行会使用一个新的随机种子,多次执行的结果可能有所不同。
- **每棵树使用样本量占比:**每棵树建立时所用的样本量比例设定
- **每棵树节点划分时输入特征的使用策略:**默认Auto
- 确认配置后,执行并查看视图,以及预测表
模型混合
节点用途: 模型混合节点可结合使用两个或多个模型块,这样所获得的预测会比通过任意一个模型获得的预测更为准确。通过结合多个模型的预测,可以避免单个模型的局限性,从而使整体准确性更高。一般情况下,以这种方式组合的模型所得的结果不但可以与使用单个模型所得的最佳结果相媲美,而且结果通常会更理想。
节点配置:

配置选项卡:
说明:
- **混合方法:**采取多个模糊预测时,设定模型混合的方式
- 随机选择: 采取随机的方式选择预测模型
- **最高置信度:**选取置信度最高的模型作为最终的预测模型
- **过滤出整体模型生成的字段:**选择是否输出模型建模过程中所生成字段
KNN
**节点用途:**KNN即最近相邻元素模型。基于最近相邻元素算法对测试数据进行分类预测。底层算法使用KD树,应该表现出理想的性能,然而,这种类型的分类器只适合几千到一万左右的训练实例。执行中可以用所有数值型字段和欧式距离,而测试数据中所有的非数值型字段都将原样的出现在输出表中
节点配置:

配置选项卡:
说明:
- **最近邻值数量(k) :**选择生成一个新实例的最近邻值数量
- **邻值距离加权:**使用邻近距离进行加权。距离越近的近邻对结果影响越大。然而,只有考虑K近邻
- **追加概率:**如果启用此选项,将会追加概率到输出表中。
- 追加所有概率:在输出的预测数据中增加预测字段,表示每条记录的属于每种分类的概率和最终预测的分类和相应的概率。默认勾选
- **顶层树样本总量:**设定顶层树的大小,所含样本量的上限
- **顶层树子节点数量:**设定顶层树的大小,顶层树所含子节点的上限
- **分布式子树子节点数量:**设定各分布子树所含节点数量的上限
- **溢出树返回度量树的占比:**设定树溢出时的返回比例
- **使用随机种子:**如果希望每次执行的结果不变,勾选此选项。如果不勾选,每次执行会使用一个新的随机种子,多次执行的结果可能有所不同
- **名义值最大类别数:**在模型训练期间,名义型字段的取值不能超过这里所定义的最大类别数,取值过多的话容易造成系统运算效率低,默认值100
贝叶斯网络
**节点用途:**贝叶斯网络是基于贝叶斯决策理论的分类算法。它假定变量之间存在相关性,并采用网络的方式描述变量之间的关系。
使用条件:
- 该节点的目标字段必须为名义型字段
- 使用该节点前需要先用一个类型节点指定参与分析的字段的角色,目标字段的角色定义为目标,其他自变量的角色定义为输入。
节点配置:

配置选项卡:
说明:
- **ADTree:**用于加速参数求解,需要使用更多的内存
- **局部搜索:**如果不选择,将采用全局搜索算法,模型训练需要更多的时间
- **搜索算法:**搜索算法发现贝叶斯网络结构
- **评估方法:**评估网络结构好坏的方法
- **得分函数:**评估基准
- **最大父节点个数:**网络结构中最大的父节点个数。
- **初始权重:**设为默认值
- **使用随机种子:**如果希望每次执行的结果不变,勾选此选项。如果不勾选,每次执行会使用一个新的随机种子,多次执行的结果可能有所不同
高斯过程回归
**节点用途:**一种常用的监督学习方法,旨在解决*回归问题*和*概率分类问题*
使用条件:
- 该节点的目标字段必须为数值型字段。
- 使用该节点前需要先用一个类型节点指定参与分析的字段的角色,目标字段的角色定义为目标,其他自变量的角色定义为输入。
节点配置:

配置选项卡:
说明:
- **噪声等级:**高斯函数中的噪声等级,噪声数据的干扰程度
- **正则化方法:**包含归一化和标准化方法,如果选择无,则不正规化
- **核函数:**选择一个核函数,一般设为默认
- **缓存:**占用缓存大小
- **指数:**设为默认值
- **使用静态种子:**如果希望每次执行的结果不变,勾选此选项。如果不勾选,每次执行会使用一个新的随机种子,多次执行的结果可能有所不同
M5P回归树
节点用途: M5P回归树综合决策树和回归算法,用于处理目标字段为连续型的业务问题。
使用条件:
- 该节点的目标字段必须为数值型字段。
- 使用该节点前需要先用一个类型节点指定参与分析的字段的角色,目标字段的角色定义为目标,其他自变量的角色定义为输入
节点配置:

配置选项卡:
说明:
- **剪枝:**是否剪枝
- 平滑处理: 是否对数据进行平滑操作
- **构建回归树:**设定是否构建回归树
- **叶子最小样本数:**设定叶子节点所含样本量的下限
- **使用静态种子:**如果希望每次执行的结果不变,勾选此选项。如果不勾选,每次执行会使用一个新的随机种子,多次执行的结果可能有所不同
关联规则
关联规则
**节点用途:**该节点是一种基于Apriori算法的关联分析模型。
Apriori 节点会发现数据中的关联规则。关联规则是下列形式的语句:如果 条件 则 结果。 例如,”if 客户购买剃须刀和剃后产品,then 该客户还会购买剃须泡沫,并且置信度为 80%。” Apriori 从数据中提取一系列规则,提取的规则带有出现频率最高的信息内容。
使用要求: 要创建 Apriori 规则集,您需要一个或多个输入字段和一个或多个目标字段。 输入字段和输出字段(角色为输入、目标或两者的字段)必须是符号型字段。角色为无的字段将被忽略。 执行节点之前字段类型必须完全实例化。数据可以是表格格式,也可以是事务格式。
**算法强度:**对于较大的问题,Apriori通常处理速度快。它对于可以包含的规则数也没有任何限制,可以处理最多带有 32 个预条件的规则。 Apriori 提供了五种不同的训练方法,因此将数据挖掘方法与当前问题相匹配时可以实现更强的灵活性。
操作方法:
- 在配置对话框,如下图:

配置选项卡:
说明:
- 对象ID:如输入数据是以单项物品购买为记录的数据格式,选择对象ID(顾客的唯一识别码)
- 物品: 用户单次购买的物品名称
- 项列: 如输入数据是以事务为条目的数据格式,选择用于进行关联规则分析的事务字段
- 算法:系统默认算法Aprior
- 建议在数据集较小时,选择Aprior
- 建议在数据集较大时, 选择FPGrowth
- 最低条件支持度: 产生频繁项集时的支持度的阈值
- 最小规则置信度: 指在剪枝时置信度的阈值。置信度低于该阈值的规则会被剪枝
- 最大前项数: 关联规则X->Y中,X包含的最大宽度
案例如下:
该业务流程包括,对初始数据进行处理,得到可以用于关联分析的事务数据,剔除掉单次购买且仅购买一种商品的购买记录后。连接关联规则节点进行分析,并对分析出的规则通过“置信度*支持度”的方式进行质量评估,最后经排序后选择高质量的关联规则。其整体流程图,如下。

图5.2.1.1购物篮分析工作流图
第一步:产生用来生成关联规则的数据。关联规则节点可以接受两种数据形式:
- 以单项物品购买为记录的原始数据,数据中必须包括用户的唯一识别代码,如图5.2.1.2所示的“卡号”。

图5.2.1.2
- 以事务为条目的数据格式,可以通过原始数据汇总(以用户唯一识别代码分组,汇总“物品”字段的列表)得到,数据格式如图图5.2.1.3所示,其中“列表(物品)”条目为事务数据; 图XX关联规则流程中以此种数据为例。

图5.2.1.3 购物篮数据集
第二步:对数据进行处理,需要删除原数据中单次购买且只购买一件物品的用户记录。
第三步:将处理好的数据连接到关联规则节点,假定原数据为第二种格式,进行节点配置,配置完成后可以执行节点,输出结果。其配置图,如图5.2.1.4所示。

图5.2.1.4 Apriori节点配置图
在完成了配置后,可以对节点进行执行,将输出训练规则,包括前后项及支持度和每条规则的置信度。如下图所示:

图5.2.1.5
第四步:在输出训练表中,通过派生节点生成规则质量字段代表关联规则的质量。
规则质量=$置信度$ * $支持度$
第五步:对规则质量进行排序,查看高质量的规则。

图5.2.1.6关联分析输出数据集图
基于生成的规则,我们知道如果客户购买啤酒和蔬菜罐头的话,那么他有87.4%的可能性还会购买冻肉。同理还可以得到更多关于关联购买的规则。
子集匹配
**节点用途:**该节点用于寻找第一个输入表中与第二个输入表中匹配的所有子集。输出表中成对的输出子集和集。可以用这个节点寻找与给定项集匹配的所有事务。
**匹配方式:**模糊匹配, 至少有一个项集与子集匹配。

配置选项卡:
说明:
- **子集字段:**包含要寻找的子集的字段。
- **ID字段:**搜索集的ID。
- **集字段:**包含搜索集的字段。
- 为匹配集合添加字段: 如果选中此项,将在输出中追加集字段,将会为每一个匹配的集创建一条新的记录。
- 最大不匹配数: 允许的最大的不匹配数。默认值为0。
项集搜索
**节点用途:**该节点提供了不同的算法去搜索频繁项集。集成的算法包括:Apriori、FP生长、RElim、SaM、JIM。
- **Apriori:**Apriori算法对其进行子集格的广度优先搜索。这是一个很快实现,使用前缀树,组织项集计数。
- **FP生长:**该算法表示将事务数据库作为前缀树,它通过将节点组织到列表中并指向同一项目来提升。 该搜索是通过投射前缀树、递归地运行和修剪原始树进行。
- **RElim:**递归消除算法是受FP生长算法的启发,但是它没有前缀树或其他复杂的数据结构。 该算法的主要优势不是因为它的速度,而是其结构简单。基本上,所有的工作都是在一个仅有几行代码的递归函数中完成。
- **SaM:**分裂合并算法结合深度优先遍历一个水平交易表示的子集格。该算法的优势也是因为其简单的结构,它只使用一个简单的数组作为唯一的数据结构。
- **JIM:**它使用Eclat算法的扩展寻找Jaccard项集。类似于频繁项集的挖掘(试图发现事务数据库中支持度超过用户指定阈值(最小支持度)的项集), Jaccard项集的Jaccard指数涵盖了用户指定的阈值。这一措施比简单支持度更好评估项目的关联强度。

配置选项卡:
说明:
- 对象ID:如输入数据是以单项物品购买为记录的数据格式,选择对象ID(顾客的唯一识别码)
- 物品: 用户单次购买的物品名称
- 项列: 如输入数据是以事务为条目的数据格式,选择用于进行关联规则分析的事务字段
- 算法:系统默认算法Aprior
- 建议在数据集较小时,选择Aprior
- 建议在数据集较大时, 选择FPGrowth
- **最小集大小:**设置项集的最小大小
- **最低支持度:**指定在规则集中保留规则的支持度标准。支持度指的是训练数据中条件(规则中的”if”部分)为真的记录的百分比。
案例如下:
我们使用案例“41购物篮分析”中的数据建立如下工作流:

配置节点如下图:

执行结果如下图:

聚类分析
DBScan
节点用途: 聚类的一种算法。
DBScan是一个比较有代表性的基于密度的聚类算法。与划分和层次聚类方法不同,本算法将簇定义为密度相连的点的最大集合,能够把具有足够高密度的区域划分为簇,并可在噪声的空间数据库中发现任意形状的聚类。
但是,在配置算法时,同样需要预先设定每个类别的最小样本点的个数和点之间的邻域半径。
DBSCAN聚类算法步骤:
- 首先在数据库中随机抽取一个点作为一个类
- 如果抽取的点是核心点,则找出所有从该点密度可达的对象,形成一个类;
- 如果抽取的点是边界点,则跳出本次循环,寻找下一个点
- 重复第二三步,直到所有的点都被处理。
操作方法:
- 配置节点,如下图:

配置选项卡:
说明:
- **距离阈值:**是否归为同一类的距离阈值
- 类最小个数:类簇中最小成员个数
- 距离类型:计算样本距离是采用的样本函数
- **固定随机种子:**如果希望每次执行的结果不变,则勾选此项。如果不勾选,每次执行会使用一个新的随机种子,多次执行的结果可能有所不同。
K-Means
节点用途: 该节点根据预定义的聚类数对输入数据进行聚类。每一个数据向量只归属一个类。当中心不在变化时算法会终止执行。
说明: 聚类算法采用欧氏距离对选中的属性进行距离计算。该节点不会数据进行标准化,如果需要,可以先使用标准化节点进行预处理。
k-means 算法基本步骤:
- 从 n个数据对象任意选择 k 个对象作为初始聚类中心;
- 根据每个聚类对象的均值(中心对象),计算每个对象与这些中心对象的距离,并根据最小距离重新对相应对象进行划分;
- 重新计算每个(有变化)聚类的均值(中心对象);
- 计算标准测度函数,当满足一定条件,如函数收敛时,则算法终止;如果条件不满足则回到步骤
操作方法:
- 配置节点,如下图:

图5-2-2-1
配置选项卡:
说明:
- 聚类数:由用户自行定义的聚类结果输出的簇数,默认值为5.
- 聚类标签: 聚类后生成的聚类簇字段的取值,可以选择数值型,字符串,并可以自定义字符串型标签的前缀,比如“cluster”,“组”
- 生成距离字段:如勾选,则输出表中会增加衡量每条记录到所在簇中心的距离的字段
- **最大迭代:**整个聚类过程中,迭代部分最多重复次数,防止在局部陷入循环,默认为20次
- 收敛条件:目标函数的变化小于用户设定的收敛条件时即停止迭代,默认值为0.001
- 初始化算法: 选择初始簇中心的方法,可以选择Random(随机选择初始簇中心)或者K-Means-Parallel聚类数
- **固定随机种子:**如果希望每次执行的结果不变,勾选此选项。如果不勾选,每次执行会使用一个新的随机种子,多次执行的结果可能有所不同。
- **名义值最大类别数:**在模型训练期间,名义型字段的取值不能超过这里所定义的最大类别数,取值过多的话容易造成系统运算效率低,默认值5。
- 缺失值: 模型数据中,若有缺失值,模型可选择终止执行,停止建模,或者模型仅使用完整记录进行建模。
- 确认配置后,执行并查看视图,以及预测表
- 聚类概述图:显示聚类分布,聚类大小,聚类质量
- **聚类单元视图:**显示每个类别特征指标的分布
- 聚类视图: 显示每个类中的样本数,样本每个字段的均值。
- PMML模型\PMML导出
- **输出表:**输出原始数据,以及分类信息
案例如下:
在软件自带“媒体分级”案例中使用了该节点,工作流如下:

该节点配置如图5-2-2-1,确认后执行。
执行结果用表输出为:


K-Medoids
节点用途: 聚类算法,K-Medoids算法与K-Means算法非常相似,该算法同样基于各个点之间的距离进行聚类,也需要用户提前指定类别数。
K-Medoids算法基本步骤:
- 随机选择K个初始点作为初始质心
- 计算各个点到质心的距离,将点的类划分为距离他最近的质心,形成K个类
- 根据分类好的类,在每个类内重新计算质心,计算方法如下:
- 计算每个类内所有样本点之间的距离和绝对误差;
- 选出使每个类绝对误差最小的样本点作为质心
- 重复迭代2-3步直到满足迭代次数或误差不再变化。
可以看出,K-Medoids和K-Means的主要区别在于质心的选择,K-Means的质心是类内样本点的均值,可能不是一个实际的样本点,而K-Medoids是以某个样本点为质心的。
K-Medoids的优缺点:
- 在计算质心时,由于要计算类内样本点两两之间的距离,因此计算的复杂度为O(n^2),远远高于K-MeansO(n)
- 由于计算质心时没有运用均值,K-Medoids的稳健性很好,在样本量较少或者存在极值时对质心的影响非常小。
综上所述,K-Medoids更适用于样本量小,且样本分布分散的情况。
操作方法:
- 配置节点,如下图:

图5-2-3-1
配置选项卡:
说明:
- **距离函数:**聚类过程中计算样本之间距离所用函数,默认为“欧式距离”
- 聚类数:由用户自行定义的聚类结果输出的簇数,默认值为3.
- 块大小:算法每次要考虑的行数。该项对输出结果没有影响,只影响运行速度。指定的值越大执行越快,但也越耗内存。
- **迭代次数:**整个聚类过程中,迭代部分最多重复次数,防止在局部陷入循环,默认为20次
- **固定随机种子:**如果希望每次执行的结果不变,则勾选此项。如果不勾选,每次执行会使用一个新的随机种子,多次执行的结果可能有所不同。
- 输出相对中心点距离:勾选此项,将会在输出表中增加多个表示每条记录到每个中心点的距离字段。值越小则与该中心点的相似性越大。有多少个聚类数,就将多生成几个字段
- **禁止非对称距离:**勾选此项,当输入距离向量被标记为非对称时该节点将会执行失败。由于交替最小,不对称的距离可能会导致无限循环。默认勾选。
- 确认配置后,执行并查看视图,以及预测表
- 聚类概述图:显示聚类分布,聚类大小,聚类质量
- **聚类单元视图:**显示每个类别特征指标的分布
- 聚类视图: 显示每个类中的样本数,样本每个字段的均值。
- PMML模型\PMML导出
- **输出表:**输出原始数据,以及分类信息
模糊C均值
**节点用途:**聚类的一种算法。模糊C均值算法称为软划分,是基于模糊数学的概念发展起来的,在这类算法中,每个样本xi不再只能属于一种类别,而是有对应的隶属度数组,数组里的每一个元素代表xi属于所有C类中的第j类的程度uij。而该样本的隶属度数组中的总值等于1,也就是 =1。
模糊C均值算法步骤:
模糊C均值算法的实现步骤与K-Means的基本相同,其最主要的差别在于,计算质心时使用的以各个样本对该类的隶属度对样本值进行加权
模糊C均值算法的实现过程如下:
- 先随机指定每个数据到各个类别的隶属度;
- 计算每个类的质心,也就是各个数据在每个类别中以隶属度为权重的加权平均,并计算每个数据到质心的距离;
- 根据更新的质心重新估计隶属度;
- 重复2-3步,直至误差平方和不再减小或者质心不再发生变化
操作方法:
- 配置节点,如下图:

配置选项卡:
说明:
- 聚类数:由用户自行定义的聚类结果输出的簇数,默认值为5.
- **最大迭代:**整个聚类过程中,迭代部分最多重复次数,防止在局部陷入循环,默认为20次
- 模糊化:显示允许重叠的聚类数。
- **固定随机种子:**如果希望每次执行的结果不变,勾选此选项。如果不勾选,每次执行会使用一个新的随机种子,多次执行的结果可能有所不同。
- **包含噪声类:**模型计算中是否包含噪声类数据。
- **设置差值:**每个数据点到噪声类中心之间的固定距离
- **自动设置差值并指定常数:**在每次迭代中,基于平均距离更新Delta的值。然而,必须根据类的形状设置lambda的参数值
- **在内存中运行:**如果选中此项,将会在内存中进行聚类计算,提高运行效率
- **计算质量度量:**这里指定是否为聚类计算质量度量值。当数据较大时,会消耗大量的内存和时间
- 确认配置后,执行并查看视图,以及输出结果
- 聚类概述图:显示聚类分布,聚类大小,聚类质量
- **聚类单元视图:**显示每个类别特征指标的分布
- 聚类视图: 显示每个类中的样本数,样本每个字段的均值。
- PMML模型\PMML导出
- **输出表:**输出原始数据,以及分类信息
异常
节点用途: 异常节点用于识别数据中的离群点或异常观测点。
该节点通过聚类分析的手段进行异常判断,也就是将输入数据中的记录分成2个(或多个)类,然后计算每个类中点到类中心的距离,离类中心越远的点就越异常,这个是异常节点进行异常判断的基本思想。
为了描述每条记录的异常程度,定义了一个变量,即“异常指数”,这个变量的值,为点到类中心的距离除以该类中所有点到类中心距离的平均值。这个节点通过计算得到每条记录的异常指数,然后通过异常指数的大小来判断该条记录是否异常。
操作方法:
- 配置节点,如下图:

配置选项卡:
说明:
- **异常判断模式:**异常判断的模式有两种:
- **异常记录百分比:**设置一个阈值,表示标记为异常的记录数占总的记录数的百分比
- **异常记录数:**设置一个阈值,表示在异常表中标记为异常记录的数量
- **要报告的异常字段数 :**指定要报告的异常字段数,报告中说明记录被标记为异常的原因。将报告最异常字段,最异常字段指的是与记录所属聚类的字段标准偏差最大的字段。
- **调整系数:**用于平衡在计算距离时赋予连续(数字范围)和分类字段的相对权重的数值。值越大,连续字段的影响也越大,它必须为非 0 值。
- **自动计算对等数组:**用于快速分析大量可能的解决方案,以选择异常判断时的最佳聚类数。可通过设置对等数组的最大值和最小值,来扩大或缩小聚类数范围。较大的值可使系统在更大范围内搜索可能的解决方案,但是,消耗的处理时间也随之增加。
- **指定对等组数 :**人为指定异常分析时聚类的数量,一般而言,选中此选项可提高性能。
- **噪声水平:**噪声数据的干扰程度
- **噪声比率:**噪声数据数量比例的设定
GMM
**节点用途:**聚类的一种算法。
高斯混合模型(Gaussian Mixture Model, GMM)是一种概率式的聚类方法。假设所有的数据样本服从混合高斯分布,那么只要根据数据推出 GMM 的概率分布来就可以了,然后GMM的K个成分实际上对应K个分类。对于一个点xi,它属于第k个聚类中心的可能性wik是一个属于0到1之间的概率值,聚类结果会将xi分配到wik最大的类别,k=1,...,K。
高斯混合模型算法基本步骤:
一般求解高斯混合模型都用的是EM算法,估计高斯混合分布的先验参数,然后计算每个样本点属于每一类别的后验分布,将其判定为概率值最大的那一类。
EM算法的实现过程如下:
- 初始化参数μi,σi和wi,i,2,...,K;
- E-步:根据上一步得到的参数估计,计算计算每个样本点属于每一类别的后验概率;
- M-步:根据上一步得到的概率值,应用极大似然法对高斯混合分布的参数重新进行估计;
- 重复第二三步,直到达到规定的最大迭代次数或者收敛标准。
GMM和K-Means的关系
K-Means算法可以被视为高斯混合模型的一种特殊形式。假设在高斯混合模型中,各个成分的方差一致,且每个样本仅仅指向一个成分时,高斯混合聚类与K-Means算法一致。
操作方法:
- 配置节点,如下图:

配置选项卡:
说明:
- 聚类数:由用户自行定义的聚类结果输出的簇数,默认值为5.
- 聚类标签: 聚类后生成的聚类簇字段的取值,可以选择数值型,字符串,并可以自定义字符串型标签的前缀,比如“cluster”,“组”
- 生成距离字段:如勾选,则输出表中会增加衡量每条记录到所在簇中心的距离的字段
- **最大迭代:**整个聚类过程中,迭代部分最多重复次数,防止在局部陷入循环,默认为20次
- 收敛条件:目标函数的变化小于用户设定的收敛条件时即停止迭代,默认值为0.001
- **固定随机种子:**如果希望每次执行的结果不变,勾选此选项。如果不勾选,每次执行会使用一个新的随机种子,多次执行的结果可能有所不同。
- **名义值最大类别数:**在模型训练期间,名义型字段的取值不能超过这里所定义的最大类别数,取值过多的话容易造成系统运算效率低,默认值5。
- 缺失值: 模型数据中,若有缺失值,模型可选择终止执行,停止建模,或者模型仅使用完整记录进行建模。
- 确认配置后,执行并查看视图,以及输出结果
- 聚类概述图:显示聚类分布,聚类大小,聚类质量
- **聚类单元视图:**显示每个类别特征指标的分布
- 聚类视图: 显示每个类中的样本数,样本每个字段的均值。
- PMML模型\PMML导出
- **输出表:**输出原始数据,以及分类信息
两步聚类
节点用途: 两步聚类是基于BIRCH层次聚类的改进算法。
相对于其他的聚类算法,两步聚类更适合超大样本的情况,而且能处理输入变量同时包括分类型和数值型的情况,而两步骤聚类可以根据算法设定的规则自动确定最佳类别个数。
两步聚类算法:
- 利用BIRCH算法构造CF-树的思想,逐个读取数据,进行预聚类,将样本点聚类成子类
- 以预聚类的子类为对象,基于每个子类的聚类特征,使用凝聚法逐个合并子类,达到最佳类别数。
在构建CF-树的过程中,可以选择是否对离群值进行处理,离群值的定义是叶节点的数据量小于一定比例的规模最大的CF-树中的记录数,默认情况下这个比例是25%。
操作方法:
- 配置节点,如下图,一般选择默认设置。

配置选项卡:
说明:
- 聚类数:由用户自行定义的聚类结果输出的簇数,默认值为5.
- **最大聚类数:**由系统自行聚类的最大聚类簇数,默认值为100.
- 聚类标签: 聚类后生成的聚类簇字段的取值,可以选择数值型,字符串,并可以自定义字符串型标签的前缀,比如“cluster”,“组”
- 生成距离字段:如勾选,则输出表中会增加衡量每条记录到所在簇中心的距离的字段
- **最大子节点个数:**聚类过程中子节点的个数的上限
- **距离阈值初始值:**距离阈值的厨师值设定,默认为0.5
- **调整系数:**调整聚类过程中所用参数。
- **是否允许节点分裂后合并:**模型聚类过程中设置,可以按照聚类效果调试
- **是否允许离群聚类:**聚类中出现异常值节点,是否允许模型将离群数据划入某聚类中
- **名义值最大类别数:**在模型训练期间,名义型字段的取值不能超过这里所定义的最大类别数,取值过多的话容易造成系统运算效率低,默认值5。
- 缺失值: 模型数据中,若有缺失值,模型可选择终止执行,停止建模,或者模型仅使用完整记录进行建模。
- 确认配置后,执行并查看视图,以及输出结果
- 聚类概述图:显示聚类分布,聚类大小,聚类质量
- **聚类单元视图:**显示每个类别特征指标的分布
- 聚类视图: 显示每个类中的样本数,样本每个字段的均值。
- PMML模型\PMML导出
- **输出表:**输出原始数据,以及分类信息
EM
节点用途:EM聚类算法有一个特性,就是没有严格要求一个点必须要属于一个类,这一特性被称为软聚类。EM算法是在概率模型中寻找参数最大似然估计或者最大后验估计的算法,其中概率模型依赖于无法观测的隐藏变量。EM经常用在机器学习和计算机视觉的数据聚类领域。
**EM算法:**经过两个步骤交替进行计算
- E-step:对于每一个数据点,我们要计算其属于其中每个聚类的概率作为权重:如果一个点很大可能属于一个聚类,就将对应的概率设置为接近1的值,对于那种可能会出现一个点属于2个或多个聚类的情况,就需要建立一个对聚类的概率分布
- M-step:这一步骤主要是利用上一步计算的权重来估计每个聚类的有关参数(均值,方差):每一个数据点以E-step中的概率作权重,然后与K-means一样计算每一个聚类的均值和方差,进而求取聚类的总体概率或极大似然。
这样通过E-step和M-step的不断交替来增加总的对数似然直到收敛,而且最大值也有可能陷入局部最优,所以需要多次迭代。
操作方法:
- 配置节点,如下图:

配置选项卡:
说明:
- 聚类数:由用户自行定义的聚类结果输出的簇数,默认值为3.
- **最大迭代数:**整个聚类过程中,迭代部分最多重复次数,防止在局部陷入循环,默认100次,模型不理想时,可以增加最大迭代数。
- **迭代最小提升:**每次迭代的最小提升
- **分布最小标准差:**高斯分布最小的标准差
- **并发度:**模型计算并发执行,值越大,并发度越高。0表示不启用并发
- **折数:**交叉验证所用样本折数
- **最大样本数:**交叉验证最大样本个数
- **似然最小提升:**似然值最小提升值
- **使用静态种子:**如果希望每次执行的结果不变,勾选此选项。如果不勾选,每次执行会使用一个新的随机种子,多次执行的结果可能有所不同。
- 确认配置后,执行并查看视图,以及输出结果
- 聚类概述图:显示聚类分布,聚类大小,聚类质量
- **聚类单元视图:**显示每个类别特征指标的分布
- 聚类视图: 显示每个类中的样本数,样本每个字段的均值。
- PMML模型\PMML导出
- **输出表:**输出原始数据,以及分类信息
层次聚类
**节点用途:**层次聚类也叫系统聚类。通过对数据集按照某种方法进行层次分解,直到满足某种条件为止。
注意: 该节点只能在小数据集上运行。它保存全部的数据在内存中计算,并且具有立方体的复杂性。
具体又可分为凝聚的,分裂的两种方案:
- 凝聚的层次聚类是一种自底向上的策略,首先将每个对象作为一个簇,然后合并这些原子簇为越来越大的簇,直到所有的对象都在一个簇中, 或者某个终结条件被满足,绝大多数层次聚类方法属于这一类,它们只是在簇间相似度的定义上有所不同。
- 分裂的层次聚类与凝聚的层次聚类相反,采用自顶向下的策略,它首先将所有对象置于同一个簇中,然后逐渐细分为越来越小的簇,直到每个对象自成一簇,或者达到了某个终止条件。
为了定义类间的距离必须定义一种度量距离的方法。主要有以下三种方法:
- 最短距离: 类间距离等于两类对象之间的最小距离,若用相似度衡量,则是各类中的任一对象与另一类中任一对象的最大相似度。
- 最长距离: 组间距离等于两组对象之间的最大距离。
- 平均距离: 组间距离等于两组对象之间的平均距离。
为了度量两点之间的距离,选择一个度量方法是有必要的。您可以选择欧式距离或者曼哈顿距离,这符合L1和L2范数。
操作方法:
- 配置节点,如下图:

配置选项卡:
说明:
- 聚类数:由用户自行定义的聚类结果输出的簇数,默认值为3.
- **距离函数:**整个聚类过程中,用于计算两节点之前距离的函数
- **聚类方法:**聚类中,定义聚类过程中组间距的方法,有single(最短距离),average(平均距离),complete(最长距离)
- **缓存距离:**通过缓存数据点之间的距离值来提高高维数据集的计算效率。它需要大量的内存,因此您在使用时应结合数据集的大小考虑内存情况。
- 确认配置后,执行并查看视图,以及输出结果
- 聚类概述图:显示聚类分布,聚类大小,聚类质量
- **聚类单元视图:**显示每个类别特征指标的分布
- 聚类视图: 显示每个类中的样本数,样本每个字段的均值。
- PMML模型\PMML导出
- **输出表:**输出原始数据,以及分类信息
相似搜素
**节点用途:**该节点检索出查询表和参考表中,与指定相似度/距离准则匹配的记录。
节点配置:

配置选项卡:
说明:距离函数:选择用于计算距离或相似性的方法。
- **欧氏距离:**需要一个或者多个数值字段
- **曼哈顿距离:**需要一个或者多个数值字段
- **距离向量:**需要有一个由距离矩阵计算节点生成的距离向量类型的字段
- **Tanimoto相似:**需要一个位向量
- **余弦相似:**需要一个或者多个数值字段
- **位向量余弦相似:**需要一个位向量
- **Dice系数:**需要一个位向量
- **编辑(绝对):**需要字符型字段。它字符串编辑之间的绝对数量(可以大于1)
- **编辑(归一化):**需要字符型字段。它字符串编辑之间数量的归一化之后的值(不超过1)
类分配器
**节点用途:**基于一种层次聚类将各个记录分配到类别。可以选择一个固定的聚类数或输入一个距离阀值。如果采用第二种方式,则所有最小距离小于指定阀值的聚类都将会被采用。阀值是一个给定的在0到1之间的标准距离。所有的距离都基于最大距离进行标准化。
操作方法:
- 配置节点,如下图:

配置选项卡:
说明:
- **更改聚类字段名称:**重新定义聚类字段名称
- 生成距离字段:如勾选,则输出表中会增加衡量每条记录到所在簇中心的距离的字段
- 缺失值: 模型数据中,若有缺失值,模型可选择终止执行,停止建模,或者模型仅使用完整记录进行建模。
案例如下:
使用“信用卡违约数据”建立如下工作流:

节点配置为默认值,执行后
执行结果如下图所示,将每条记录进行了分类。

时间序列
ARIMA
**节点用途:**时间序列预测中的一种算法。
**算法逻辑:**ARIMA模型,是指将非平稳时间序列转化为平稳时间序列,然后将因变量仅对它的滞后值以及随机误差项的现值和滞后值进行回归所建立的模型。ARIMA模型根据原序列是否平稳以及回归中所含部分的不同,包括移动平均过程(MA)、自回归过程(AR)、自回归移动平均过程(ARMA)以及ARIMA过程。
节点配置
:
配置选项卡:
说明:
- **学习方法:**包括条件似然,Yule-Walker,极大似然
- **p值:**指定自回归模型AR的阶数。
- **d值:**指定差分的阶数。
- **q值:**指定移动平均模型MA的阶数。
- **预测期数:**指定预测未来几期的数据
- **置信区间:**预测区间的置信度,默认设置为95%。
- **ACF和PACF的最大延迟数:**计算自相关系数时最大的延迟期数,一般为序列周期的倍数
案例如下:
建立工作流如下:

我们用时间区间,
按照系统默认值配置ARIMA节点后执行,结果如下:

指数平滑
**节点用途:**时间序列预测的一种算法。
**算法介绍:**该节点使用指数平滑法对时间序列进行训练,并输出用于预测的指数平滑模型。
指数平滑模型根据时间序列先前的观察值来预测未来,如根据销售历史记录来预测未来销售情况。该节点提供了自动、简单指数平滑、Holt线性趋势、简单季节模型、Winter加法和Winter乘法多种模型可以选择。其中自动是指节点会按照其他五个模型分别进行训练,然后输出效果最好的一个,所以自动选项运行耗时会相对长一些。
指数平滑节点与其他的节点稍有不同,用于分析的时间序列数据都是在均匀间隔的时间点下测量到的数据,时间序列的模型要求每个测量值之间要有一致的区间,所以,在指数平滑节点之前都要加一个时间区间节点以对时间区间有个规范的定义:指定要使用的时间区间(年、季度、月、日)。在模型训练或者预测的过程中将从时间区间生成的标准时间字段中获取相关的时间信息。
节点配置:

配置选项卡:
说明:
- 模型: 选择具体的分析模型,提供了自动、简单、Holt趋势、简单季节、Winter加法和Winter乘法多种模型供选择。如果选择“自动”,将自动执行所有的模型拟合并输出效果最好的一个,选择该选项则耗时会相对长一些
- 预测期数:指定要预测未来几期的数据
- 置信区间的置信度:模型不仅输出预测值,也输出预测值的置信区间。对于同样的模型而言,置信度越高,预测区间越宽,置信度越低,预测区间越窄
- ACF和PACF的最大延迟数: 用于指定计算ACF(auto correlation function,自相关)和PACF(partial auto correlation function,偏自相关)时最大的延迟期数。一般为序列周期的倍数
- **时序周期:**可以有用户指定时间序列的周期,或者由系统自动识别
案例如下:
对85-95年历史销量利润数据,预测96-98年的利润。
按照默认值配置算法节点,执行后,结果如下图:


序列预测器
**节点用途:**此节点通过解析训练好的PMML格式的模型对连接的时间序列的未来几期进行预测,通常连接在指数平滑节点后配合使用。除了时间序列的预测值,同时可以输出一定置信水平下的预测区间,以及残差的白噪声检验等评估结果。

配置选项卡:
说明:
-
-
- 预测期数:指定预测未来几期的数据。
- **置信区间的置信度:**预测节点除了预测值,还可以输出预测区间,在这里指定预测区间的置信度。
-
自相关图
**节点用途:**时间序列分析中,通常根据ACF和PACF分析一个序列的相关性,而且还可以通过残差的自相关性观察序列中的信息是否被充分提取。
节点配置:

配置选项卡:
说明:
- **选择字段:**选择观测值字段
- **差分阶数:**将非平稳时间序列平稳化时做的差分操作,默认为0
- **延迟阶数:**指定要计算ACF和PACF的阶数,默认为0
案例如下:
建立工作流如下:

按照节点默认值进行配置后,执行得到以下结果:

平稳检验
**节点用途:**绘制数据的正态QQ图,通过QQ图检验所选字段是否服从正态分布。
节点配置:

配置选项卡:
说明:
- **检验字段:**从输入表中选择一个进行检验的数值型字段,只有数值型字段可选。
混成检验
**节点用途:**混成检验是一类检验,用来检验序列的自相关性。其零假设为序列独立(对于某个延迟),而且像一个白噪声那样。如果这些检验的p值很小,则说明可能有相关性;而对于不相关的观测值,如纯随机过程,p值应该很大。可用于检验训练的时间序列模型的残差是否是纯随机序列。
节点配置:

配置选项卡:
说明:
- **选择检验字段:**从输入表中选择一个进行检验的数值型字段,只有数值型字段可选
- **延迟阶数:**定义延迟阶数,默认为1
- **检验方法:**选择一种检验方法
特征选择
**节点用途:**数据挖掘问题中可能包括成百或者上千的字段可以作为输入字段,从这些字段中挑选出模型应该包含的字段需要耗费很大的精力。为了缩小选择范围,可以使用特征选择节点进行初步筛选。该节点分两步对输入字段进行筛选,首先根据数据的特征质量过滤掉数据质量很差的字段,减少了后面的计算量,然后通过计算剩余的输入字段对目标的重要性对剩余字段进行排序或者过滤。
节点配置:

配置选项卡:
说明:
- **按重要性分段:**选择根据重要性筛选字段的规则,并指定相应的阀值
- **特征质量选择:**按缺失值、单类别所占最大比重、分类数、最小变异系数、最小标准差设置的条件进行筛选。指定各个统计量的阀值。
**案例如下:**利用“诊病数据”建立如下工作流:

节点配置按照默认值,执行后结果如下图:

降维分析
主成分分析
**节点用途:**该节点对输入数据执行主成分分析。用于提取最大主成份,可以被主成分分析应用节点使用,将输入数据映射到一个更低维度的数据集同时最大限度的保留信息。
节点配置:

配置选项卡:
说明:
- **提取主成分:**设置降维后的维度数,即主成分数。可以直接指定主成分个数或通过指定保留的最少信息比例来训练。如果直接设置,则该值不能高于参与分析的字段数。
- **替换原始数据:**设定是否覆盖原数据
- 缺失值: 模型数据中,若有缺失值,模型可选择终止执行,停止建模,或者模型仅使用完整记录进行建模。
主成分应用
**节点用途:**该节点应用主成分模型计算输入数据的主成分。它应用主成分计算节点的模型将任意数据映射到指定维度的数据集。
使用连接的主成分计算节点的模型估计目标维的信息保持率。保持率的计算是基于预测数据和主成分计算模型所有的数据分布相同的假设。
节点配置:

配置选项卡:
说明:
- **替换原始数据:**设定是否覆盖原数据
- 缺失值: 模型数据中,若有缺失值,模型可选择终止执行,停止建模,或者模型仅使用完整记录进行建模。
模型评估
评估
节点用途:分析评估模型质量
节点配置:

配置选项卡:
说明:两种方式输出模型评估结果
案例:建立一下工作流:

配置节点为默认设置,执行后,结果如下图:

信息熵
**节点用途:**根据给定的参考类为聚类结果评分。
该节点有两个输入端口,第一个输入端口连接参考类的表,第二个输入端口连接包含聚类结果的表,且这两个表均需要包含类ID。 从对话框中选择两个表中相应的列。成功执行之后,视图中会显示熵值和质量值,其中熵值越小越好,质量值属于[0,1],越趋于1越好。
节点配置:

配置选项卡:
说明:
- 参考字段:选择第一个输入表中包含参考类的列
- 聚类字段:选择第二个输入表中用于评估的字段。
评估图
**节点用途:**将模型评估结果以视图形式展示。

节点配置:
配置选项卡:
说明:
- **图表类型:**根据建模分析的目的,选择数据图表
- **增益图:**增益的定义是相对于全部匹配,发生于每个分位数中的匹配的百分比。其计算方法为(分位数中的匹配数量/全部匹配数量) × 100%。
累积收益图的线从左至右的走势通常是从0% 到100%。优秀模型的收益图将陡升至100%,然后保持平直。无法提供有用信息的模型将呈对角线状,即从左下角到右上角(选择了包含基线后将显示类似图表)
- **响应图:**响应即分位数中,匹配记录的比例。其计算方式为(分位数中的匹配/分位数中的记录)× 100%
通常,响应图开始于接近100%之处,并逐渐下降,最终将在延伸至图表右侧边缘时达到整体响应率(全部匹配/全部记录)。对于优秀模型的响应图,其线开始于图表左侧接近或等于100% 的值,且在向右移动的过程中,始终保持在较高的水平;然后,在图表右侧,向整体响应率的方向迅速下降。如果模型不能提供任何信息,则其线在整个图形中将始终围绕在整体响应率左右。(如果选择了包含基线,一条值相当于整体响应率的水平线将显示在图表中供您参考
- **提升图:**提升将每个分位数中匹配记录的百分比与在全部训练数据中匹配的百分比进行比较。其计算方式为(在分位数中的匹配/在分位数中的记录)/(全部匹配/全部记录)
累积提升图的线从左至右的走势通常为:起始于大于1.0 的值,并渐渐下降,直到接近1.0。图表的右侧边缘表示整个数据集,因此累积分位数的匹配与数据中的匹配的比例为1.0。对于优秀模型的提升图,其线开始于图表左侧大于1.0 的值,且在向右移动的过程中,始终保持在较高的水平;然后,在图表右侧,向1.0的方向迅速下降。如果模型不能提供任何信息,则其线在整个图形中将始终围绕在1.0 左右。(如果选择了包含基线,一条值为1.0 的水平线将显示在图表中供您参考
- **ROC图:**ROI 将分位数的成本和利润进行比较。其计算方法为(分位数利润/分位数成本)× 100%
累积投资回报(ROI) 图通常与响应图及提升图类似,只有在尺度标准方面有所差别。投资回报图通常开始于大于0% 的值,并逐渐下降,直到达到整个数据集的整体ROI(可能为负)。对于优秀模型的投资回报图,其线开始于图表左侧大于0% 的值,且在向右移动的过程中,始终保持在较高的水平;然后,在图表右侧,向整体ROI 的方向迅速下降。如果模型不能提供任何信息,则其线在整个图形中将始终围绕在整体ROI 左右
- **目标\预测变量字段:**使用类型设置或者自定义,如果选择类型设置,需要定义分类目标字段,以及倾向类别值,如果选择自定义,则可以在最下方的数据字段列表中选择目标字段。
文本挖掘
概述
(此页面暂无内容)
噪声词过滤
节点用途: 噪声词过滤节点的功能是将分词字段中的无关词汇或者不重要的词过滤掉,进而筛选出重要的词汇,可过滤中文或者英文。
过滤的方法有多种,分别是过滤与内置的噪声词库匹配的词汇、过滤与自定义噪声词库匹配的词汇、过滤所有的标点符号、过滤所有的数字、区分大小写和过滤所有字节长度小于N的词。这些方法可以只选择一个进行过滤,也可以选择全部进行过滤。过滤后输出表中的列数保持不变,只会过滤掉匹配条件的记录。
节点配置:

配置选项卡
说明:
- 选择过滤字段:选择文档中所需过滤字段
- **使用内置噪声词库:**如果勾选此项,将会过滤掉分词字段中与内置噪声词库匹配的记录,可选择中英文
- **选择自定义噪声词库:**如果您需要让程序根据您指定的噪声词汇进行过滤,请将包含您指定的包含噪声词的表连接到第二个输入端口(自定义噪声词库)。如果选择使用自定义噪声词库,请在后面下拉框中选择包含噪声词的字段。
- **过滤数字:**如果勾选此项,将会过滤掉选择的分词字段中所有只有数字组成的词
- **过滤标点符号:**如果勾选此项,将会过滤掉选择的分词字段中所有只有标点符号组成的词
- **区分大小写:**如果勾选此项,在与噪声词库中的词匹配时会区分大小写
- **过滤字节数:**如果勾选此项,还需要在后面的文本框中定义字节数,将会过滤掉选择的分词字段中所有字节长度小于指定值的词。
字符串匹配
**节点用途:**字符串匹配节点的功能是对两个字符串字段进行比较,计算两个字段中字符串之间的距离,并在输出表中列出最相似的字符串。
该节点需要两个输入表,一个表包含用于比较的字符串字段,一个表包含一个词典字段。字符串匹配节点会寻找词典字段中与指定的字符串字段中最相似的元素。
节点配置:

配置选项卡
说明:
- **选择字符串字段:**选择数据表中所需要的字符串字段。该列来自于第一个输入表
- **选择匹配字段:**选择一个与字符串列对比的词匹配字段。该匹配字段来自于第二个输入表(词典表)。程序将会从这个词典列中找出与目标字段中相关的元素
- **输出相关词的最大数量:**指定相关词的最大数量,即要从字典表中最多找到几个与字符串列中的元素相关的元素。如果指定的值为3,输出表中将会增加三个相关字段,分别命名为“相关词1”、“相关词2”和“相关词3”,计算得到的与字符串每个元素相关的元素会分别保存在这三个字段中
- **显示匹配距离:**在输出表中显示目标字段与匹配字段间差异
语句提取
**节点用途:**语句提取节点的功能是提取文档中的语句并返回一个包含文档字段、语句字段和表示语句中包含的词量字段的表。
节点配置:

配置选项卡
- **选择文档字段:**选择数据表中所需要的字符串字段
分词
节点用途: 分词节点的功能是用于对中文,英文文本进行分词,进而从非结构化数据中提取结构信息。
分词的对象都是每列字段。分词后将在输出表中追加分词、计数和词性三个字段。分词字段表示从文本字段中提取出词;计数字段表示按照每个文本对得到每个分词出现次数的统计,注意,统计的只是每次词所在文本中出现的次数,并不是所有文本中出现的次数;词性字段显示的每个分词的词性。
节点配置:

配置选项卡
说明:
- **选择词库:**选择适合分词的词库,中文或者是英文
- **选择分词的字段:**请在这里选择要分词的文本字段。分词程序将对该字段进行分词
- **选择自定义词库:**从自定义词库输入表中选择包含新增词的字段。这个功能主要用于自定义词库,用户可以基于该功能将一些词库中没有的新词添加到分词词库中,以提高分词的准确率。这些新增词在程序执行后不会添加到程序自带的词库中,只是临时使用。
情感分析
**节点用途:**这个节点根据情感分析节点的功能是定义文本的情感强度和情感分类。文本情感分析又称意见挖掘。简单而言,是对带有情感色彩的主观性文本进行分析、处理、归纳和推理的过程。例如,由于基于产品评论的情感分析可以帮助用户了解某一产品在大众心目中的口碑,因此受到很多消费者和商业网站的青睐。而基于新闻评论的情感分析多用于舆情监控和信息预测中,是国内外评测中重要的评测任务。
情感信息抽取是情感分析的最底层的任务,它旨在抽取情感评论文本中有意义的信息单元。其目的在于将无结构化的情感文本转化为计算机容易识别和处理的结构化文本,继而供情感分析上层的研究和应用服务。情感信息分类则利用底层情感信息抽取的结果将情感文本单元分为若干类别,供用户查看,如分为褒、贬两类或者其他更细致的情感类别(如喜、怒、哀、乐等)。按照不同的分类目的,可分为主客观分析和褒贬分析;按照不同的分类粒度,可分为词语级、短语级、篇章级等多种情感分类任务。
节点配置:

配置选项卡
说明:
- **选择分析对象 :**情感分析是面向研究对象的,可以是每条记录,也可以是文档类别,也可以是文本的作者。因此,需要选择分析的对象,情感分析会按照选择的分析对象计算每个对象的情感强度,进而计算情感分类。这一项不是必选项,如果不选,则程序会把每条记录当作一个分析对象
- 选择分词字段: 由于情感分析需要根据文本中词判断词的情感,进而计算每个研究对象的所有文本整体的情感强度,即为该研究对象的情感强度。因此,在做情感分析之前需要使用分词节点对文本进行分词(有时还需要对分词进行噪声词过滤)。因此,此处需要选择一个之前已经处理好的分词字段
- **选择频数字段:**这一项是指定情感分析的权重,可以选择一个数值型字段作为权重。此项也非必选,如果不选,则权重默认相同。
社会网络
概述
(此页面暂无内容)
网络生成
**节点用途:**网络生成节点的功能是自定义网络。根据界面的信息配置生成新的随机数据。
节点配置:

配置选项卡
说明:
- **节点数:**网络生成的节点数目
- **连线的概率:**用于确定网络中节点之间的连线概率,取值范围为0~1,如果为0 ,则网络中的节点没有连线,如果为1,那么网络中任意两个节点都存在连线。
对象插入
**节点用途:**对象插入节点的功能是从输入表中选择表示节点、边及节点和边特征的字段来创建网络,即将表转换为网络。
输入表中的每一行包含每条边的节点。该算法可以支持以下三种格式的输入表: 第一节点id 第二节点id
节点1 节点2
节点2 节点4
节点3 节点4
这种格式的输入表,需要在配置窗口中选择第一节点id字段和第二节点id字段(第一节点id和第二节点id不能选择同一字段),还需要选择一个边id字段,缺一不可。另外,也可以使用行ID作为边ID。
节点配置:

配置选项卡
说明:
- **第一节点ID:**选择一个字段作为第一节点的id。此选项为必选项
- **第一节点标签:**选择一个字段作为第一节点的标签。此选项为可选项
- **第二节点ID:**选择一个字段作为第二节点的id。此选项为可选项
- **第二节点标签:**选择一个字段作为第二节点的标签。此选项为可选项
- **边ID:**建立边ID三种方式,此选项为必选项
- 选择一个字段作为边的ID
- 选择节点id作为边ID
- 创建唯一边ID
- **边标签:**选择一个字段作为边的标签。此选项为可选项
- **创建有向边:**添加目标特征到每条边的后一个节点。该选项是使用两个已经定义的节点字段,将目标特征分配给第二个节点
- **删除首部和尾部空格:**是否删除空格
特征表
节点用途: 特征表节点的功能是将网络的特征写入到数据表中,将网络信息转化为表。另外,可以只选择部分特征输出,也可以指定一部分对象(节点id或者边id)输出。另外,输出的特征表有两种输出格式:特征独立显示、特征写入一个字段,分别如下:
如果您在输出表类型中选择特征独立显示,则输出表的格式如下所示:
| 特征目标 | 边id | 节点id | 描述 | 标签 | 权重 | 目标 |
|---|---|---|---|---|---|---|
| 节点 | ? | 节点1 | ? | 标签1 | ? | ? |
| 边 | 边1 | ? | ? | ? | 1.0 | ? |
| 终端 | 边1 | 节点2 | ? | ? | ? | 目标 |
如果您在输出表类型中选择特征写入一个字段,则输出表的格式如下所示:
| 特征目标 | 边 id | 节点 id | 特征名称 | 特征类型 | 特征值 |
|---|---|---|---|---|---|
| 节点 | ? | 节点1 | 标签 | 字符串 | 标签1 |
| 边 | 边1 | ? | 权重 | 浮点型 | 1.0 |
| 终端 | 边1 | 节点2 | 目标 | 布尔 | 是 |
节点配置

配置选项卡
说明:
- **指定输出对象:**这里可以通过从第二个输入表中选择一个包含节点id或者边id的字段来指定输出的对象,输出表中显示的将只是所选字段中包含的对象(节点id或者边id)。这两个都是可选项,但是如果第二个输入表被连接,则两项至少要选择一项。
- 节点特征: 选择一个包含指定节点ID的字段,则输出表中仅包含该字段中包含的对象(节点ID)对应的特征。
- 边特征: 选择一个包含指定边ID的字段,则输出表中仅包含该字段中包含的对象(边ID)对应的特征。
- **特征字段选择:**选择要写入输出表的特征字段。
- **过滤输出对象:**这里可以通过从第二个输入表中选择一个包含节点id或者边id的字段来过滤输出的对象,输出表中不显示的将只是所选字段中包含的对象(节点id或者边id)。这两个都是可选项,但是如果第二个输入表被连接,则两项至少要选择一项。
- 节点特征: 选择一个包含指定节点ID的字段,则输出表中不输出包含该字段中包含的对象(节点ID)对应的特征。
- 边特征: 选择一个包含指定边ID的字段,则输出表中不输出包含该字段中包含的对象(边ID)对应的特征。
特征添加
节点用途: 特征添加节点的功能是从一个输入表中向网络添加特征。每一个特征都是通过可用边ID或者节点ID向边或者节点添加。字段的名称将被用作特征的名称,字段的类型将被作为特征的类型。
节点配置:

配置选项卡
说明:
- ID设置:
- 节点ID: 如果要添加节点的特征,则选择节点id,指定要添加特征的节点。
- 边ID: 如果要添加边的特征,则选择边id,指定要添加特征的边。
- 特征字段选择: 即将左侧框中想要添加到节点或边上的特征,添加到右侧框中。
特征过滤
节点用途: 特征添加节点的功能是从一个输入表中向网络添加特征。每一个特征都是通过可用边ID或者节点ID向边或者节点添加。字段的名称将被用作特征的名称,字段的类型将被作为特征的类型。
节点配置:

配置选项卡
说明:
- 指定对象:
- 节点:
- 边:
- 特征字段选择:
参考特征过滤
**节点用途:**参考特征过滤节点的功能是根据输入表中提供的参考特征对现有的网络元素进行过滤。需要从输入网络中选择一个网络特征字段,从输入表中选择一个参考字段,它会检查输入表中参考字段的值在网络特征中是否存在。
节点配置:

配置选项卡
说明:
- **指定对象:**用于确定过滤的对象是边,还是节点
- **特征:**选择一个网络特征字段,程序将根据这个特征字段的取值判断是保留还是删除该取值对应的网络元素
- **参考字段:**从输入表中选择一个与已选的网络特征匹配的字段。程序将使用该字段与网络特征做比较,根据比较的结果判定哪些网络元素保留哪些删除
- **保留匹配元素 :**用于指定匹配的元素是保留还是排除。如果选中该项,则保留,否则将从网络中剔除这些元素
- **过滤缺失特征:**如果选中此项,将会从网络中过滤掉特征缺失的元素。
参考对象过滤
**节点用途:**指定对象过滤节点的功能是从输入表中指定一个包含对象id的字段,与网络数据中的对象id进行匹配,对匹配的对象做排除或者保留操作。这里的对象指网络中的节点或者边。
节点配置:

配置选项卡
说明:
- **指定对象:**用于确定过滤的对象是边,还是节点
- **包含/排除:**如果选择了排除对象,那么所有id匹配的对象都会被过滤掉,不匹配结果会被保留下来。如果选择了包含对象,那么所有id匹配的对象都会被保留,不匹配的对象会被过滤掉
- **对象ID:**选择参考对象ID
特征值过滤
**节点用途:**特征值过滤节点的功能是基于给定的值过滤相应的网络元素,可以在配置中指定一批特征值,对选中的特征进行过滤。
节点配置:

配置选项卡
说明:
- **指定对象:**用于确定过滤的对象是边,还是节点
- **特征:**在下拉框中选择一个要进行特征值过滤的特征。这里的特征相当于数据表中的一个字段
- 特征值: 指定进行操作的特征值。这里的特征值即为特征字段中的取值。数值特征可以使用>,>=,<,<=、=等过滤。非数值特征会按照给定的正则表达式过滤,比如*smart*,表示包含所有smart的值。有些使用布尔特征,比如T和F
- **保留匹配的元素:**用于指定匹配的元素是保留还是排除。
- **过滤缺失特征:**如果勾选此项,程序将会过滤掉特征的缺失值。
度过滤
**节点用途:**该选项是根据节点度的范围对网络进行过滤。与某点相邻的那些点称为该点的“邻点”,一个节点的邻点的个数称为该点的“度数”,也叫关联度。一个节点的度数就是对其“邻点”多少的测量。实际上,一个点的度数也是与该点相连的线的条数。如果一个点的度数为0,称之为“孤立点”。在一个有向图中,必须考察线的方向。因此,一点的“度数”包括两类,分别称为“入度”和“出度”。一个节点的入度指的是直接指向该点的点的总数;出度指的是该点所直接指向的点的总数。
节点配置:

配置选项卡
说明:
- 最小节点度:指定度选择范围的下限。
- 最大节点度:指定度选择范围的上限。
- 度类型: 包括度、出度和入度。度指的该节点上连线的总数,出度指的是该节点连接其他节点的连线数,入度指的是该节点被连线数。
邻节提取
**节点用途:**邻节提取节点的功能是提取指定节点id的邻近节点,每一个节点为一行,邻接节点作为集合列表存储。其中,可以指定提取所有源节点或者目标节点的相邻节点,也可以通过从第二个输入表中选择一个字段指定只提取该字段中包含的节点。该节点有两个输入端口,上面为模型输入端口,输入网络,是必连端口;下面为表输入端口,输入一个包含节点id的表,这个端口不是必连的,该端口用于提取指定节点时使用的。
节点配置:

配置选项卡
说明:
- **节点ID:**可以通过从第二个输入表中选择一个包含指定节点ID的字段,程序将只提取字段中包含的节点的邻近节点
- **有向:**如果选中此项,将考虑节点间连线的方向性。仅当网络有向时该选项是可用的
- **节点状态:**仅当“有向”已被选中,该项才能启用。如果选中此项,该邻节表将包含源节点和目标节点
- **附加特征:**如果需要将权重附加到节点ID上,则选中此项。该邻节字段是一个包含节点id(字符型)和权重(浮点型)的混合列表
- **过滤空邻节:**如果选中该项,所有没有邻近节点的节点将被过滤掉。因此,输出表将只包含至少具有一个邻节点的节点。
层次提取
节点用途: 层次提取节点的功能是基于集合字段或者列表字段创建网络。该算法通常和关联分析一起使用,用于可视化关联关系,辅助分析物品之间的关联
节点配置:

配置选项卡
说明:
- **成员字段:**选择一个成员字段,程序将从成员字段中提取节点和网络关系
- **最小成员数:**此处可以指定最小成员数,精简生成的网络。这里的成员数指的是成员字段每个单元格中值的个数。在层次创建过程中,成员字段少于指定成员数量的集合的行将被忽略
网络图
节点用途: 层次提取节点的功能是基于集合字段或者列表字段创建网络。该算法通常和关联分析一起使用,用于可视化关联关系,辅助分析物品之间的关联
节点配置:

配置选项卡
说明:
对节点进行,形状,大小,颜色,标签,标签位置,标签字体的一些设定。
SmartR
概述
(此页面暂无内容)
R源表
**节点用途:**工作流从R中读取数据表的源节点。当你想在工作流中使用R函数读取外部的数据文件时,可以使用该节点。
R的"foreign"库中提供了读取数据文件的相关示例。更多关于R的信息,可以登录http://www.r-project.org/
**节点配置:**在节点配置中,写入R语言,读取外部数据

配置选项卡:
- **R脚本:**编辑用于在R中执行的代码。
案例:
读取数据文件夹C:\SmartMining\Desktop-5.2.0\demo下的数据:appUserData,这需要在R源表节点的“R脚本”模块中编辑读入数据的语句_SmartR.out<-read.table('C:\SmartMining\Desktop-5.2.0\demo\appUserData.csv',header=T,sep=",");_
脚本中使用read.table函数读取CSV数据。并将读取的数据赋值给SmartR.out。这是因为SmartR用变量SmartR.out来接收R代码的输出结果,所有的输出数据都需要赋值给SmartR.out来进行输出。相似的变量还有SmartR.in,SmartR.model。SmartR.in用于存储节点的输入数据,SmartR.model用于存放SmartR中的模型。
R代码段
**节点用途:**在工作流中使用R函数整理数据时,可以使用该节点。R的"foreign"库中提供了读取数据文件的相关示例。更多关于R的信息,可以登录http://www.r-project.org/
**节点配置:**在节点配置中,写入R语句,处理数据字段等

配置选项卡:
- **R脚本:**写入R语言,选择字段列表中的目标字段作为R代码段要处理的参数变量
- **字段列表:**列表中包含了输入表中当前可用字段。双击鼠标可以将选中字段插入到光标位置
案例:
appUser数据中,有2700条数据,选择其中应用是微信的用户数据,需要R代码段选取数据,在脚本中输入代码:
smartR.out<-subset(smartR.in,smartR.in$"应用"=="微信");
节点执行后,输出数据表为520条应用为微信的记录,如下图:

相关检验
节点用途: 使用一种或者多种相关检验方法对两个数值型字段间的相关性进行检验。在配置界面可以选择多个检验字段,节点将对每两个字段之间进行计算并输出每对字段的检验结果。
节点配置:

配置选项卡
说明:
- **检验字段:**在字段列表中选择要检验是否具有相关性的字段,只能是数值型字段
- **相关系数:**选择一种或者多种相关系数计算方法,包含Pearson相关系数、Kendall’s tau_b和Spearman秩相关系数
- **显著性检验 :**选择检验时使用双侧检验还是单侧检验。双侧检验用来检验相关系数是否等于0即两字段是否相关,单侧检验用来检验相关系数是否大于0或者小于0即两字段是否正相关或者负相关
- 缺失值: 四种缺失值处理方式
- 仅完整记录:仅对所有字段都不缺失的记录进行分析
- 按对排除记录:仅排除参与计算的两个字段任一个有缺失的记录
- 按列排除:有缺失值的字段不参与计算
- 数据中存在缺失值时,中止执行
- 标记显著性相关: 选中此项,在输出结果中,检验p-值小于等于0.01的相关系数用“**”标记,检验p-值大于0.01且小于等于0.05的相关系数用“*”标记
- **输出协方差矩阵:**选中此项,在输出结果中输出协方差矩阵
案例:
在医药数据中,查看血压与胆固醇的相关性
如果上图配置节点,执行后结果如下图:

Granger因果检验
**节点用途:**多个时间序列的二元Granger因果检验。 关于两个时间序列X和Y的Granger因果检验是用来评估X过去的观测值对于预测Y是否有用的。原假设:X过去的观测值(比如T个)对于预测Y值没用。 该节点对选中的检验字段两两之间分别进行检验,得到相应的F统计量值及p-值。
节点配置:

配置选项卡
说明:
- **检验字段:**选择检验的目标字段,只能选择数值型字段,可多选
- **检验选项:**指定滞后阶数和显著性水平。滞后阶数为大于等于0的整数。显著性水平用于输出结果中判断字段的因果关系是否显著。默认取值0.05,可取范围:0—1。
案例:
医药数据中,检验血压与血液中钠含量是否有因果关系,按照上图进行配置节点,执行后结果如下:

单样本非参数检验
**节点用途:**单样本非参数检验是对单个总体的分布形态等进行推断的方法,其中包括卡方检验、二项分布检验、K-S检验以及变量值随机性检验等方法。可以使用多种方法对所选字段分别进行非参数检验,进而了解数据所包含的关于总体的位置和尺度信息,如均值, 中位数。
节点配置:
该节点有两个参数配置界面:【配置】和【检验方法】,在【配置】中配置节点的全局参数,配置的参数适用于【检验方法】中所选的检验方法,在【检验方法】中选择一种或多种检验方法对【配置】界面选择的字段进行分析。


配置选项卡
说明:
- **检验字段:**选择需要进行检验的字段。只有数值型字段可选,可多选。
- **检验选项:**指定一个显著性水平,用于在输出结果中判断是否拒绝原假设。默认取值0.05,可取范围:0—1
- **缺失值:**缺失数据的两种处理方式。选择“仅完整记录”则对选中的所有字段进行检验的时候排除缺失值,如果选择“中止执行”则对有缺失值的不进行分析。
检验方法选项卡:
说明:
选择要进行的检验分析,可以是多选。在每种检验方法的右边设置该检验方法需要的参数信息。默认检验方法都是没有被选中的,在检验方法没有被选中的状态下对应的右侧的参数配置信息是置灰的,参数信息不可更改,当勾选了左侧的复选框时,右侧的参数配置被激活,可以更改。
为方便描述,对一些参数用符号进行定义,分位点(a)、字段在分位点a处的分位数(Qa)、字段中位数(即在分位点0.5的分位数Q0.5)、假设分位数或者假设中位数(q0)。
- **广义符号检验:**对字段的分位数进行检验,即检验字段指定分位点a处的分位数Qa与假设分位数q0之间的关系。
- 分位点:指定一个分位点,默认0.5,可取范围:0—1
- 假设分位数:输入一个数字,可以是小数。
- 检验方向:下拉框有三个选项(左侧、右侧、双侧),默认是双侧。三个选项的意思分别为:左侧—检验字段分位数Qa是否大于等于假设分位数q0;右侧—检验字段分位数Qa是否小于等于假设分位数q0;双侧—检验字段分位数Qa是否等于假设分位数q0。
- **Wilcoxon符号秩检验:**对字段的中位数进行检验,即检验字段中位数Q0.5与假设中位数q0之间的关系
- 假设中位数:输入一个数字,可以是小数
- 检验方向:下拉框有三个选项(左侧、右侧、双侧),默认是双侧。三个选项的意思分别为:左侧—检验字段中位数Q0.5是否大于等于假设中位数q0;右侧—检验字段中位数Q0.5是否小于等于假设中位数q0;双侧—检验字段中位数Q0.5是否等于假设中位数q0。
- **正态记分检验:**对字段的中位数进行双侧检验,即检验字段中位数Q0.5是否等于假设中位数q0
- 假设中位数:输入一个数字,可以是小数。
- **游程检验:**检验随机性,分析之前需要对数值型字段进行一下处理, 指定一个分割点b,小于等于b的为1,大于b的为0.分割点的定义有以下三种方式
- 中位数:即字段从小到大排序之后中间位置的数
- 均值:字段的平均取值
- 自定义:自己指定一个数字,可以是小数。
QQ图
**节点用途:**绘制正态QQ图,通过QQ图检验所选字段是否服从正态分布。
节点配置:

配置选项卡
说明:
- **选择字段:**从输入表中选择一个进行检验的数值型字段,只有数值型字段可选
- **缺失值:**对缺失值的处理,选择仅对完整记录分析还是有缺失值时中止执行。默认中止执行。
- **图片:**调整显示的宽度,高度
**案例:**查看医药数据中钾分布是否是正态分布。
按照上图进行节点配置,执行后结果如下图:

单样本分布检验
**节点用途:**检验单个数值型样本是否服从假定的分布(正态分布,指数分布,均匀分布,泊松分布)。检验结果可以在输出的视图结果中进行查看。
节点配置:


配置选项卡
说明:
- **检验字段:**选择需要进行检验的字段。只能选择数值型字段,可多选
- **假设检验:**选择假设的分布,并设置分布参数,可多选。每种分布的分布参数可通过两种方式进行设置:
- 使用样本数据:即通过计算字段的平均值或者标准差然后传给参数。
- 定制:定制即自定义参数
- **检验选项:**此处可以配置显著性水平,以及是否大样本近似,显著性水平用于输出结果中判断是否可以拒绝原假设。默认取值0.05,可取范围:0—1。输出结果中小于此处配置的显著性水平时,则拒绝原假设。
**案例:**在医药数据中,检验年龄字段的是否按照正态分布,指数分布。
节点配置中,选择“old”,勾选正态,指数,执行并查看结果,如下图:

两样本分布检验
**节点用途:**检验两个数值型样本的分布是否一致。检验结果可以在输出的视图结果中进行查看。
节点配置:


配置选项卡
说明:
- **使用分组字段:**该页签用于配置检验两样本数据是否是同分布的参数。这里提供两种配置方式:使用分组字段/不使用分组字段
- 选中此项,则选择一个分组字段,并从该分组字段的取值中选择两个组将要检验的数值型字段分成两样本
- 此项未勾选,即不使用分组字段,则使用“假设检验”选择两个配对字段的方式,选择要检验的数值型字段
- **检验字段:**当勾选了“使用分组字段时”,选择需要进行检验的字段。只能选择数值型字段,可多选。
- **假设检验:**检验字段时,不使用分组,则可以使用该功能
- **检验选项:**此处可以配置显著性水平,以及是否大样本近似,显著性水平用于输出结果中判断是否可以拒绝原假设。默认取值0.05,可取范围:0—1。输出结果中小于此处配置的显著性水平时,则拒绝原假设。
**案例:**在医药数据中,检验服用药物Y与药物X的人的年龄是否分布致。
节点配置中,选择“yaowu”为分组变量,组1:DrugY,组2:DrugX选择“old”为检验字段,执行后结果为下图:

R表视图
**节点用途:**使用该节点可以在通过R语言对数据进行可视化。
有关R语言绘图函数,更多详情参看R的官网:http://www.r-project.org/
节点配置:

配置选项卡
说明:
- **字段列表:**列表中包含了输入表中当前可用字段。双击鼠标可以将选中字段插入到光标位置
- **R脚本:**编辑R语言进行绘图
- **PNG设置:**设置输出图像的大小格式。
-
- 宽度:设置图像的宽度。
- 高度:设置图像的高度。
- 分辨率:设置图像的像素,默认值为72。
- 文字大小:设置默认字体大小。
- 背景颜色:为图像设置默认背景颜色。
-
按照上图进行配置节点,执行后结果如下图:

R建模器
**节点用途:**在SM里可以执行R模型的命令,有关R语言建模的更多详情可以参看R的官网 :http://www.r-project.org/
节点配置:

配置选项卡
说明:
- **字段列表:**列表中包含了输入表中当前可用字段。双击鼠标可以将选中字段插入到光标位置
- **R脚本:**编辑用于在R中执行的代码
R预测器
节点用途: 基于R建模器节点生成的模型,对新的数据输入进行预测。所以使用该节点需要同时具备输入表信息和输入模型,模型端口可以直接连接R建模器的模型输出端口或者连接R模型读取节点。
有关R语言,更多详情参看R的官网 : http://www.r-project.org/
节点配置:

配置选项卡
说明:
- **字段列表:**列表中包含了输入表中当前可用字段。双击鼠标可以将选中字段插入到光标位置
- **R脚本:**编辑用于在R中执行的代码
R模型读取
**节点用途:**从压缩文件中读取一个R模型。
节点配置:

输入R模型文件读取路径。
数据导出
概述
(此页面暂无内容)
数据库
**节点用途:**数据库读取节点可以用来从数据库中读取数据表。使用数据库节点时需选择相应的数据库驱动,配置数据库URL、用户名和密码。
节点配置:

配置选项卡:
说明:
- **数据源:**选择相应的数据格式
- **数据库驱动:**输入目标数据库
- **数据库URL:**选择数据库后,配置数据库所在服务器IP、端口和数据库的名称
- **用户名:**输入登录数据库的用户名
- **密码:**输入登录数据库的密码
- **表名称:**设定要导出数据表的名称
- **如果表已存在:**可以选择本数据表与原数据表的处理方式
Hive
**节点用途:**把数据导入到Hive文件进行存储

配置选项卡:
说明:
- **数据库URL:**选择数据库后,配置数据库所在服务器IP、端口和数据库的名称
- **数据库驱动:**输入目标数据库
- **用户名:**输入登录数据库的用户名
- **密码:**输入登录数据库的密码
- **表名称:**设定要导出数据表的名称
- **如果表已存在:**可以选择本数据表与原数据表的处理方式
- **分隔符:**在输出文件中选取符号对数据中字段进行分隔
HDFS
**节点用途:**把数据导入到HDFS文件进行存储

配置选项卡:
说明:
- **文件地址:**设定导出文件要存放的地址
- **分隔符:**在输出文件中选取符号对数据中字段进行分隔
- **分块数:**依据用户需求,设定存储数据块的数量
HBase
**节点用途:**把数据导入到HBase文件进行存储

配置选项卡:
说明:
- **zookeeper.znode.parent:**输入ZooKeeper中的HBase的根ZNode,或者从下拉列表中选择一个历史路径
- **zookeeper端口:**输入zookeeper使用的端口。
- zookeeper集群:输入集群的地址列表,用逗号分割。
- **表名称:**设定要导出数据表的名称
- **如果表已存在:**可以选择本数据表与原数据表的处理方式
- **分隔符:**在输出文件中选取符号对数据中字段进行分隔