敏捷挖掘节点手册

数据源

数据源

概述

(此页面暂无内容)

数据源

数据库

节点用途:数据库节点用于读取关系数据库中的数据

说明

前提条件:

操作步骤:

1.选择配置选项卡,如下图所示:

配置选项卡:

说明

过滤选项卡

过滤选项卡的功能如同过滤节点,用于精简数据表字段,方便过滤字段并配置字段的属性信息。

类型选项卡

类型选项卡的功能如同类型节点,用于指定字段的测量类型、角色以及计算元数据。

  1. 确定界面配置**,预览**数据
数据源

HDFS

**节点用途:**HDFS(Hadoop分布式文件系统)读取节点,用于连接HDFS文件系统,读取HDFS文件系统中的数据。

配置选项卡

说明

操作示例:

工作流中的第一个节点,数据读取,节点配置:

  1. 右键点击节点,在配置选项卡键入文件地址,勾选对应的分隔符,点击确定
  2. 右键点击节点,选择执行
  3. 右键单击节点,选择预览,可以查看数据表
数据源

Hive

**节点用途:**连接Hive数据仓库,并读取Hive中的数据表。

操作步骤:

选择配置选项卡,如下图所示:

配置选项卡

说明

操作示例:

  1. 节点配置,如上图:
  2. 确定后,并执行。

将系统自动生成的数据库URL中的分别替换为主机名或IP地址、端口和数据库名称,点击加载数据表选择表名称,点击确定即可完成配置。右键单击Hive节点选择预览可以查看数据表

数据源

HBase

**节点用途:**连接HBase数据库,并读取HBase中的数据表。

操作步骤:

1.选择配置选项卡,如下图:

配置选项卡

说明

2.选择字段选项卡,如下图:

**字段选项卡:**对从HBase中读取的字段信息进行配置。

说明

  1. 勾选此项,则按照String类型从HBase中读取,然后转成指定的字段类型,
  2. 不勾选此项,则根据下面配置框中用户指定的类型读取。
  1. 通过右侧的按钮:添加, 删除,进行添加或移除字段。
  2. 列族:用于选择列族字段,下拉列表为从HBase中加载的列族列表,默认选择第一个;
  3. 列名:用于输入HBase中的列名;
  4. 字段类型:指定所选字段的输出类型,可选String、Int、Long、Double,默认为String;
  5. 输出字段名:指定所选字段在输出表中的字段名,默认为列族_列名,可在文本框中进行编辑修改。
数据源

SmartDI

**节点用途:**SmartDI节点用于读取数据管理模块配置的数据源或者大数据工具下创建的数据集中的数据,可以实现对数据权限更全面的控制。

前提条件: 需要先在数据管理模块连接好数据源或者在大数据工具下创建好数据集查询

操作步骤:

1.选择配置选项卡,如下图:

配置选项卡

说明

操作示例:

案例需求:读取数据管理模块下数据源demo中credit数据表,配置如下:

  1. 选择数据源方式
  2. 在数据源资源树中找到demo数据库中的credit数据表,选中数据
  3. 点击右上角预览按钮可以预览数据表,结果如下

  1. 点击确定关闭配置界面
  2. 查看数据
  3. 右键点击预览也可以预览数据结果
  4. 右键启用缓存然后点击执行,执行成功之后,可以在右键的SmartDI表中查看所有读取的数据信息。
数据源

用户输入

节点用途: 用户输入节点用于手动创建一个数据表。

操作方法:

配置选项卡

说明

**列属性窗口:**编辑修改字段名称、选择字段的存储类型,定义该字段的缺失值。

操作示例:

**案例需求:**用户手动创建一个成绩单数据表,登记每个学生的语文、数学、英文成绩。过程如下:

  1. 字段属性窗口定义各个字段名称和类型,学生姓名的字段类型为String,各科目成绩的类型为Double;如下图:

  1. 配置完成后,点击“确定”按钮,表的字段信息就配置完成了。双击单元格可以直接键入数据,如下图:

  1. 输入完成后点击“确定”按钮,右键启用缓存执行,便可以在右键菜单中通过用户输入表查看该表结果,如下图:

数据源

PMML

**节点用途:**读取已有的PMML格式的模型,通常用于模型的部署应用,比如将训练好的模型导出成PMML格式的文件

说明

操作步骤:

选择配置选项卡,如下图:

配置选项卡

说明

操作示例:

读取已有的PMML格式的决策树模型。节点配置如下:

点击浏览按钮,找到pmml文件,点击确定。右键启用缓存并执行后,在右键单击PMML模型,可以查看模型内容。

数据准备

数据准备

概述

(此页面暂无内容)

数据准备

Java代码段

(此页面暂无内容)

数据准备

Java选择器

(此页面暂无内容)

数据准备

自定义算法

(此页面暂无内容)

数据准备

名义值过滤

**节点用途:**筛选目标字段的取值等于选择的一个或者多个名义值的记录。

说明: 该节点只适用于测量类型为分类型的字段,配置过程中需使用元数据

前提条件:选取的目标字段的类型为分类型字段

操作步骤:

选择配置选项卡,如下图:

配置选项卡

说明

操作示例:

示例工作流中的统计案例用到了这一功能,原始数据如下:

员工基础信息表:

使用名义值过滤节点,过滤出所有工作类型为“State-gov”的记录,配置如下:

执行后,数据转换为,工作类型是“State-gov”的数据,如下图:

数据准备

抽样

节点用途: 从输入数据中抽取一个样本

**操作方法:**在配置对话框中可以指定抽样方法

定义抽取样本量

选取抽样方式

配置选项卡

说明

  1. 样本量**:**指定本次抽样所需样本数量
  2. 样本比例:按照总样本的一定比例抽取样本
  1. **前n个:**抽取前n条记录作为样本。如果现有的行数比指定的数小,则使用所有行。
  2. **等距抽样:**先将总体按照一定顺序排列,采用简单随机抽样,抽取第一个样本 (或称为随机起点),再顺序抽取其余的样本
  3. **简单随机:**指定样本量占总记录数的百分比。该值必须处在1到100之间
  4. **分层抽样:**是从一个可以分成不同子总体(或称为层)的总体中,按规定的比例从不同层中随机抽取样本的方法
  5. **等量抽样:**此方法总是包含第一和最后的行,对于剩余的记录,每隔一定间隔抽取一条记录,例如每隔三行。
  6. **固定随机数种子:**如果希望每次执行的结果不变,只需要勾选随机数种子即可。如果不勾选,每次执行会使用一个新的随机种子,多次执行的结果可能有所不同。

操作示例

案例:员工基础信息表,含有总样本32,561条记录,现在按照员工性别,分层抽样,抽取10%的样本。

  1. 配置节点,如下:

  1. 执行后,右键点击本节点,会有两个输出表,一个是样本表(按指定规则抽取的样本,3,257条数据),一个是过滤表(总样本-抽取样本, 29,304条数据)。

数据准备

汇总

节点用途:基于选中字段的唯一值对表中的行进行分组计算,生成汇总表

说明

操作方法:

  1. 在配置对话框中可以指定汇总方式,如下图:

配置选项卡

说明

汇总方式:

  1. 高级设置,为各类型字段进行批量定义汇总方法,在各类型字段对应的汇总方式列表中,勾选所需要的汇总方法(可多选)。
  2. **汇总方法:**单独为所选变量指定汇总方法,如下图位置中设定:

单独设定

  1. 执行后输出汇总表

汇总表展示汇总结果,但是为了能清晰看到汇总结果,建议对汇总结果的分组变量进行排序。

操作示例 如下:

案例:对员工基础信息表进行汇总,汇总方式为:按照教育程度国籍,进行分组后,按照列表汇总收入,按照总和,平均值汇总每周工时。

  1. 配置节点,如下图:

  1. 启用缓存,执行后,生成的**汇总表,**如下图:

数据准备

排序

节点用途: 按照用户指定字段,对数据进行升序或者降序排列。

操作方法:

  1. 在配置对话框中可以指定汇总方式,如下图

配置选项卡

说明

  1. 执行后,输出排序表

操作示例如下:

案例:对员工基础信息表进行排序,方式为:按照国籍降序教育程度升序对数据排序

  1. 配置节点,如下图:

  1. 启动缓存,执行后,生成的排序表如下:

可以看到,国籍按照字段降序,教育程度按照升序进行排序的数据。

数据准备

分区

节点用途: 将数据表随机分为训练集和测试集,训练集用于生成模型,测试集用于测试已经生成的模型。可以预判此模型对新数据的拟合优劣。

说明

操作方法 如下:

配置选项卡

说明

操作示例 如下:

通过配置选项卡,数据表得到新变量“分区”,将数据表随机分为训练数据和测试数据,执行后,右键查看分区表,训练集如下:

数据准备

合并

**节点用途:**将两个或多个数据表,合并到一张数据表中,使生成的数据包含更多字段信息。当您要合并来源不同的数据(如客户基本信息和客户消费信息)时,此操作非常有用。有以下两种合并数据的方式:

说明

操作方法如下:

配置节点,如下图:

输入选项卡:

说明

配置选项卡:

说明

数据链接案例解释:

要合并第一个数据表(语文成绩表)和第二个数据表(数学成绩表)。

输入表:

语文成绩表: id 姓名 语文成绩

001 张三 85

002 李四 70

数学成绩表:id 姓名 数学成绩

001 张三 90

003 王二 80

内链接合并后:id 姓名 语文成绩 数学成绩

新表: 001 张三 85 90

外部链接合并后:id 姓名 语文成绩 数学成绩

新表: 001 张三 85 90

002 李四 70 -

003 王二 - 70

左链接合并后:id 姓名 语文成绩 数学成绩

新表: 001 张三 85 90

002 李四 70 -

过滤选项卡:

该选项卡的功能是过滤左表和右表中,对于建模分析不需要的字段。通过点击“过滤”列的 ,合并后的表,将不再输出不需要的字段。

操作示例 如下:

案例: 合并学生的语文成绩表和数学成绩表。输入表如下图,合并为一个表

通过配置该节点,选择“关键字”合并,选择好关键字字段以后,点击“左链接”。确认后查看合并表

数据准备

追加

节点用途: 用于将多个表追加到一张表中

说明

操作方法如下:

输入选项卡:

说明

配置选项卡:

说明

配置好节点后,就执行启用缓存,就可以查看追加表。

操作示例如下:

案例:追加两个表,1班同学的数据成绩(4个学生)和2班的数学成绩(5个学生),配置追加节点如下图:

执行后,查看生成的**追加表,**数据表有9个学生,如下图

数据准备

选择

**节点用途:**将输入表的数据拆分成两部分,一部分为符合指定条件的数据记录,可以在第一个输出端口中查看,另一部分为过滤掉的数据记录,可以在第二个输出端口中查看。

操作方法 如下图:

配置选项卡:

说明:2种数据选择方式

  1. 类型变量,可以选择**模式匹配,**进行多项选取
  2. 数值型变量,可以选择范围匹配,定义数据选择的上限下限
  3. 仅匹配缺失值,按照字段是否是缺失值,来分组数据。

**输出端口:**选择表和过滤表

操作示例 如下:

案例:选择出员工信息表中所有婚姻状况是“Divorced”的数据。

员工信息表中有32,561条数据记录。

配置选择节点,选择“行属性”,选择匹配条件字段为“婚姻状况”,在模式匹配中,选择“Divorced”。

执行后,右键查看选择表如下图,仅有4443条记录。

数据准备

转置

**节点用途:**用于转换数据的行列显示方式,新生成的数据表,可以用新的字名,或者延用数据转置前的字段名

**端口:**数据收入端口;转置数据输出端口

操作方法:

配置节点,如下图:

图2-12-1

配置选项卡:

说明

**操作示例:**将数据-数学成绩表进行转置。

1 配置节点如图2-12-1,选择从字段读取后**,点击“读取值”,**在转置中

添加所有变量。

2启用缓存,并执行后,查看转置表 ,如下图

数据准备

参考行过滤

节点用途: 将第一个输入表,按照第二个输入表中所选字段的条件,对数据进行过滤。

**前提条件:**第一个输入表,与作为参考表的第二个输入表对比时,需要有相同字段,这样两个数据才可以对比。

**端口:**2个数据收入端口;1个输出端口(参考行过滤表)

操作方法:

配置节点,如下图

图2-13-1

配置选项卡:

说明

操作示例 如下:

案例:参考表(收入<=50k),将员工信息表按照收入字段进行参考行过滤。

1 按照图2-13-1的方式配置节点

2 执行后,右键参考行过滤表,结果如下图:

进行过滤前,基础表含有数据32,561条记录,过滤后,输出表仅为收入<=50K的数据,记录为24,720条

数据准备

设为标志

**节点用途:**简化数据,为一个或多个名义字段值,派生的标志字段。

这个节点将选中字段的每个可能的取值分别转化为一个标志字段并将取值定义为新字段的名字,根据初始字段在每行的取值,相对应的新字段在同行单元格的取值为T,否则取值为F。这个节点添加的字段数等于选中字段定义的可能取值数。

操作方法:配置节点,如下图

图2-14-1

配置选项卡**:**

说明

操作示例:

案例:用设为标志节点对教育程度字段中博士,硕士,本科进行标志

1 节点的配置如图2-14-1:

2启用缓存执行后,生成的数据表如下:

数据准备

重新结构化

**节点用途:**根据名义字段或标志字段的值生成多个字段。

新生成的字段可包含来自另一个字段或布尔型(0和1)的值。通过本节点,可以借助另一个字段的值,创建任意类型的字段(包括标志字段)。而设为标志节点,只针对名义字段或标志字段的值生成多个标志字段,因此如果要创建标志字段,使用设为标志节点更为方便。

**操作方法,**如下图

配置选项卡**:**

说明

  1. **集字段:**选择一个或多个集字段,用于创建新字段的标识,将以集字段的值生成新的字段,而新字段取值基于汇总字段计算得到。
  2. 集字段选项卡中原则上也应该只支持整型或字符型字段。而且如果集字段中的取值越多则生成的字段越多,计算成本越高。

操作示例 如下:

配置节点如图:

原始数据如下:

在员工基础信息表中,分别查看不同收入,不同性别的员工平均年龄:

  1. 配置节点,分组,选择“收入”;
  2. **集合,**选择“性别”,添加字段值
  3. 汇总,选择“年龄”,汇总方式选择平均值
  4. 确定配置,右键启用缓存,并执行,查看生成的重新结构化表

执行后生成的数据表如下:

数据准备

时间选择

**节点用途:**对数据中的时间字段选择指定时间区间的所有记录。时间区间由一个起始日期和结束日期指定。

前提条件:数据中含有日期型数据,如果含有的时间数据不是日期型,需要进行字段的类型转换

操作方法:

配置选项卡:

设定所需要数据的起止时间点

数据准备

自定义选择

**节点用途:**自定义条件,过滤数据。

支持用户自定义函数表达式的方法设定选择条件,根据某个特定的条件(如 年龄>50)将输入表拆分成选择表和过滤表。

操作方法:

图2-17-1

配置选项卡

说明

配置节点信息后,启用缓存执行,右键查看输出:“选择表”和“过滤表

操作示例如下

案例:查看员工信息表中年龄为15-35岁的员工信息

配置节点,如图2-17-1,

步骤:

  1. 在函数库中找到“between( , , )”
  2. 在表达式第一个输入项中,双击变量“年龄”
  3. 在第二个输入项中,输入年龄下限:15
  4. 在第三个输入项中,输入年龄上限:35

执行后,查看选择表,结果仅为15-35岁年龄的数据,14,925条记录。如下图:

数据准备

去重

节点用途: 将数据表中,重复出现的记录剔除。

配置选项卡**:**

说明

操作示例 如下:

案例:将员工信息表,按照国籍进行去重。

配置去重节点,如下图:

图2-18-1

执行后生成的预览表如下,预览表中的数据已由原先的32,561条记录变成42条,重复记录已被去除,如下图。

图2-18-2

数据准备

提取字段名

**节点用途:**用于提前数据表中所含字段名称

本节点较为简单,不需要赘述。

节点配置图,以及结果输出表,参看图2-19-1

图2-19-1

数据准备

插入字段名

**节点用途:**使用第二个输入表(字典表)对第一个输入表的字段进行重命名字典表至少要包含两个列,一列为原有字段名,用来对第一个输入表的字段进行查找匹配,另一列为将要替换的新字段名。

节点配置:

配置选项卡:

说明

数据准备

平衡

**节点用途:**使用平衡节点修正数据集中的不平衡,以便它们符合指定的检验标准。

说明

若某个数据集只有两个值(T和F),并且 90% 的观测值为F,而只有 10% 的观测值为T,这类现象成为样本失衡。

很多建模技术处理此类失衡数据都有困难,因为它们倾向于只学习这些F的结果,而忽略T的结果(因为这些结果少的可怜)。如果数据平衡很好,T和F结果具有大致相同的数量,那么模型将更有可能找出分辨这两个组的模型。

这种情况下,平衡节点对于创建平衡指令,从而减少带有F结果的观测值数量非常有用。

操作方法:

配置选项卡:

说明

  1. 名义值:显示的是所选分类字段的取值。
  2. 倍数是样本平衡处理的指数,这个需要用户指定。

如果值小于1,则为欠抽样,即随机去掉一定比例样本,使其减少。

如果值大于1,则为过抽样,即多次有放回的抽取类样本,使其增加。

如果值都是1,则执行后不发生任何改变。

数据准备

RMF汇总

**节点用途:**根据指定的用户ID, 对其交易金额、交易频次、时间间隔进行汇总, 输出用户ID的交易总金额、交易频次、最近一次交易时间间隔。

配置选项卡:

说明

数据准备

类型

节点用途: 主要是为了计算或更新字段的元数据,包字段测量类型、值域和缺失,以及指定字段的角色。

比如,分类预测类模型都需要指定一个目标变量,所以必须通过类型节点的角色功能。首先指定一个字段的角色为目标,指定影响因素的角色为输入,这样模型节点就可以自动识别目标字段,并将其作为目标变量,而输入字段被作为自变量,参与训练模型。

配置选项卡:

说明

比如说,通常条形图的分类字段必须为字符型,但是对于一个取值不是很多的整型字段作为分类,统计该字段每个整数值的计数并可视化展现有时也是很合理的,所以通过类型节点无需转换字段的存储类型,只要将该字段的测量类型改为名义型即可以使用条形图进行展现。

注意:字段的测量级别与字段的存储类型不同,后者表明数据是以字符串、整数、实数、日期、时间还是时间戳存储。

如果在类型节点中已经统计出字段中是否有缺失值,模型运算时可以提前获知数据集中是否有缺失值,并根据已经指定的缺失值处理方法,快速做出响应。

  1. 角色为目标,表示该字段为目标变量;
  2. 角色为输入,表示该字段为自变量;
  3. 角色为记录ID,表示该字段为标识型字段,不参与建模;
  4. 角色为无,表示该字段不参与建模,但是模型预测表中仍保留该字段,这是将字段的角色设置为无与直接使用过滤节点将该字段过滤掉的区别,对于标识分析对象的字段(如客户编码)来说,这个功能特别有用。

操作示例 如下:

工作流中的“平稳时间序列模型”案例中使用了这一功能,

为了构建平稳时间序列模型,需要把利润字段设为目标,日期,销量字段均设置为**输入,**配置如下:

这样就可以进行后续的时间序列建模操作了。

数据准备

过滤

节点用途: 用于过滤不需要的字段,或者对字段进行重命名。

操作方法:

  1. 配置节点

图2-24-1

配置选项卡:

说明

  1. 配置好节点好,启用缓存,执行
  2. 查看过滤表
数据准备

分列

**节点用途:**将数据字段中的值,按照某种统一规则进行拆分。与excel中的数据分列用途,方法基本一样。

操作方法 如下:

  1. 配置节点

图2-25-1

配置选项卡:

说明

  1. **基于分隔符:**选择或输入分隔符号
  2. **固定宽度:**定义划分的数据宽度
  1. 确定配置,启用缓存,执行。
  2. 查看输出表-分列表

操作示例:

案例:在员工基础表中,收入字段的值为“<=50K”和“>50K”,为了下一步建模分析,希望把字段值中“K”去掉。

首先,引入数据-“员工基础表”,按照图2-25-1,配置分列节点:

  1. 使用“基于分隔符”
  2. 选择“其他”,输入“K”
  3. 预览后,确定
  4. 启用缓存,执行后,结果如下图:

结果中,原收入字段保留,新生成分列好的字段。

数据准备

类型转换

节点用途: 将一个字段或一组字段从一种数据类型转换为另一种数据类型。

在数据挖掘过程中,不同类型的字段的处理方式是不一样的,所以有时需要对字段的类型进行一下转换,再进行下一步的分析。例如,将字符型转换为数值型、数值型转换为字符型等。

操作方法 如下:

  1. 配置节点

配置选项卡:

说明

  1. **字符串到数值:**将字符型的字段转换为数值型。一次可以处理多个字段
  2. **数值到字符串:**将数值型(整型和浮点型)字段转换为字符型字段。一次可以处理多个字段。
  3. 浮点到整型:将浮点型字段转换为整数型字段。浮点数转换为整数时,有四舍五入取整向上取整三种方式,其中取整表示只取整数部分,小数部分忽略,向上取整表示整数部分加1。一次可以处理多个字段。
  4. **字符串到日期:**将存储为字符型的日期字段转换为日期型。一次只能以处理一个字段。从可用列框中选择一个要转换的字段。并选择该字段中日期值的格式,也可以手动输入日期值的格式,程序将根据指定的日期值格式来解析该字段并生成日期字段。
  5. **日期到字符串:**将日期型字段转换为字符型字段。此处字段选择框只能选择日期型的字段。另外,必须正确的指定该日期字段的格式。
  6. **集合到字符串:**将集合类型字段转换为字符型字段。
  7. **字符串到集合:**将字符串型字段转换为集合型字段。

操作示例:

案例:在时间序列分析中,原始数据中日期字段是字符串形式,但是为了做时间序列预测,需要对日期进行类型转换,从字符串类型转换到日期类型。

  1. 配置节点,选择:“字符串到日期”

观察日期字段中,数值为“12/31/1979”,在日期格式中选择“MM/dd/yyyy”

  1. 确认配置,启用缓存后,执行。

执行后生成的数据表规格如下图,日期字段,已经被转换成日期类型。

数据准备

缺失填充

节点用途: 用来处理输入表中的缺失值。

操作方法:

  1. 配置节点,如下图:

配置选项卡:

说明分为两类——整型字段和字符型字段

如果需要对数据中相同类型的不同字段,进行差异化的缺失值填充,那么可以使用高级选项卡,选定数据表中的字段,制定缺失值填充方法。

操作示例如下:

案例:员工基础信息表中,字段国籍中,含有缺失值,现在对这一字段进行缺失值填充。

由于字段国籍,目前是字符串类型,故在配置时:

  1. 选择高级选项卡,选中国籍,并添加
  2. 进行“删除”操作

执行后生成的缺失填充表中,国籍字段中,不在有缺失值。

数据准备

参考列过滤

**节点用途:**可以参照第二个输入表(参考表)过滤掉第一个输入表中的字段。根据对话框的设置,在输出表中,参考表的字段被包含或排除。

操作方法:

节点配置,如下图

配置选项卡:

说明

案例:参考表2,将表1中多余变量删除,简化数据,提升系统效率。

表1与表2中相同字段有“学号”“姓名”。

如图2-28-1,配置该节点后,执行后的参考列过滤表中,仅为表1中去除学号,姓名后的数据。

数据准备

填充

**节点用途:**功能是基于第二个输入表(字典表)某个字段的值来替换第一个输入表某个字段的值。

从字典表中选择一字段(或者行ID)作为匹配查询的依据,再选择另外一个包含新值的字段作为替换字段。所有目标字段中与查找值匹配的项都将被替换为替换字段中对应的值。

操作方法:

节点配置,如下图

配置选项卡:

说明

  1. 输入(查询):从字典表中选择的查询字段,将会基于该字段与目标字段中的值进行匹配,如果相等,第一个输入表中该字段的值将会替换字段相应的值替换。
  2. 输出(替换):从字典表中选择的替换字段。
数据准备

自定义填充

**节点用途:**基于通配符或者正则表达式来实现替换字段取值的功能。

操作方法:

  1. 配置节点,如下图:

配置选项卡:

说明

注意:引用变量,需要在变量上加上引用符号“$”, 例如:用 $年龄$+1 替换年龄字段

操作示例 如下:

案例:由于成绩计算错误,所有学生的数学成绩都比实际高出了10分,现在要通过自定义填充节点减去这10分。

配置如下:

配置好节点后,启用缓存,并执行。

生成年龄数据已被全部改正,数学成绩比之前的数据表中少了10。

数据准备

组合

节点用途: 组合节点的功能与分列节点刚好相反,它是将多个字段的内容结合到一起,并生成一个新的字段。

配置选项卡

说明

数据准备

近似处理

节点用途: 根据指定的小数点位数或者有效数字使用指定的舍入方式对浮点型数据近似处理。只可以对指定的浮点型数据列执行此操作。

说明

输入 浮点型(*) 标准字符 简单字符 工程字符
1.23501 1.24 “1.24” “1.24” “1.24”
0.00000035239 0.000000352 “3.52E-7” “0.000000352” “352E-9”
-3.123103001 -3120000000 “-3.12E+9” “-3120000000” “-3.12E+9”

(*)注意由于”浮点型”输出选项在表示浮点数时的数值精度问题,可能会出现意料之外的结果。如0.1可能表示为0.09999999999999999。

操作方法:

1 配置节点,如下图:

图2-32-1

配置选项卡

说明

有7种不同的模式可供选择:

  1. 向上舍入:如果该值为正,则往远离0的方向近似的舍入模式。如果该值为为负,则向上舍入。如果是2.5取整后等于3,如是-2.5取整后等于-2。
  2. 负向舍入:向负方向舍入。如果是2.5取整后等于2,如是-2.5取整后等于-3。
  3. 远离0取整:向远离0的方向取整。如果是2.5取整后等于3,如是-2.5取整后等于-3。
  4. 向0取整:往小于该值的方向近似的舍入模式。如果是2.5取整后等于2,如是-2.5取整后等于-2。
  5. 四舍五入:四舍五入的舍入模式。如果是2.5取整后等于3,如是2.4取整后等于2。
  6. 五舍六入:五舍六入的舍入模式(类似四舍五入,差别在于对于5选择向下近似)。如果是2.5取整后等于2,如是2.6取整后等于3。
  7. 四舍六入:四舍六入,如果等于五,则选择近似值为偶数的舍入模式。如果是2.4取整后等于2,如是2.6取整后等于3,2.5取整后等于2,3.55取整后等于4。

操作示例 如下:

案例:将数据中利润字段做近似处理

操作:节点配置,如图2-32-1,

确定后执行节点,生成的近似处理表为:

数据准备

标准化

**节点用途:**标准化节点的功能是对数值型字段进行标准化。

在设置对话框中可以选择要标准化的字段,有三种标准化方法。

操作方法:

配置节点,如图:

图2-33-1

配置选项卡:

说明

Min-max标准化方法是对原始数据进行线性变换。设minA和maxA分别为属性A的最小值和最大值,默认最小值为0.0,最大值为1.0。将A的一个原始值x通过min-max标准化映射成在区间[0,1]中的值x',其公式为:

x'=(x –min(x))/(max(x)- min(x))

这种方法基于原始数据的均值和标准差进行数据的标准化。将A的原始值x使用z-score标准化到x'。z-score标准化方法适用于属性A的最大值和最小值未知的情况,或有超出取值范围的离群数据的情况。

x'=(x –mean(x))/stdev(x)

z-score标准化方法可以回答这样一个问题:”一个给定值距离平均数多少个标准差”。在平均数之上的值会得到一个正的标准值,在平均数之下的分数会得到一个负的标准值,标准化后的变量值围绕0上下波动,大于0说明高于平均水平,小于0说明低于平均水平。这是一种可以看出某值在分布中相对位置的方法。标准值能够真实的反应一个值距离平均数的相对标准距离。

通过移动数据的小数点位置来进行标准化。小数点移动的位数取决于字段的最大绝对值,直到变换后的最大绝对值小于等于1。然后所有的其他值移动相同的位数。

操作示例如下:

为了比较数据表中的权重字段,要进行标准化处理,配置如图2-33-1:

按照Min-Max方法进行标准化

执行后生成的数据表中,权重的数值已经是从0-1的数,如下图

数据准备

延迟

节点用途: 根据指定的延迟和延迟间隔从前面的记录中将字段的值复制到当前记录。一般都是按周期性复制。

说明

根据指定的延迟_L_确定要生成多少个所选字段的副本,根据延迟间隔_I_确定延迟几条记录。生成延迟字段名称由原字段名加编号组成,编号根据延迟_L_和延迟间隔_I_确定,每个延迟字段的编号为_I_, 2*I, 3*I, ...L*I。例如,如果_L=3_,I=1,则字段的编号为1,2,3;L=3I=2,则字段的编号为2,4,6。编号也表示该字段第一个不为空的起始行。

延迟节点在做时间序列预测时特别有用,尤其可以和线性回归算法一起使用,可以建立基于线性回归算法的时间序列预测模型。通过该节点可以计算预测序列的同期值:延迟为1则表示生成一个同期序列,当前记录的值就等于一个周期_I_之前的数据,_I=1_则新生成延迟字段的值都等于它原字段上一条记录的值,_I=12_则新生成延迟字段的值都等于原字段往前数第十二条记录的值;延迟为2,则表示生成两个同期序列,生成的第一个延迟字段当前记录的值就等于一个周期_I_之前的数据,_I=1_则新生成延迟字段的值都等于它原字段上一条记录的值,_I=12_则新生成延迟字段的值都等于原字段往前数第十二条记录的值。而第二个延迟字段当前记录的值就等于上一个延迟字段之前的数据,_I=1_则新生成延迟字段的值都等于上一个延迟字段上一条记录的值,_I=12_则新生成延迟字段的值都等于上一个延迟字段往前数第十二条记录的值。

图2-34-1

配置选项卡:

说明

**案例:**生成时间序列数据中销量字段的延迟数据

建立工作流如下:

按照图2-34-1对节点进行配置,执行后生成数据如下图:

数据准备

字段重排

节点用途: 字段重排节点的功能是基于用户定义的设置改变输入表中字段的顺序。

**操作方法:**节点配置如下图:

配置选项卡:

将选中的字段,进行位置上的操作。向上或向下移动一个位置等等。如果选中字段已经移动到了列表的最顶端或最底端,再移动就会移到列表的另一端。

数据准备

RFM分级

**节点用途:**根据指定的用户最近一次交易间隔、交易频次及交易总金额来得到用户分级。

配置选项卡:

说明

数据准备

分箱

**节点用途:**这个节点对数值型数据按一定间距进行分组,称为分箱。

节点配置:

配置选项卡:

说明

  1. **固定箱数:**通过调整箱数大小,确定自动分箱的数量
  2. **固定宽度:**确定分箱的宽度。程序将根据指定的宽度进行分箱并确定分箱的箱数
  3. **分位数:**使用分位数进行分箱,可以选择的有“四分位数”、“十分位数”、“二十分位数”,还可以自定义分位数
  1. 编号,则以“Bin”为前缀进行依次编号命名,如 Bin 1,Bin 2等
  2. 边界,则以分箱区间为分箱名,如“(a,b]”
  3. 中点,则以分箱区间的中点为分箱名。
数据准备

日期时间提取

节点用途: 从已有的日期时间字段中提取日期(年、季度、月、周、日)、时间(时、分、秒)等生成可用的字段。例如,生成年份字段、月份字段、日字段等。

**前提条件:**目标数据中需要有日期类型的字段。,如果日期字段是其他类型数据,则需要提前将该字段进行类型转换。

操作方法 如下:

1 节点配置,如图:

图2-38-1

配置选项卡

说明

2 配置好节点后,启用缓存,执行后,可查看输出表

数据准备

时间偏移

**节点用途:**对一个日期字段,按照指定的偏移量,做偏移。您首先需要选择一个日期字段,然后指定一个偏移量,偏移量可以是一个整型的字段,也可能是一个常量。

操作方法

  1. 配置节点,如下图

图2-39-1

配置选项卡:

说明

  1. 确认配置后,启用缓存,并执行,查看时间偏移表。

操作示例 如下:

案例:表中数据有误,记录年份都比实际年份早一年,可以使用时间偏移节点进行修改,节点配置,如图2-39-1:

执行后生成的数据表,偏移时间比源数据日期推迟了一年,如下图:

数据准备

时间差

节点用途: 计算连个时间点的间隔。

可以用于计算该选择的日期时间字段与当前执行时间的间隔,或者计算与一个指定的固定时间的间隔,也可以计算该字段与另外一个日期的差,还可以计算该字段每一行与上一行的差。

操作方法:

1 配置节点,如图:

配置选项卡:

说明

  1. **执行时间:**计算指定日期与执行时间的差。
  2. **固定时间:**计算指定日期与固定时间的差,在对应位置填入时间
  3. **前一行:**计算指定日期字段中,本行日期与上一行日期的差,第一个 单元格为缺失值。
  4. **第二字段:**计算第一个指定日期与数据中第二个日期的时间差,在对应位置设定第一个时间字段,第二个时间字段。

操作示例 如下:

案例:计算数据表中的时间,与当前时间的时差,插入时间差节点,配置如图2-40-1:

当前时间为2018-09-19

执行后生成的数据中“时间间隔”显示,一些数据距今39年,过早。可以考虑是否删除过早的历史数据。

数据准备

时间区间

**节点用途:**为用于时间序列建模节点或时间散点图节点的时间序列数据指定间隔并生成标签,以便于估计或预测。

说明

操作方法 如下:

  1. 节点配置 如下图:

图2-41-1

配置选项卡:

说明

这种方式,可以用”汇总设置”,指定数据汇总方式。

汇总设置

  1. **汇总函数。**分不同类型的字段进行汇总
  2. 数值型:用于连续字段的可用函数包括总和、均值、最小值和最大值。
  3. 字符型:选项包括模式、第一个。”第一个”表示汇总组中的第一个非 Null 值(按日期排序)。
  4. 布尔型:选项包括任一值为真则为真和全部为真则为真。
  5. **填充函数。**不同类型的数据,可选择不同的填充函数进行数据填充。
  1. 配置好节点后,启用缓存,并执行。

操作示例 如下:

案例: 对以后的85年-95年历史数据进行时间序列进行年度预测,在建立模型之前,需要把历史数据按照年度汇总好。此时,需要时间区间节点,将数据重新加标签。

1 时间区间节点配置如图2-41-1:

2 确认,执行后生成的数据表如下,数据已经按照年度时间序列整理好,可以进行之后的时间序列预测的建模分析。

数据准备

派生

字段用途: 可以根据一个或多个现有字段创建四种类型的新字段

*请注意,表达式区分大小写。

操作方法 如下:

  1. 节点配置 如下图:

图2-42-1

配置选项卡:

说明

派生新字段通常需要使用特殊的函数或数学表达式。所有类型的派生对话框中都提供了函数库,用于帮助创建这些表达式,节点也会对编辑的表达式做检查。

注意:

  1. 选择以公式派生新字段时,此表达式不能是条件表达式。要根据条件表达式派生值,请使用标志或条件类型的派生节点。
  2. 要返回空字符串,应键入一对引号,之间不包含任何内容,如 ““。例如,空字符串通常可用作假值,以使真值在表中更为明显。类似地,如果希望某个字符串值在其他情况下被视为数值,应使用引号。
  3. 配置好节点后,启用缓存,并执行。

操作示例如下:

案例: 销量利润数据表中,仅有日期,销量,利润三个字段,但是想看当时是简单产品的单价。这时候就要用派生节点。

1 按照图2-42-1,配置节点。单价=利润/销量

2 执行后生成的派生表如下,可以看到每个时间点的产品单价

数据准备

2.43 重新编码

**节点用途:**重新编码节点将名义型字段的每一个类别映射为一个整数。这个节点可以同时处理多个字段。

操作方法 如下:

  1. 节点配置 如下图:

图2-43-1

配置选项卡:

说明

  1. 配置好节点后,启用缓存,并执行。

操作示例 如下:

案例:员工基础信息表中,字段收入的值为“<=50K”和“>50K”。为了方便做分析,需要对其进行重新编码。

  1. 配置节点,如图2-43-1.
  2. 确定配置,并执行后,生成的数据如下图,经过重新编码,“<=50K”编码为1,“>50K”编码为2.

数据准备

2.44 大小写转换

节点用途: 大小写转换节点的功能是将所有的字母字符都转换为小写或大写。

仅对字符型字段可用。

操作方法 如下:

  1. 节点配置 如下图:

配置选项卡:

说明

  1. 配置好节点后,启用缓存,并执行。

本节点功能简单,易于理解,不做案例展示。

数据准备

2.26 序列缺失填充

节点用途: 用来处理输入表中的缺失值,但是填补缺失值的方法跟数据相关,用下一个、上一个记录来填充,或者用线性序列,平均值等填充缺失值。

操作方法:

  1. 配置节点,如下图:

配置选项卡:

说明分为两类——连续字段和分类字段

如果需要对数据中相同类型的不同字段,进行差异化的缺失值填充,那么可以使用高级选项卡,选定数据表中的字段,制定缺失值填充方法。

操作示例如下:

案例:员工基础信息表中,字段国籍中,含有缺失值,现在对这一字段进行缺失值填充。

由于字段国籍,目前是字符串类型,故在配置时:

  1. 选择高级选项卡,选中国籍,并添加
  2. 选择“下一个”填充方法

执行后生成的缺失填充表中,国籍字段中,不在有缺失值。

可视化探索

可视化探索

概述

连接到新数据源时,Edata将该数据源中的每个字段分配给数据窗格的“维度”区域或“度量”区域,具体情况视字段包含的数据类型而定。如果字段包含分类数据(例如名称、日期或地理数据),SM将其分配给“维度”区域;同理如果字段包含数字,SM则会将其分配给“度量”部分。

那么,可不可以说维度就是包含分类数据(例如名称、日期或地理数据)的字段,度量就是包含数字的字段?以这些断言作为出发点是足够准确的,但当您在 SM可视化中工作时,请记住您可以控制视图中字段的定义。根据用户的要求,大多数字段都可用作维度或用作度量,并且可以为连续或离散。 SM将字段分配给“维度”区域或“度量”区域进行初始分配时建立了默认值。当您单击并将字段从“数据”窗格拖到视图时,SM将继续提供该字段的默认定义。如果从“维度”区域中拖动字段,视图中生成的字段将为离散字段;如果从“度量”区域中拖动字段,生成的字段将为连续字段。

可视化探索

条形图

节点用途: 以条形图,可视化所选择的名义字段的每一个取值的统计。统计的方式有计数,最大值,最小值等。

操作方法:

  1. 配置节点,如下图:

图3-1-1

配置选项卡:

说明

图3-1-2

图3-1-3

操作示例

案例:统计诊病数据表中药物的使用具有重要的意义,我们可以根据药物的使用多少的信息,为下一阶段药物的储备做参考依据。原数据表如下图:

按照图3-1-1,配置条形图节点,执行后,可视化条形图结果为:

可视化探索

散点图

节点用途: 对两个选中的变量绘制散点图,易于了解数据分布形态,判断两变量之间是否存在某种关联或总结坐标点的分布模式

说明:所有的数据点将作为点显示在相应的位置。只有有效域的列,才可以显示在这个视图中。确保前面的节点已执行,或者通过域计算器节点定义域。

操作方法:

  1. 配置节点,如下图:

图3-2-1

配置选项卡:

说明

2 确认配置节点,执行并查看散点图

案例:销售利润表中,查看销售量与利润之间的关系。

配置节点如图3-2-1:

节点运行后,执行结果:

可视化探索

直方图

节点用途: 展示字段数据值的分布状况。对分类字段,选择直方图展示数据。选取分类的字段,汇总则以选取的汇总字段来汇总,同一分类下不同的汇总,软件自动以不同的颜色显示。

操作方法:

  1. 配置节点,如下图:

图3-3-1

配置选项卡:

说明

2 配置好节点后,执行并查看视图

案例如下:

查看销量利润表中的,销量数据的分布

节点配置如图3-3-1,选择销量作为分箱,度量变量,度量选择计数,并执行。

执行结果为下图:

可视化探索

箱线图

**节点用途:**箱线图(Box-plot),是一种用作显示一组数据分散情况资料的统计图。因形状如箱子而得名。它主要用于反映原始数据分布的特征,还可以进行多组数据分布特征的比较。

节点配置:

图3-4-1

配置选项卡:

说明

**案例:**按照图3-4-1进行节点配置,执行后查看视图,如下图:

可视化探索

饼图

节点用途: 通过饼图,展示数据的分布比例。如果要突出显示或者动态的更改饼图列或者汇总列,需要在交互饼图中实现。

操作方法:

  1. 配置节点,如下图:

图3-5-1

配置选项卡:

说明

2. 配置好节点后,执行并查看视图

案例如下:通过饼图看下数据中性别比例

配置节点,如图

执行结果:

可视化探索

词云

**节点用途:**选择一个词汇字段,一个词频字段,绘图展示词汇出现的频次大小。

操作方法:

  1. 配置节点,如下图:

图3-6-1

配置选项卡:

说明

2. 配置好节点后,执行并查看视图

案例: 将度假关键词频数,做成词云。

配置词云节点,如图3-6-1,执行后的词云如下:

可视化探索

趋势图

节点用途: 将数值在坐标的纵轴中体现,绘制成一条线,以便数据变化规律的趋势。列的值在图中对应为y轴坐标, 如果列中值的差异非常大可以会使视图扭曲。

操作方法:

  1. 节点配置,如下图:

图3-8-1

配置选项卡:

说明

2. 配置好节点后,执行并查看视图

案例: 在85-95年的销售利润表中,将销售量按照年度展示

线图节点配置如图3-8-1,

执行结果如下:

可视化探索

地图

节点用途:用于在地图中展示位置或区域的特征表现,提供指定地理字段、度量字段及统计的方式,然后将最后的结果展示到地图上。

C:\Users\elaixin\Documents\Tencent Files\1010333038\Image\C2C\646MB4SBOG@5)XBFCAWI~U1.jpg

对话框选项

经度/纬度

如果有经度和纬度字段,拖入这两个配置框。

颜色

拖入一个字段可以渲染地图的颜色。

大小

拖入一个字段可以渲染点地图的点的大小。

文本

拖字段进入文本框,将会增加标记的标签显示。

详细信息

拖入字段进入详细信息,如果是维度字段将会分割标记,如果是度量字段会添加到标记的悬停信息中。

端口

输入端口

0 输入需要展示的数据。

视图

地图

按照所选显示参数,显示最后图形,同时可以交互修改字段及配置信息。

可视化探索

雷达图

节点用途: 这个节点为每一行添加一个雷达图。每一个这样的图总结了两个值之间的关系。它还显示一个选择范围,简化了在给定的范围内识别值。值被描绘成一个丝带连接轴。丝带的颜色、范围、和背景是完全可自定义的。

操作方法:

  1. 配置节点,如下图:

图3-9-1

配置选项卡:

说明

案例如下:

将诊断数据中按照药物的种类进行钠,钾总量汇总进行可视化对比

雷达图节点配置如图3-9-1:

药物作为分类字段,钠,钾作为度量字段,按照求和汇总。

执行结果如下:

可视化探索

自助可视化

节点用途: 自助可视化节点囊括了之前所有的可视化探索的图形显示节点的功能,如同一个工具箱,可以根据需要再图形推荐板里选取适合的图形显示数据。

使用方法类似大数据工具下的自助可视化。

可视化探索

节点用途: 在表格视图展示数据。如果行数未知,视图会在打开时计算行数。

节点配置如图:

该节点配置很简单,可在最大显示记录数中设置显示的数据数,如果超出数目设置则只显示设置数目,如果未超出则显示现有数据

统计学习

统计学习

概述

(此页面暂无内容)

统计学习

数据审核

节点用途: 通过数据审核,可以大致了解数据内容,还可以审核数据质量。描述一列数据的特征,可以计算出最大值、最小值、平均数、总数、众数、中位数、方差等数据来进行描述。

操作方法:

  1. 配置节点,如下图:

图4-1-1

配置选项卡:

说明

  1. 确认配置后,执行并查看视图

操作示例:

将员工信息表中数据字段,按照图4-1-1配置后,执行,并查看视图

统计学习

相关分析

**节点用途:**研究两个或两个以上处于同等地位的随机变量间的相关关系,变量之间是否有关系,以及有关系的程度。

操作方法:

  1. 配置节点,如下图:

图4-2-1

  1. 确认配置后,执行并查看视图

操作示例:

将员工信息表中数据字段,按照图4-2-1配置后,执行,并查看视图,性别,收入之间,相关系数为0.216,相关性小,性别于教育程度的相关系数近0.096,相关性也很小,教育程度于收入的相关系数为0.369,相关性较高一点。

统计学习

单样本T检验

**节点用途:**检验单个字段的均值与指定的常数检验值的差异是否显著。对于每个检验字段,均可输出该字段的描述性统计量(均值、标准差和均值的标准误)和T检验结果(如P值、置信区间等)。

例如:某生产商可以用此方法检验一批生产线的平均日产量是否等于100。

节点配置:

配置选项卡:

说明

机器学习

机器学习

概述

(此页面暂无内容)

机器学习

分类预测

线性回归

**节点用途:**线性回归可以用来研究一个或多个自变量对一个目标字段的影响重要程度,或者对目标字段进行预测。

使用条件:

节点输出:

操作方法:

  1. 在配置对话框中可以指定汇总方式,如下图:

图5-1-1-1

配置选项卡:

说明

  1. 确认配置后,执行并查看视图,以及预测表

线性回归结果

显示估计的系数和模型评估结果。

散点图

散点图用于展示输入数据点和回归线。Y轴为目标字段,X轴为其中一个数值型自变量。 注意:如果有多个自变量,此视图只是一个近似的图。 图中将没有显示在视图中的变量设为平均水平,因此,这个视图在仅有少数自变量时比较准确。

案例如下:

以1952-1988年中国农业实际国民收入指数序列为数据创建如下工作流:

连接线性回归模型配置节点如下:

执行结果如下:

利用表节点输出结果如下:

逻辑回归

节点用途: 测量一个分类型目标变量与一个或多个自变量之间的关系。

目标字段可以是二分类,也可以是多分类的;自变量可以是数值型的,也可以是分类型的,当自变量为分类型时将转化为多个哑变量进行分析。 逻辑回归可用于研究影响目标字段的因素的重要性、预测和判别。

在流行病学中有着广泛的应用,如探索某疾病的危险因素,根据危险因素预测该疾病发生的概率。

前提条件:

节点输出:

操作方法:

  1. 在配置对话框中可以指定汇总方式,如下图:

图5-1-2-1

配置选项卡:

说明

  1. 自动:模型自动识别目标变量的分类数;
  2. 二分类目标:用户指定目标变量是二分类的;
  3. 多分类目标:用户指定目标变量是多分类的;
  1. $LP_0表示模型预测的该记录不流失的概率
  2. $LP_1表示模型预测的该记录流失的概率
  3. 其中$LP_0+$LP_1=1
  4. 默认勾选
  1. 确认配置后,执行并查看视图,以及预测表

案例如下:

在软件自带案例“客户流失分析模型”中使用了该节点,工作流如下:

该节点配置如图5-1-2-1。

执行结果如下:

朴素贝叶斯

**节点用途:**使用给定的训练数据创建一个贝叶斯模型, 进行分类预测。 它为名义型字段计算其所有值的记录数,为数值型字段计算高斯分布概率。

前提条件:

节点输出:

操作方法:

  1. 在配置对话框中可以指定汇总方式,如下图:

图5-1-3-1

配置选项卡:

说明

  1. $NBP_0表示模型预测的该记录不流失的概率
  2. $NBP_1表示模型预测的该记录流失的概率
  3. 其中$NBP_0+$NBP_1=1
  4. 默认勾选
  5. 确认执行后,查看输出结果:

案例如下:

将朴素贝叶斯算法应用到信用评分模型,该案例的工作流分为三个部分:数据理解与探索、建模和应用,该部分的工作流图如下:

NB流程

其他节点不在这里赘述了,本节点配置如图5-1-3-1,执行后查看结果:

执行结果:

  1. 输入变量的重要性,如下图所示

NB变量重要性

  1. 输入变量统计表,即在预测结果的各个类别下,输入变量的统计指标。

NB统计表

  1. 预测数据,也就是针对每条记录的预测结果和针对预测结果的概率,如果在设置中已勾选,还会输出模型预测的每条记录的流失/不流失的概率。

  1. 输出PMML模型结果并提供PMML模型导出功能,可在其他节点或者其他软件中调用已建好的模型。

一般,朴素贝叶斯模型生成后,使用评估节点,进行评估。结果如下图所示,对于测试集的预测准确度达到76.3%,是个不错的预测水平。

NB 评估

图 朴素贝叶斯算法评估结果图

还可以针对流失用户和非流失用户分别评估模型结果,以进一步保证模型的有效性。

分类预测器

**节点用途:**使用一个训练好的分类预测模型对新数据进行预测。

输入模型,输入数据,默认配置执行,就可以查看数据的分类结果。

C4.5

节点用途: 该节点包含可以进行分类预测的决策树算法。决策树(Decision Tree)是在已知各种情况发生概率的基础上,通过构成决策树来求取净现值的期望值大于等于零的概率,评价项目风险,判断其可行性的决策分析方法,是直观运用概率分析的一种图解法。由于这种决策分支画成图形很像一棵树的枝干,故称决策树。

说明

  1. 数值型字段通常进行二元分割, 根据确定的分割点将数据分成两个分区。
  2. 名义型字段可以是二元分割也可以是多元分割,甚至是每一个名义值为一个分割点
  3. 该模型该提供了两个计算分割质量的算法

节点输出:

操作方法:

  1. 在配置对话框中可以指定汇总方式,如下图:

图5-1-5-1

配置选项卡:

说明

  1. 确认配置后,执行并查看视图,以及预测表

案例如下:

该节点的使用在软件中自带案例“信用评价模型”案例中的工作流如下:

该节点配置如图5-1-5-1,设置为默认值。

执行结果如下:

预测数据中显示了每条记录的分类预测值,同时输出分类规则,可使用分类预测器节点,将决策树的规则用来对同源但未知分类的数据进行预测。

LSVM

节点用途: 该节点使用输入的数据建立支持向量机训练模型。它支持许多不同的内核(双曲正切函数 、多项式和径向基函数)。支持向量机训练模型支持分类型字段(通过计算每一个类值和其余类值的双曲正切函数),不过这会增加执行时间。

操作方法:

  1. 在配置对话框,如下图:

图5-1-6-1

配置选项卡:

说明

  1. 确认配置后,执行并查看视图,以及预测表

案例如下:

以“信用卡违约数据”建立如下工作流:

节点配置如图5-1-6-1,确认配置后,执行节点。

结果如下图,通过LSVM算法预测,对客户进行是否违约预测:

多项式回归

节点用途: 与线性回归一样,多项式回归模型可以研究一个或多个自变量对一个目标字段的影响重要程度,或者对目标字段进行预测。不同的是,多项式回归用来研究非线性关系,如种植密集度对粮食产量的影响。
  该节点的目标字段必须为数值型字段。使用该节点前需要先用一个类型节点指定参与分析的字段的角色,目标字段的角色定义为目标,其他自变量的角色定义为输入。在配置界面指定多项式的最大阶数,系统默认执行二次多项式。 通过训练, 估计得出使得离差平方和最小的系数。节点可以输出预测结果、模型的参数估计以及PMML格式的模型,在有新的数据输入时,可以使用得到的PMML模型配合使用分类预测器节点对新的输入的目标字段进行预测。通过评估节点还可以评估预测效果。

操作方法:

  1. 在配置对话框,如下图:

图5-1-7-1

配置选项卡:

说明

  1. 确认配置后,执行并查看视图,以及预测表

随机森林

节点用途: 随机森林利用随机的方式将许多决策树组合成一个森林,每个决策树在分类的时候投票决定测试样本的最终类别

随机森林同时训练多个决策树,模型的结果由多个决策树基于投票策略决定。相比与决策树,随机森林模型更为稳定。

使用条件:

操作方法:

  1. 在配置对话框,如下图:

图5-1-8-1

配置选项卡:

说明

  1. 确认配置后,执行并查看视图,以及预测表

模型混合

节点用途: 模型混合节点可结合使用两个或多个模型块,这样所获得的预测会比通过任意一个模型获得的预测更为准确。通过结合多个模型的预测,可以避免单个模型的局限性,从而使整体准确性更高。一般情况下,以这种方式组合的模型所得的结果不但可以与使用单个模型所得的最佳结果相媲美,而且结果通常会更理想。

节点配置:

配置选项卡:

说明

KNN

**节点用途:**KNN即最近相邻元素模型。基于最近相邻元素算法对测试数据进行分类预测。底层算法使用KD树,应该表现出理想的性能,然而,这种类型的分类器只适合几千到一万左右的训练实例。执行中可以用所有数值型字段和欧式距离,而测试数据中所有的非数值型字段都将原样的出现在输出表中

节点配置:

C:\Users\elaixin\Documents\Tencent Files\1010333038\Image\C2C%QMO2I4GC$__3)W9`~61M%S.png

配置选项卡:

说明

贝叶斯网络

**节点用途:**贝叶斯网络是基于贝叶斯决策理论的分类算法。它假定变量之间存在相关性,并采用网络的方式描述变量之间的关系。

使用条件:

节点配置:

配置选项卡:

说明

高斯过程回归

**节点用途:**一种常用的监督学习方法,旨在解决*回归问题*和*概率分类问题*
使用条件:

节点配置:

配置选项卡:

说明

M5P回归树

节点用途: M5P回归树综合决策树和回归算法,用于处理目标字段为连续型的业务问题。

使用条件:

节点配置:

配置选项卡:

说明

机器学习

关联规则

关联规则

**节点用途:**该节点是一种基于Apriori算法的关联分析模型。

Apriori 节点会发现数据中的关联规则。关联规则是下列形式的语句:如果 条件 则 结果。 例如,”if 客户购买剃须刀和剃后产品,then 该客户还会购买剃须泡沫,并且置信度为 80%。” Apriori 从数据中提取一系列规则,提取的规则带有出现频率最高的信息内容。

使用要求: 要创建 Apriori 规则集,您需要一个或多个输入字段和一个或多个目标字段。 输入字段和输出字段(角色为输入、目标或两者的字段)必须是符号型字段。角色为无的字段将被忽略。 执行节点之前字段类型必须完全实例化。数据可以是表格格式,也可以是事务格式。

**算法强度:**对于较大的问题,Apriori通常处理速度快。它对于可以包含的规则数也没有任何限制,可以处理最多带有 32 个预条件的规则。 Apriori 提供了五种不同的训练方法,因此将数据挖掘方法与当前问题相匹配时可以实现更强的灵活性。

操作方法:

  1. 在配置对话框,如下图:

配置选项卡:

说明

  1. 建议在数据集较小时,选择Aprior
  2. 建议在数据集较大时, 选择FPGrowth

案例如下:

该业务流程包括,对初始数据进行处理,得到可以用于关联分析的事务数据,剔除掉单次购买且仅购买一种商品的购买记录后。连接关联规则节点进行分析,并对分析出的规则通过“置信度*支持度”的方式进行质量评估,最后经排序后选择高质量的关联规则。其整体流程图,如下。

关联规则流程

图5.2.1.1购物篮分析工作流图

第一步:产生用来生成关联规则的数据。关联规则节点可以接受两种数据形式:

  1. 以单项物品购买为记录的原始数据,数据中必须包括用户的唯一识别代码,如图5.2.1.2所示的“卡号”。

关联规则输入数据

图5.2.1.2

  1. 以事务为条目的数据格式,可以通过原始数据汇总(以用户唯一识别代码分组,汇总“物品”字段的列表)得到,数据格式如图图5.2.1.3所示,其中“列表(物品)”条目为事务数据; 图XX关联规则流程中以此种数据为例。

关联规则数据处理

图5.2.1.3 购物篮数据集

第二步:对数据进行处理,需要删除原数据中单次购买且只购买一件物品的用户记录。

第三步:将处理好的数据连接到关联规则节点,假定原数据为第二种格式,进行节点配置,配置完成后可以执行节点,输出结果。其配置图,如图5.2.1.4所示。

关联规则设置

图5.2.1.4 Apriori节点配置图

在完成了配置后,可以对节点进行执行,将输出训练规则,包括前后项及支持度和每条规则的置信度。如下图所示:

关联规则规则输出

图5.2.1.5

第四步:在输出训练表中,通过派生节点生成规则质量字段代表关联规则的质量。

规则质量=$置信度$ * $支持度$

第五步:对规则质量进行排序,查看高质量的规则。

关联规则高质量规则查看

图5.2.1.6关联分析输出数据集图

基于生成的规则,我们知道如果客户购买啤酒和蔬菜罐头的话,那么他有87.4%的可能性还会购买冻肉。同理还可以得到更多关于关联购买的规则。

子集匹配

**节点用途:**该节点用于寻找第一个输入表中与第二个输入表中匹配的所有子集。输出表中成对的输出子集和集。可以用这个节点寻找与给定项集匹配的所有事务。

**匹配方式:**模糊匹配, 至少有一个项集与子集匹配。

配置选项卡:

说明

项集搜索

**节点用途:**该节点提供了不同的算法去搜索频繁项集。集成的算法包括:Apriori、FP生长、RElim、SaM、JIM。

配置选项卡:

说明

  1. 建议在数据集较小时,选择Aprior
  2. 建议在数据集较大时, 选择FPGrowth

案例如下:

我们使用案例“41购物篮分析”中的数据建立如下工作流:

配置节点如下图:

执行结果如下图:

机器学习

聚类分析

DBScan

节点用途: 聚类的一种算法。

DBScan是一个比较有代表性的基于密度的聚类算法。与划分和层次聚类方法不同,本算法将簇定义为密度相连的点的最大集合,能够把具有足够高密度的区域划分为簇,并可在噪声的空间数据库中发现任意形状的聚类。

但是,在配置算法时,同样需要预先设定每个类别的最小样本点的个数和点之间的邻域半径。

DBSCAN聚类算法步骤:

  1. 首先在数据库中随机抽取一个点作为一个类
  2. 如果抽取的点是核心点,则找出所有从该点密度可达的对象,形成一个类;
  3. 如果抽取的点是边界点,则跳出本次循环,寻找下一个点
  4. 重复第二三步,直到所有的点都被处理。

操作方法:

  1. 配置节点,如下图:

配置选项卡:

说明

K-Means

节点用途: 该节点根据预定义的聚类数对输入数据进行聚类。每一个数据向量只归属一个类。当中心不在变化时算法会终止执行。

说明: 聚类算法采用欧氏距离对选中的属性进行距离计算。该节点不会数据进行标准化,如果需要,可以先使用标准化节点进行预处理。

k-means 算法基本步骤

  1. 从 n个数据对象任意选择 k 个对象作为初始聚类中心;
  2. 根据每个聚类对象的均值(中心对象),计算每个对象与这些中心对象的距离,并根据最小距离重新对相应对象进行划分;
  3. 重新计算每个(有变化)聚类的均值(中心对象);
  4. 计算标准测度函数,当满足一定条件,如函数收敛时,则算法终止;如果条件不满足则回到步骤

操作方法:

  1. 配置节点,如下图:

图5-2-2-1

配置选项卡:

说明

  1. 确认配置后,执行并查看视图,以及预测表

案例如下:

在软件自带“媒体分级”案例中使用了该节点,工作流如下:

该节点配置如图5-2-2-1,确认后执行。

执行结果用表输出为:

K-Medoids

节点用途: 聚类算法,K-Medoids算法与K-Means算法非常相似,该算法同样基于各个点之间的距离进行聚类,也需要用户提前指定类别数。

K-Medoids算法基本步骤

  1. 随机选择K个初始点作为初始质心
  2. 计算各个点到质心的距离,将点的类划分为距离他最近的质心,形成K个类
  3. 根据分类好的类,在每个类内重新计算质心,计算方法如下:
  4. 计算每个类内所有样本点之间的距离和绝对误差;
  5. 选出使每个类绝对误差最小的样本点作为质心
  6. 重复迭代2-3步直到满足迭代次数或误差不再变化。

可以看出,K-Medoids和K-Means的主要区别在于质心的选择,K-Means的质心是类内样本点的均值,可能不是一个实际的样本点,而K-Medoids是以某个样本点为质心的。

K-Medoids的优缺点

  1. 在计算质心时,由于要计算类内样本点两两之间的距离,因此计算的复杂度为O(n^2),远远高于K-MeansO(n)
  2. 由于计算质心时没有运用均值,K-Medoids的稳健性很好,在样本量较少或者存在极值时对质心的影响非常小。

综上所述,K-Medoids更适用于样本量小,且样本分布分散的情况。

操作方法:

  1. 配置节点,如下图:

图5-2-3-1

配置选项卡:

说明

  1. 确认配置后,执行并查看视图,以及预测表

模糊C均值

**节点用途:**聚类的一种算法。模糊C均值算法称为软划分,是基于模糊数学的概念发展起来的,在这类算法中,每个样本xi不再只能属于一种类别,而是有对应的隶属度数组,数组里的每一个元素代表xi属于所有C类中的第j类的程度uij。而该样本的隶属度数组中的总值等于1,也就是 =1。

模糊C均值算法步骤:

模糊C均值算法的实现步骤与K-Means的基本相同,其最主要的差别在于,计算质心时使用的以各个样本对该类的隶属度对样本值进行加权

模糊C均值算法的实现过程如下:

  1. 先随机指定每个数据到各个类别的隶属度;
  2. 计算每个类的质心,也就是各个数据在每个类别中以隶属度为权重的加权平均,并计算每个数据到质心的距离;
  3. 根据更新的质心重新估计隶属度;
  4. 重复2-3步,直至误差平方和不再减小或者质心不再发生变化

操作方法:

  1. 配置节点,如下图:

配置选项卡:

说明

  1. 确认配置后,执行并查看视图,以及输出结果

异常

节点用途: 异常节点用于识别数据中的离群点或异常观测点。

该节点通过聚类分析的手段进行异常判断,也就是将输入数据中的记录分成2个(或多个)类,然后计算每个类中点到类中心的距离,离类中心越远的点就越异常,这个是异常节点进行异常判断的基本思想。

为了描述每条记录的异常程度,定义了一个变量,即“异常指数”,这个变量的值,为点到类中心的距离除以该类中所有点到类中心距离的平均值。这个节点通过计算得到每条记录的异常指数,然后通过异常指数的大小来判断该条记录是否异常。

操作方法:

  1. 配置节点,如下图:

配置选项卡:

说明

  1. **异常记录百分比:**设置一个阈值,表示标记为异常的记录数占总的记录数的百分比
  2. **异常记录数:**设置一个阈值,表示在异常表中标记为异常记录的数量

GMM

**节点用途:**聚类的一种算法。

高斯混合模型(Gaussian Mixture Model, GMM)是一种概率式的聚类方法。假设所有的数据样本服从混合高斯分布,那么只要根据数据推出 GMM 的概率分布来就可以了,然后GMM的K个成分实际上对应K个分类。对于一个点xi,它属于第k个聚类中心的可能性wik是一个属于0到1之间的概率值,聚类结果会将xi分配到wik最大的类别,k=1,...,K。

高斯混合模型算法基本步骤:

一般求解高斯混合模型都用的是EM算法,估计高斯混合分布的先验参数,然后计算每个样本点属于每一类别的后验分布,将其判定为概率值最大的那一类。

EM算法的实现过程如下:

  1. 初始化参数μi,σi和wi,i,2,...,K;
  2. E-步:根据上一步得到的参数估计,计算计算每个样本点属于每一类别的后验概率;
  3. M-步:根据上一步得到的概率值,应用极大似然法对高斯混合分布的参数重新进行估计;
  4. 重复第二三步,直到达到规定的最大迭代次数或者收敛标准。

GMM和K-Means的关系

K-Means算法可以被视为高斯混合模型的一种特殊形式。假设在高斯混合模型中,各个成分的方差一致,且每个样本仅仅指向一个成分时,高斯混合聚类与K-Means算法一致。

操作方法:

  1. 配置节点,如下图:

配置选项卡:

说明

  1. 确认配置后,执行并查看视图,以及输出结果

两步聚类

节点用途: 两步聚类是基于BIRCH层次聚类的改进算法。

相对于其他的聚类算法,两步聚类更适合超大样本的情况,而且能处理输入变量同时包括分类型和数值型的情况,而两步骤聚类可以根据算法设定的规则自动确定最佳类别个数。

两步聚类算法:

  1. 利用BIRCH算法构造CF-树的思想,逐个读取数据,进行预聚类,将样本点聚类成子类
  2. 以预聚类的子类为对象,基于每个子类的聚类特征,使用凝聚法逐个合并子类,达到最佳类别数。

在构建CF-树的过程中,可以选择是否对离群值进行处理,离群值的定义是叶节点的数据量小于一定比例的规模最大的CF-树中的记录数,默认情况下这个比例是25%。

操作方法:

  1. 配置节点,如下图,一般选择默认设置。

两步骤类配置

配置选项卡:

说明

  1. 确认配置后,执行并查看视图,以及输出结果

EM

节点用途:EM聚类算法有一个特性,就是没有严格要求一个点必须要属于一个类,这一特性被称为软聚类。EM算法是在概率模型中寻找参数最大似然估计或者最大后验估计的算法,其中概率模型依赖于无法观测的隐藏变量。EM经常用在机器学习和计算机视觉的数据聚类领域。

**EM算法:**经过两个步骤交替进行计算

  1. E-step:对于每一个数据点,我们要计算其属于其中每个聚类的概率作为权重:如果一个点很大可能属于一个聚类,就将对应的概率设置为接近1的值,对于那种可能会出现一个点属于2个或多个聚类的情况,就需要建立一个对聚类的概率分布
  2. M-step:这一步骤主要是利用上一步计算的权重来估计每个聚类的有关参数(均值,方差):每一个数据点以E-step中的概率作权重,然后与K-means一样计算每一个聚类的均值和方差,进而求取聚类的总体概率或极大似然。

这样通过E-step和M-step的不断交替来增加总的对数似然直到收敛,而且最大值也有可能陷入局部最优,所以需要多次迭代。

操作方法:

  1. 配置节点,如下图:

配置选项卡:

说明

  1. 确认配置后,执行并查看视图,以及输出结果

层次聚类

**节点用途:**层次聚类也叫系统聚类。通过对数据集按照某种方法进行层次分解,直到满足某种条件为止。

注意: 该节点只能在小数据集上运行。它保存全部的数据在内存中计算,并且具有立方体的复杂性。

具体又可分为凝聚的,分裂的两种方案:

为了定义类间的距离必须定义一种度量距离的方法。主要有以下三种方法:

为了度量两点之间的距离,选择一个度量方法是有必要的。您可以选择欧式距离或者曼哈顿距离,这符合L1和L2范数。

操作方法:

  1. 配置节点,如下图:

配置选项卡:

说明

  1. 确认配置后,执行并查看视图,以及输出结果

相似搜素

**节点用途:**该节点检索出查询表和参考表中,与指定相似度/距离准则匹配的记录。

节点配置:

配置选项卡:

说明:距离函数:选择用于计算距离或相似性的方法。

类分配器

**节点用途:**基于一种层次聚类将各个记录分配到类别。可以选择一个固定的聚类数或输入一个距离阀值。如果采用第二种方式,则所有最小距离小于指定阀值的聚类都将会被采用。阀值是一个给定的在0到1之间的标准距离。所有的距离都基于最大距离进行标准化。

操作方法:

  1. 配置节点,如下图:

配置选项卡:

说明

案例如下:

使用“信用卡违约数据”建立如下工作流:

节点配置为默认值,执行后

执行结果如下图所示,将每条记录进行了分类。

机器学习

时间序列

ARIMA

**节点用途:**时间序列预测中的一种算法。

**算法逻辑:**ARIMA模型,是指将非平稳时间序列转化为平稳时间序列,然后将因变量仅对它的滞后值以及随机误差项的现值和滞后值进行回归所建立的模型。ARIMA模型根据原序列是否平稳以及回归中所含部分的不同,包括移动平均过程(MA)、自回归过程(AR)、自回归移动平均过程(ARMA)以及ARIMA过程。

节点配置

配置选项卡:

说明

案例如下:

建立工作流如下:

QQ截图20160707100103

我们用时间区间,

按照系统默认值配置ARIMA节点后执行,结果如下:

QQ截图20160707110530

指数平滑

**节点用途:**时间序列预测的一种算法。

**算法介绍:**该节点使用指数平滑法对时间序列进行训练,并输出用于预测的指数平滑模型。

指数平滑模型根据时间序列先前的观察值来预测未来,如根据销售历史记录来预测未来销售情况。该节点提供了自动、简单指数平滑、Holt线性趋势、简单季节模型、Winter加法和Winter乘法多种模型可以选择。其中自动是指节点会按照其他五个模型分别进行训练,然后输出效果最好的一个,所以自动选项运行耗时会相对长一些。
  指数平滑节点与其他的节点稍有不同,用于分析的时间序列数据都是在均匀间隔的时间点下测量到的数据,时间序列的模型要求每个测量值之间要有一致的区间,所以,在指数平滑节点之前都要加一个时间区间节点以对时间区间有个规范的定义:指定要使用的时间区间(年、季度、月、日)。在模型训练或者预测的过程中将从时间区间生成的标准时间字段中获取相关的时间信息。

节点配置:

配置选项卡:

说明

案例如下:

对85-95年历史销量利润数据,预测96-98年的利润。

按照默认值配置算法节点,执行后,结果如下图:

序列预测器

**节点用途:**此节点通过解析训练好的PMML格式的模型对连接的时间序列的未来几期进行预测,通常连接在指数平滑节点后配合使用。除了时间序列的预测值,同时可以输出一定置信水平下的预测区间,以及残差的白噪声检验等评估结果。

配置选项卡:

说明

自相关图

**节点用途:**时间序列分析中,通常根据ACF和PACF分析一个序列的相关性,而且还可以通过残差的自相关性观察序列中的信息是否被充分提取。

节点配置:

配置选项卡:

说明

案例如下:

建立工作流如下:

按照节点默认值进行配置后,执行得到以下结果:

平稳检验

**节点用途:**绘制数据的正态QQ图,通过QQ图检验所选字段是否服从正态分布。

节点配置:

配置选项卡:

说明

混成检验

**节点用途:**混成检验是一类检验,用来检验序列的自相关性。其零假设为序列独立(对于某个延迟),而且像一个白噪声那样。如果这些检验的p值很小,则说明可能有相关性;而对于不相关的观测值,如纯随机过程,p值应该很大。可用于检验训练的时间序列模型的残差是否是纯随机序列。

节点配置:

配置选项卡:

说明

机器学习

特征选择

**节点用途:**数据挖掘问题中可能包括成百或者上千的字段可以作为输入字段,从这些字段中挑选出模型应该包含的字段需要耗费很大的精力。为了缩小选择范围,可以使用特征选择节点进行初步筛选。该节点分两步对输入字段进行筛选,首先根据数据的特征质量过滤掉数据质量很差的字段,减少了后面的计算量,然后通过计算剩余的输入字段对目标的重要性对剩余字段进行排序或者过滤。

节点配置:

配置选项卡:

说明

**案例如下:**利用“诊病数据”建立如下工作流:

节点配置按照默认值,执行后结果如下图:

机器学习

降维分析

主成分分析

**节点用途:**该节点对输入数据执行主成分分析。用于提取最大主成份,可以被主成分分析应用节点使用,将输入数据映射到一个更低维度的数据集同时最大限度的保留信息。

节点配置:

配置选项卡:

说明

主成分应用

**节点用途:**该节点应用主成分模型计算输入数据的主成分。它应用主成分计算节点的模型将任意数据映射到指定维度的数据集。
使用连接的主成分计算节点的模型估计目标维的信息保持率。保持率的计算是基于预测数据和主成分计算模型所有的数据分布相同的假设。

节点配置:

配置选项卡:

说明

机器学习

模型评估

评估

节点用途:分析评估模型质量

节点配置:

配置选项卡:

说明:两种方式输出模型评估结果

案例:建立一下工作流:

配置节点为默认设置,执行后,结果如下图:

信息熵

**节点用途:**根据给定的参考类为聚类结果评分。

该节点有两个输入端口,第一个输入端口连接参考类的表,第二个输入端口连接包含聚类结果的表,且这两个表均需要包含类ID。 从对话框中选择两个表中相应的列。成功执行之后,视图中会显示熵值和质量值,其中熵值越小越好,质量值属于[0,1],越趋于1越好。

节点配置:

配置选项卡:

说明

评估图

**节点用途:**将模型评估结果以视图形式展示。

节点配置:

配置选项卡:

说明

  1. **增益图:**增益的定义是相对于全部匹配,发生于每个分位数中的匹配的百分比。其计算方法为(分位数中的匹配数量/全部匹配数量) × 100%。

累积收益图的线从左至右的走势通常是从0% 到100%。优秀模型的收益图将陡升至100%,然后保持平直。无法提供有用信息的模型将呈对角线状,即从左下角到右上角(选择了包含基线后将显示类似图表)

  1. **响应图:**响应即分位数中,匹配记录的比例。其计算方式为(分位数中的匹配/分位数中的记录)× 100%

通常,响应图开始于接近100%之处,并逐渐下降,最终将在延伸至图表右侧边缘时达到整体响应率(全部匹配/全部记录)。对于优秀模型的响应图,其线开始于图表左侧接近或等于100% 的值,且在向右移动的过程中,始终保持在较高的水平;然后,在图表右侧,向整体响应率的方向迅速下降。如果模型不能提供任何信息,则其线在整个图形中将始终围绕在整体响应率左右。(如果选择了包含基线,一条值相当于整体响应率的水平线将显示在图表中供您参考

  1. **提升图:**提升将每个分位数中匹配记录的百分比与在全部训练数据中匹配的百分比进行比较。其计算方式为(在分位数中的匹配/在分位数中的记录)/(全部匹配/全部记录)

累积提升图的线从左至右的走势通常为:起始于大于1.0 的值,并渐渐下降,直到接近1.0。图表的右侧边缘表示整个数据集,因此累积分位数的匹配与数据中的匹配的比例为1.0。对于优秀模型的提升图,其线开始于图表左侧大于1.0 的值,且在向右移动的过程中,始终保持在较高的水平;然后,在图表右侧,向1.0的方向迅速下降。如果模型不能提供任何信息,则其线在整个图形中将始终围绕在1.0 左右。(如果选择了包含基线,一条值为1.0 的水平线将显示在图表中供您参考

  1. **ROC图:**ROI 将分位数的成本和利润进行比较。其计算方法为(分位数利润/分位数成本)× 100%

累积投资回报(ROI) 图通常与响应图及提升图类似,只有在尺度标准方面有所差别。投资回报图通常开始于大于0% 的值,并逐渐下降,直到达到整个数据集的整体ROI(可能为负)。对于优秀模型的投资回报图,其线开始于图表左侧大于0% 的值,且在向右移动的过程中,始终保持在较高的水平;然后,在图表右侧,向整体ROI 的方向迅速下降。如果模型不能提供任何信息,则其线在整个图形中将始终围绕在整体ROI 左右

文本挖掘

文本挖掘

概述

(此页面暂无内容)

文本挖掘

噪声词过滤

节点用途: 噪声词过滤节点的功能是将分词字段中的无关词汇或者不重要的词过滤掉,进而筛选出重要的词汇,可过滤中文或者英文。

过滤的方法有多种,分别是过滤与内置的噪声词库匹配的词汇、过滤与自定义噪声词库匹配的词汇、过滤所有的标点符号、过滤所有的数字、区分大小写和过滤所有字节长度小于N的词。这些方法可以只选择一个进行过滤,也可以选择全部进行过滤。过滤后输出表中的列数保持不变,只会过滤掉匹配条件的记录。

节点配置:

配置选项卡

说明

文本挖掘

字符串匹配

**节点用途:**字符串匹配节点的功能是对两个字符串字段进行比较,计算两个字段中字符串之间的距离,并在输出表中列出最相似的字符串。

该节点需要两个输入表,一个表包含用于比较的字符串字段,一个表包含一个词典字段。字符串匹配节点会寻找词典字段中与指定的字符串字段中最相似的元素。

节点配置:

配置选项卡

说明

文本挖掘

语句提取

**节点用途:**语句提取节点的功能是提取文档中的语句并返回一个包含文档字段、语句字段和表示语句中包含的词量字段的表。

节点配置:

配置选项卡

文本挖掘

分词

节点用途: 分词节点的功能是用于对中文,英文文本进行分词,进而从非结构化数据中提取结构信息。

分词的对象都是每列字段。分词后将在输出表中追加分词、计数和词性三个字段。分词字段表示从文本字段中提取出词;计数字段表示按照每个文本对得到每个分词出现次数的统计,注意,统计的只是每次词所在文本中出现的次数,并不是所有文本中出现的次数;词性字段显示的每个分词的词性。

节点配置:

配置选项卡

说明

文本挖掘

情感分析

**节点用途:**这个节点根据情感分析节点的功能是定义文本的情感强度和情感分类。文本情感分析又称意见挖掘。简单而言,是对带有情感色彩的主观性文本进行分析、处理、归纳和推理的过程。例如,由于基于产品评论的情感分析可以帮助用户了解某一产品在大众心目中的口碑,因此受到很多消费者和商业网站的青睐。而基于新闻评论的情感分析多用于舆情监控和信息预测中,是国内外评测中重要的评测任务。

情感信息抽取是情感分析的最底层的任务,它旨在抽取情感评论文本中有意义的信息单元。其目的在于将无结构化的情感文本转化为计算机容易识别和处理的结构化文本,继而供情感分析上层的研究和应用服务。情感信息分类则利用底层情感信息抽取的结果将情感文本单元分为若干类别,供用户查看,如分为褒、贬两类或者其他更细致的情感类别(如喜、怒、哀、乐等)。按照不同的分类目的,可分为主客观分析和褒贬分析;按照不同的分类粒度,可分为词语级、短语级、篇章级等多种情感分类任务。

节点配置:

配置选项卡

说明

社会网络

社会网络

概述

(此页面暂无内容)

社会网络

网络生成

**节点用途:**网络生成节点的功能是自定义网络。根据界面的信息配置生成新的随机数据。

节点配置:

配置选项卡

说明

社会网络

对象插入

**节点用途:**对象插入节点的功能是从输入表中选择表示节点、边及节点和边特征的字段来创建网络,即将表转换为网络。

输入表中的每一行包含每条边的节点。该算法可以支持以下三种格式的输入表: 第一节点id 第二节点id

节点1 节点2

节点2 节点4

节点3 节点4

  这种格式的输入表,需要在配置窗口中选择第一节点id字段和第二节点id字段(第一节点id和第二节点id不能选择同一字段),还需要选择一个边id字段,缺一不可。另外,也可以使用行ID作为边ID。

节点配置:

配置选项卡

说明

  1. 选择一个字段作为边的ID
  2. 选择节点id作为边ID
  3. 创建唯一边ID
社会网络

特征表

节点用途: 特征表节点的功能是将网络的特征写入到数据表中,将网络信息转化为表。另外,可以只选择部分特征输出,也可以指定一部分对象(节点id或者边id)输出。另外,输出的特征表有两种输出格式:特征独立显示、特征写入一个字段,分别如下:

如果您在输出表类型中选择特征独立显示,则输出表的格式如下所示:

特征目标 边id 节点id 描述 标签 权重 目标
节点 ? 节点1 ? 标签1 ? ?
边1 ? ? ? 1.0 ?
终端 边1 节点2 ? ? ? 目标

如果您在输出表类型中选择特征写入一个字段,则输出表的格式如下所示:

特征目标 边 id 节点 id 特征名称 特征类型 特征值
节点 ? 节点1 标签 字符串 标签1
边1 ? 权重 浮点型 1.0
终端 边1 节点2 目标 布尔

节点配置

配置选项卡

说明

  1. 节点特征: 选择一个包含指定节点ID的字段,则输出表中仅包含该字段中包含的对象(节点ID)对应的特征。
  2. 边特征: 选择一个包含指定边ID的字段,则输出表中仅包含该字段中包含的对象(边ID)对应的特征。
  1. 节点特征: 选择一个包含指定节点ID的字段,则输出表中不输出包含该字段中包含的对象(节点ID)对应的特征。
  2. 边特征: 选择一个包含指定边ID的字段,则输出表中不输出包含该字段中包含的对象(边ID)对应的特征。
社会网络

特征添加

节点用途: 特征添加节点的功能是从一个输入表中向网络添加特征。每一个特征都是通过可用边ID或者节点ID向边或者节点添加。字段的名称将被用作特征的名称,字段的类型将被作为特征的类型。

节点配置:

配置选项卡

说明

  1. 节点ID: 如果要添加节点的特征,则选择节点id,指定要添加特征的节点。
  2. 边ID: 如果要添加边的特征,则选择边id,指定要添加特征的边。
社会网络

特征过滤

节点用途: 特征添加节点的功能是从一个输入表中向网络添加特征。每一个特征都是通过可用边ID或者节点ID向边或者节点添加。字段的名称将被用作特征的名称,字段的类型将被作为特征的类型。

节点配置:

配置选项卡

说明

  1. 节点:
  2. 边:
社会网络

参考特征过滤

**节点用途:**参考特征过滤节点的功能是根据输入表中提供的参考特征对现有的网络元素进行过滤。需要从输入网络中选择一个网络特征字段,从输入表中选择一个参考字段,它会检查输入表中参考字段的值在网络特征中是否存在。

节点配置:

配置选项卡

说明

社会网络

参考对象过滤

**节点用途:**指定对象过滤节点的功能是从输入表中指定一个包含对象id的字段,与网络数据中的对象id进行匹配,对匹配的对象做排除或者保留操作。这里的对象指网络中的节点或者边。

节点配置:

配置选项卡

说明

社会网络

特征值过滤

**节点用途:**特征值过滤节点的功能是基于给定的值过滤相应的网络元素,可以在配置中指定一批特征值,对选中的特征进行过滤。

节点配置:

配置选项卡

说明

社会网络

度过滤

**节点用途:**该选项是根据节点度的范围对网络进行过滤。与某点相邻的那些点称为该点的“邻点”,一个节点的邻点的个数称为该点的“度数”,也叫关联度。一个节点的度数就是对其“邻点”多少的测量。实际上,一个点的度数也是与该点相连的线的条数。如果一个点的度数为0,称之为“孤立点”。在一个有向图中,必须考察线的方向。因此,一点的“度数”包括两类,分别称为“入度”和“出度”。一个节点的入度指的是直接指向该点的点的总数;出度指的是该点所直接指向的点的总数。

节点配置:

配置选项卡

说明

社会网络

邻节提取

**节点用途:**邻节提取节点的功能是提取指定节点id的邻近节点,每一个节点为一行,邻接节点作为集合列表存储。其中,可以指定提取所有源节点或者目标节点的相邻节点,也可以通过从第二个输入表中选择一个字段指定只提取该字段中包含的节点。该节点有两个输入端口,上面为模型输入端口,输入网络,是必连端口;下面为表输入端口,输入一个包含节点id的表,这个端口不是必连的,该端口用于提取指定节点时使用的。

节点配置:

配置选项卡

说明

社会网络

层次提取

节点用途: 层次提取节点的功能是基于集合字段或者列表字段创建网络。该算法通常和关联分析一起使用,用于可视化关联关系,辅助分析物品之间的关联

节点配置:

配置选项卡

说明

社会网络

网络图

节点用途: 层次提取节点的功能是基于集合字段或者列表字段创建网络。该算法通常和关联分析一起使用,用于可视化关联关系,辅助分析物品之间的关联

节点配置:

配置选项卡

说明

对节点进行,形状,大小,颜色,标签,标签位置,标签字体的一些设定。

SmartR

SmartR

概述

(此页面暂无内容)

SmartR

R源表

**节点用途:**工作流从R中读取数据表的源节点。当你想在工作流中使用R函数读取外部的数据文件时,可以使用该节点。

R的"foreign"库中提供了读取数据文件的相关示例。更多关于R的信息,可以登录http://www.r-project.org/

**节点配置:**在节点配置中,写入R语言,读取外部数据

配置选项卡:

案例:

读取数据文件夹C:\SmartMining\Desktop-5.2.0\demo下的数据:appUserData,这需要在R源表节点的“R脚本”模块中编辑读入数据的语句_SmartR.out<-read.table('C:\SmartMining\Desktop-5.2.0\demo\appUserData.csv',header=T,sep=",");_

脚本中使用read.table函数读取CSV数据。并将读取的数据赋值给SmartR.out。这是因为SmartR用变量SmartR.out来接收R代码的输出结果,所有的输出数据都需要赋值给SmartR.out来进行输出。相似的变量还有SmartR.in,SmartR.model。SmartR.in用于存储节点的输入数据,SmartR.model用于存放SmartR中的模型。

SmartR

R代码段

**节点用途:**在工作流中使用R函数整理数据时,可以使用该节点。R的"foreign"库中提供了读取数据文件的相关示例。更多关于R的信息,可以登录http://www.r-project.org/

**节点配置:**在节点配置中,写入R语句,处理数据字段等

配置选项卡:

案例:

appUser数据中,有2700条数据,选择其中应用是微信的用户数据,需要R代码段选取数据,在脚本中输入代码:

smartR.out<-subset(smartR.in,smartR.in$"应用"=="微信");

节点执行后,输出数据表为520条应用为微信的记录,如下图:

SmartR

相关检验

节点用途: 使用一种或者多种相关检验方法对两个数值型字段间的相关性进行检验。在配置界面可以选择多个检验字段,节点将对每两个字段之间进行计算并输出每对字段的检验结果。

节点配置:

配置选项卡

说明

案例:

在医药数据中,查看血压与胆固醇的相关性

如果上图配置节点,执行后结果如下图:

SmartR

Granger因果检验

**节点用途:**多个时间序列的二元Granger因果检验。 关于两个时间序列X和Y的Granger因果检验是用来评估X过去的观测值对于预测Y是否有用的。原假设:X过去的观测值(比如T个)对于预测Y值没用。 该节点对选中的检验字段两两之间分别进行检验,得到相应的F统计量值及p-值。

节点配置:

配置选项卡

说明

案例:

医药数据中,检验血压与血液中钠含量是否有因果关系,按照上图进行配置节点,执行后结果如下:

SmartR

单样本非参数检验

**节点用途:**单样本非参数检验是对单个总体的分布形态等进行推断的方法,其中包括卡方检验、二项分布检验、K-S检验以及变量值随机性检验等方法。可以使用多种方法对所选字段分别进行非参数检验,进而了解数据所包含的关于总体的位置和尺度信息,如均值, 中位数。

节点配置:

该节点有两个参数配置界面:【配置】和【检验方法】,在【配置】中配置节点的全局参数,配置的参数适用于【检验方法】中所选的检验方法,在【检验方法】中选择一种或多种检验方法对【配置】界面选择的字段进行分析。

配置选项卡

说明

检验方法选项卡:

说明

选择要进行的检验分析,可以是多选。在每种检验方法的右边设置该检验方法需要的参数信息。默认检验方法都是没有被选中的,在检验方法没有被选中的状态下对应的右侧的参数配置信息是置灰的,参数信息不可更改,当勾选了左侧的复选框时,右侧的参数配置被激活,可以更改。

为方便描述,对一些参数用符号进行定义,分位点(a)、字段在分位点a处的分位数(Qa)、字段中位数(即在分位点0.5的分位数Q0.5)、假设分位数或者假设中位数(q0)。

  1. 分位点:指定一个分位点,默认0.5,可取范围:0—1
  2. 假设分位数:输入一个数字,可以是小数。
  3. 检验方向:下拉框有三个选项(左侧、右侧、双侧),默认是双侧。三个选项的意思分别为:左侧—检验字段分位数Qa是否大于等于假设分位数q0;右侧—检验字段分位数Qa是否小于等于假设分位数q0;双侧—检验字段分位数Qa是否等于假设分位数q0。
  1. 假设中位数:输入一个数字,可以是小数
  2. 检验方向:下拉框有三个选项(左侧、右侧、双侧),默认是双侧。三个选项的意思分别为:左侧—检验字段中位数Q0.5是否大于等于假设中位数q0;右侧—检验字段中位数Q0.5是否小于等于假设中位数q0;双侧—检验字段中位数Q0.5是否等于假设中位数q0。
  1. 假设中位数:输入一个数字,可以是小数。
  1. 中位数:即字段从小到大排序之后中间位置的数
  2. 均值:字段的平均取值
  3. 自定义:自己指定一个数字,可以是小数。
SmartR

QQ图

**节点用途:**绘制正态QQ图,通过QQ图检验所选字段是否服从正态分布。

节点配置:

配置选项卡

说明

**案例:**查看医药数据中钾分布是否是正态分布。

按照上图进行节点配置,执行后结果如下图:

SmartR

单样本分布检验

**节点用途:**检验单个数值型样本是否服从假定的分布(正态分布,指数分布,均匀分布,泊松分布)。检验结果可以在输出的视图结果中进行查看。

节点配置:

配置选项卡

说明

  1. 使用样本数据:即通过计算字段的平均值或者标准差然后传给参数。
  2. 定制:定制即自定义参数

**案例:**在医药数据中,检验年龄字段的是否按照正态分布,指数分布。

节点配置中,选择“old”,勾选正态,指数,执行并查看结果,如下图:

SmartR

两样本分布检验

**节点用途:**检验两个数值型样本的分布是否一致。检验结果可以在输出的视图结果中进行查看。

节点配置:

配置选项卡

说明

  1. 选中此项,则选择一个分组字段,并从该分组字段的取值中选择两个组将要检验的数值型字段分成两样本
  2. 此项未勾选,即不使用分组字段,则使用“假设检验”选择两个配对字段的方式,选择要检验的数值型字段

**案例:**在医药数据中,检验服用药物Y与药物X的人的年龄是否分布致。

节点配置中,选择“yaowu”为分组变量,组1:DrugY,组2:DrugX选择“old”为检验字段,执行后结果为下图:

SmartR

R表视图

**节点用途:**使用该节点可以在通过R语言对数据进行可视化。

有关R语言绘图函数,更多详情参看R的官网:http://www.r-project.org/

节点配置:

配置选项卡

说明

按照上图进行配置节点,执行后结果如下图:

SmartR

R建模器

**节点用途:**在SM里可以执行R模型的命令,有关R语言建模的更多详情可以参看R的官网 :http://www.r-project.org/

节点配置:

配置选项卡

说明

SmartR

R预测器

节点用途: 基于R建模器节点生成的模型,对新的数据输入进行预测。所以使用该节点需要同时具备输入表信息和输入模型,模型端口可以直接连接R建模器的模型输出端口或者连接R模型读取节点。

有关R语言,更多详情参看R的官网 : http://www.r-project.org/

节点配置:

配置选项卡

说明

SmartR

R模型读取

**节点用途:**从压缩文件中读取一个R模型。

节点配置:

输入R模型文件读取路径。

数据导出

数据导出

概述

(此页面暂无内容)

数据导出

数据库

**节点用途:**数据库读取节点可以用来从数据库中读取数据表。使用数据库节点时需选择相应的数据库驱动,配置数据库URL、用户名和密码。

节点配置:

配置选项卡:

说明

数据导出

Hive

**节点用途:**把数据导入到Hive文件进行存储

配置选项卡:

说明

数据导出

HDFS

**节点用途:**把数据导入到HDFS文件进行存储

配置选项卡:

说明

数据导出

HBase

**节点用途:**把数据导入到HBase文件进行存储

C:\Users\malirong\AppData\Local\Temp\1539911302(1).jpg

配置选项卡:

说明