Skip to main content
Advanced Search
Search Terms
Content Type

Exact Matches
Tag Searches
Date Options
Updated after
Updated before
Created after
Created before

Search Results

672 total results found

去重

敏捷挖掘节点手册 数据准备

节点用途: 将数据表中,重复出现的记录剔除。 配置选项卡**:** 说明: **模式:**这里有两种模式可供选择,包含首个记录和丢弃首个记录 **关键字:**可以选择一个或者多个列作为排序字段。根据每个选中列 的唯一值确定分组,一个分组作为生成排序表的一条记录。 **组内排序:**可以选择一个或多个字段基于分组进行排序。升序或者降序 操作示例 如下: 案例:将员工信息表,按照国籍进行去重。 配置去重节点,如下图: 图2-18-1 执行后生成的预览表如下,预览表中的数据已由原先的32,561条记录变成42条,重...

提取字段名

敏捷挖掘节点手册 数据准备

**节点用途:**用于提前数据表中所含字段名称 本节点较为简单,不需要赘述。 节点配置图,以及结果输出表,参看图2-19-1 图2-19-1

插入字段名

敏捷挖掘节点手册 数据准备

**节点用途:**使用第二个输入表(字典表)对第一个输入表的字段进行重命名字典表至少要包含两个列,一列为原有字段名,用来对第一个输入表的字段进行查找匹配,另一列为将要替换的新字段名。 节点配置: 配置选项卡: 说明: **原字段名列:**从字典表中选择包含原字段名的字段 **新字段名列:**从字典表中选择包含新原字段名的字段

平衡

敏捷挖掘节点手册 数据准备

**节点用途:**使用平衡节点修正数据集中的不平衡,以便它们符合指定的检验标准。 说明: 若某个数据集只有两个值(T和F),并且 90% 的观测值为F,而只有 10% 的观测值为T,这类现象成为样本失衡。 很多建模技术处理此类失衡数据都有困难,因为它们倾向于只学习这些F的结果,而忽略T的结果(因为这些结果少的可怜)。如果数据平衡很好,T和F结果具有大致相同的数量,那么模型将更有可能找出分辨这两个组的模型。 这种情况下,平衡节点对于创建平衡指令,从而减少带有F结果的观测值数量非常有用。 操作方法: 配置选项卡: 说...

RMF汇总

敏捷挖掘节点手册 数据准备

**节点用途:**根据指定的用户ID, 对其交易金额、交易频次、时间间隔进行汇总, 输出用户ID的交易总金额、交易频次、最近一次交易时间间隔。 配置选项卡: 说明: 固定日期 :用于计算最近一次用户交易的交易间隔。 **用户ID:**指定用户的ID号 **交易日期:**对应用户每次交易的交易日期 **交易金额:**对应用户每次交易的交易金额

类型

敏捷挖掘节点手册 数据准备

节点用途: 主要是为了计算或更新字段的元数据,包字段测量类型、值域和缺失,以及指定字段的角色。 比如,分类预测类模型都需要指定一个目标变量,所以必须通过类型节点的角色功能。首先指定一个字段的角色为目标,指定影响因素的角色为输入,这样模型节点就可以自动识别目标字段,并将其作为目标变量,而输入字段被作为自变量,参与训练模型。 配置选项卡: 说明: **字段:**显示的是输入表中所有的字段名称。 **测量:**这是测量级别,用于描述某个给定字段中数据的特征。最大的作用是为了放宽对字段存储类型的限制。 比如说,通常条...

过滤

敏捷挖掘节点手册 数据准备

节点用途: 用于过滤不需要的字段,或者对字段进行重命名。 操作方法: 配置节点 图2-24-1 配置选项卡: 说明: 原始字段:输入数据表中所包含的字段列表。 **过滤:**点击想要过滤掉的字段的箭头,箭头上将会显示一个叉号,该字段在接下来的分析中会被过滤掉。也可以通过”反选”按钮来批量反向过滤字段,这在字段特别多时很有用。 **输出字段:**如果想要重命名字段,可以在这里双击显示字段名,可以更改此字段名。新字段名会出现在节点输出表中。 配置好节点好,启用缓存,执行 查看过滤表

分列

敏捷挖掘节点手册 数据准备

**节点用途:**将数据字段中的值,按照某种统一规则进行拆分。与excel中的数据分列用途,方法基本一样。 操作方法 如下: 配置节点 图2-25-1 配置选项卡: 说明: 拆分目标:选择输入数据中要进行拆分的字段。 拆分方式:拆分字段的规则有两种,基于分隔符或者固定宽度。 **基于分隔符:**选择或输入分隔符号 **固定宽度:**定义划分的数据宽度 数据预览:定义好数据值拆分规则后,可以使用预览功能查看,分列后的数据是否达到预期,以便调整数据分列的规则。 确定配置,启用缓存,执行。 查看输出表...

类型转换

敏捷挖掘节点手册 数据准备

节点用途: 将一个字段或一组字段从一种数据类型转换为另一种数据类型。 在数据挖掘过程中,不同类型的字段的处理方式是不一样的,所以有时需要对字段的类型进行一下转换,再进行下一步的分析。例如,将字符型转换为数值型、数值型转换为字符型等。 操作方法 如下: 配置节点 配置选项卡: 说明: 类型选择:数据类型转换方式 **字符串到数值:**将字符型的字段转换为数值型。一次可以处理多个字段 **数值到字符串:**将数值型(整型和浮点型)字段转换为字符型字段。一次可以处理多个字段。 浮点到整型:将浮点型字段转换为整...

缺失填充

敏捷挖掘节点手册 数据准备

节点用途: 用来处理输入表中的缺失值。 操作方法: 配置节点,如下图: 配置选项卡: 说明:分为两类——整型字段和字符型字段 **无操作:**仍保留缺失值,这个选项对所有类型的字段都适用。 **现在删除:**删除所有包含缺失值的记录,这个选项对所有类型的字段都适用。 **最小、最大、平均,众数:**用字段的最小值、最大值,平均值或者众数来填充缺失值。这个选项只适用于数值型字段,即浮点型或整型。整型字段的均值取近似值。 **固定值:**使用用户指定的值来填充缺失值,这个选项适用于浮点型、整数型和字符串型字段。...

参考列过滤

敏捷挖掘节点手册 数据准备

**节点用途:**可以参照第二个输入表(参考表)过滤掉第一个输入表中的字段。根据对话框的设置,在输出表中,参考表的字段被包含或排除。 操作方法: 节点配置,如下图 配置选项卡: 说明: **包含/排除:**指定从第一个输入表中包含/排除所有参考表中的列到输出表中。 **确保字段类型一致:**即保证匹配列不仅有同样的名字,而且字段类型也要相同。如果勾选,必须是字段名称和类型都相同才算相同。如果不勾选,只需要字段名称相同即可。 案例:参考表2,将表1中多余变量删除,简化数据,提升系统效率。 表1与表2中相同字段有...

填充

敏捷挖掘节点手册 数据准备

**节点用途:**功能是基于第二个输入表(字典表)某个字段的值来替换第一个输入表某个字段的值。 从字典表中选择一字段(或者行ID)作为匹配查询的依据,再选择另外一个包含新值的字段作为替换字段。所有目标字段中与查找值匹配的项都将被替换为替换字段中对应的值。 操作方法: 节点配置,如下图 配置选项卡: 说明: **输入表:**目标字段,从第一个输入表中选择要替换值的字段 字典表: 输入(查询):从字典表中选择的查询字段,将会基于该字段与目标字段中的值进行匹配,如果相等,第一个输入表中该字段的值将会替换字段相应的...

自定义填充

敏捷挖掘节点手册 数据准备

**节点用途:**基于通配符或者正则表达式来实现替换字段取值的功能。 操作方法: 配置节点,如下图: 配置选项卡: 说明: **字段列表:**数据表中可用的字段,可以作为条件表达式的变量。 **函数:**编辑条件表达式可用的函数。 **操作符:**编辑条件表达式可用的操作符。 **描述:**函数或者运算符的介绍。 **表达式:**根据所选择的的函数,显示要计算的表达式 **填入字段:**需要进行填充的字段,通过双击左侧字段列表中的字段进行选择。 **替换:**这里可以指定替换的方案来选择要替换的内容。有“根...

组合

敏捷挖掘节点手册 数据准备

节点用途: 组合节点的功能与分列节点刚好相反,它是将多个字段的内容结合到一起,并生成一个新的字段。 配置选项卡 说明: **分隔符:**在此处输入分隔符,用于将新字段中的内容隔离开 **引用字符:**在此处输入引用字符,用于将原字段中的值括起来 **替换原分隔符:**可以在此处输入一个分隔符替代原有字段中的分隔符 **新字段名称:**指定新字段的名称

近似处理

敏捷挖掘节点手册 数据准备

节点用途: 根据指定的小数点位数或者有效数字使用指定的舍入方式对浮点型数据近似处理。只可以对指定的浮点型数据列执行此操作。 说明: 近似值可以添加为一个新的列,或者替换原始列。 如果添加为新列,需要指定新列名字的后缀。有7种不同的舍入模式可供选择:远离,靠近,向上,向下,半向上,半向下,偶数。 输出格式也可以使用不同的类型,可以参看下面的例子。将1.23501, 0.00000035239 和 -3.123103E9近似(半向上)保留3位有效数字的结果如下表。 输入 浮点型(*) 标准字符 简单字符 工程...

标准化

敏捷挖掘节点手册 数据准备

**节点用途:**标准化节点的功能是对数值型字段进行标准化。 在设置对话框中可以选择要标准化的字段,有三种标准化方法。 操作方法: 配置节点,如图: 图2-33-1 配置选项卡: 说明: Min-max 标准化 Min-max标准化方法是对原始数据进行线性变换。设minA和maxA分别为属性A的最小值和最大值,默认最小值为0.0,最大值为1.0。将A的一个原始值x通过min-max标准化映射成在区间[0,1]中的值x',其公式为: x'=(x –min(x))/(max(x)- min(x)) Z-scor...

延迟

敏捷挖掘节点手册 数据准备

节点用途: 根据指定的延迟和延迟间隔从前面的记录中将字段的值复制到当前记录。一般都是按周期性复制。 说明: 根据指定的延迟_L_确定要生成多少个所选字段的副本,根据延迟间隔_I_确定延迟几条记录。生成延迟字段名称由原字段名加编号组成,编号根据延迟_L_和延迟间隔_I_确定,每个延迟字段的编号为_I_, 2*I, 3*I, ...L*I。例如,如果_L=3_,I=1,则字段的编号为1,2,3;L=3,I=2,则字段的编号为2,4,6。编号也表示该字段第一个不为空的起始行。 延迟节点在做时间序列预测时特别有用,尤其可以...

字段重排

敏捷挖掘节点手册 数据准备

节点用途: 字段重排节点的功能是基于用户定义的设置改变输入表中字段的顺序。 **操作方法:**节点配置如下图: 配置选项卡: 将选中的字段,进行位置上的操作。向上或向下移动一个位置等等。如果选中字段已经移动到了列表的最顶端或最底端,再移动就会移到列表的另一端。