Skip to main content
Advanced Search
Search Terms
Content Type

Exact Matches
Tag Searches
Date Options
Updated after
Updated before
Created after
Created before

Search Results

536 total results found

平衡

敏捷挖掘节点手册 数据准备

**节点用途:**使用平衡节点修正数据集中的不平衡,以便它们符合指定的检验标准。 说明: 若某个数据集只有两个值(T和F),并且 90% 的观测值为F,而只有 10% 的观测值为T,这类现象成为样本失衡。 很多建模技术处理此类失衡数据都有困难,因为它们倾向于只学习这些F的结果,而忽略T的结果(因为这些结果少的可怜)。如果数据平衡很好,T和F结果具有大致相同的数量,那么模型将更有可能找出分辨这两个组的模型。 这种情况下,平衡节点对于创建平衡指令,从而减少带有F结果的观测值数量非常有用。 操作方法: 配置选项卡: 说...

RMF汇总

敏捷挖掘节点手册 数据准备

**节点用途:**根据指定的用户ID, 对其交易金额、交易频次、时间间隔进行汇总, 输出用户ID的交易总金额、交易频次、最近一次交易时间间隔。 配置选项卡: 说明: 固定日期 :用于计算最近一次用户交易的交易间隔。 **用户ID:**指定用户的ID号 **交易日期:**对应用户每次交易的交易日期 **交易金额:**对应用户每次交易的交易金额

类型

敏捷挖掘节点手册 数据准备

节点用途: 主要是为了计算或更新字段的元数据,包字段测量类型、值域和缺失,以及指定字段的角色。 比如,分类预测类模型都需要指定一个目标变量,所以必须通过类型节点的角色功能。首先指定一个字段的角色为目标,指定影响因素的角色为输入,这样模型节点就可以自动识别目标字段,并将其作为目标变量,而输入字段被作为自变量,参与训练模型。 配置选项卡: 说明: **字段:**显示的是输入表中所有的字段名称。 **测量:**这是测量级别,用于描述某个给定字段中数据的特征。最大的作用是为了放宽对字段存储类型的限制。 比如说,通常条...

过滤

敏捷挖掘节点手册 数据准备

节点用途: 用于过滤不需要的字段,或者对字段进行重命名。 操作方法: 配置节点 图2-24-1 配置选项卡: 说明: 原始字段:输入数据表中所包含的字段列表。 **过滤:**点击想要过滤掉的字段的箭头,箭头上将会显示一个叉号,该字段在接下来的分析中会被过滤掉。也可以通过”反选”按钮来批量反向过滤字段,这在字段特别多时很有用。 **输出字段:**如果想要重命名字段,可以在这里双击显示字段名,可以更改此字段名。新字段名会出现在节点输出表中。 配置好节点好,启用缓存,执行 查看过滤表

分列

敏捷挖掘节点手册 数据准备

**节点用途:**将数据字段中的值,按照某种统一规则进行拆分。与excel中的数据分列用途,方法基本一样。 操作方法 如下: 配置节点 图2-25-1 配置选项卡: 说明: 拆分目标:选择输入数据中要进行拆分的字段。 拆分方式:拆分字段的规则有两种,基于分隔符或者固定宽度。 **基于分隔符:**选择或输入分隔符号 **固定宽度:**定义划分的数据宽度 数据预览:定义好数据值拆分规则后,可以使用预览功能查看,分列后的数据是否达到预期,以便调整数据分列的规则。 确定配置,启用缓存,执行。 查看输出表...

类型转换

敏捷挖掘节点手册 数据准备

节点用途: 将一个字段或一组字段从一种数据类型转换为另一种数据类型。 在数据挖掘过程中,不同类型的字段的处理方式是不一样的,所以有时需要对字段的类型进行一下转换,再进行下一步的分析。例如,将字符型转换为数值型、数值型转换为字符型等。 操作方法 如下: 配置节点 配置选项卡: 说明: 类型选择:数据类型转换方式 **字符串到数值:**将字符型的字段转换为数值型。一次可以处理多个字段 **数值到字符串:**将数值型(整型和浮点型)字段转换为字符型字段。一次可以处理多个字段。 浮点到整型:将浮点型字段转换为整...

缺失填充

敏捷挖掘节点手册 数据准备

节点用途: 用来处理输入表中的缺失值。 操作方法: 配置节点,如下图: 配置选项卡: 说明:分为两类——整型字段和字符型字段 **无操作:**仍保留缺失值,这个选项对所有类型的字段都适用。 **现在删除:**删除所有包含缺失值的记录,这个选项对所有类型的字段都适用。 **最小、最大、平均,众数:**用字段的最小值、最大值,平均值或者众数来填充缺失值。这个选项只适用于数值型字段,即浮点型或整型。整型字段的均值取近似值。 **固定值:**使用用户指定的值来填充缺失值,这个选项适用于浮点型、整数型和字符串型字段。...

参考列过滤

敏捷挖掘节点手册 数据准备

**节点用途:**可以参照第二个输入表(参考表)过滤掉第一个输入表中的字段。根据对话框的设置,在输出表中,参考表的字段被包含或排除。 操作方法: 节点配置,如下图 配置选项卡: 说明: **包含/排除:**指定从第一个输入表中包含/排除所有参考表中的列到输出表中。 **确保字段类型一致:**即保证匹配列不仅有同样的名字,而且字段类型也要相同。如果勾选,必须是字段名称和类型都相同才算相同。如果不勾选,只需要字段名称相同即可。 案例:参考表2,将表1中多余变量删除,简化数据,提升系统效率。 表1与表2中相同字段有...

填充

敏捷挖掘节点手册 数据准备

**节点用途:**功能是基于第二个输入表(字典表)某个字段的值来替换第一个输入表某个字段的值。 从字典表中选择一字段(或者行ID)作为匹配查询的依据,再选择另外一个包含新值的字段作为替换字段。所有目标字段中与查找值匹配的项都将被替换为替换字段中对应的值。 操作方法: 节点配置,如下图 配置选项卡: 说明: **输入表:**目标字段,从第一个输入表中选择要替换值的字段 字典表: 输入(查询):从字典表中选择的查询字段,将会基于该字段与目标字段中的值进行匹配,如果相等,第一个输入表中该字段的值将会替换字段相应的...

自定义填充

敏捷挖掘节点手册 数据准备

**节点用途:**基于通配符或者正则表达式来实现替换字段取值的功能。 操作方法: 配置节点,如下图: 配置选项卡: 说明: **字段列表:**数据表中可用的字段,可以作为条件表达式的变量。 **函数:**编辑条件表达式可用的函数。 **操作符:**编辑条件表达式可用的操作符。 **描述:**函数或者运算符的介绍。 **表达式:**根据所选择的的函数,显示要计算的表达式 **填入字段:**需要进行填充的字段,通过双击左侧字段列表中的字段进行选择。 **替换:**这里可以指定替换的方案来选择要替换的内容。有“根...

组合

敏捷挖掘节点手册 数据准备

节点用途: 组合节点的功能与分列节点刚好相反,它是将多个字段的内容结合到一起,并生成一个新的字段。 配置选项卡 说明: **分隔符:**在此处输入分隔符,用于将新字段中的内容隔离开 **引用字符:**在此处输入引用字符,用于将原字段中的值括起来 **替换原分隔符:**可以在此处输入一个分隔符替代原有字段中的分隔符 **新字段名称:**指定新字段的名称

近似处理

敏捷挖掘节点手册 数据准备

节点用途: 根据指定的小数点位数或者有效数字使用指定的舍入方式对浮点型数据近似处理。只可以对指定的浮点型数据列执行此操作。 说明: 近似值可以添加为一个新的列,或者替换原始列。 如果添加为新列,需要指定新列名字的后缀。有7种不同的舍入模式可供选择:远离,靠近,向上,向下,半向上,半向下,偶数。 输出格式也可以使用不同的类型,可以参看下面的例子。将1.23501, 0.00000035239 和 -3.123103E9近似(半向上)保留3位有效数字的结果如下表。 输入 浮点型(*) 标准字符 简单字符 工程...

标准化

敏捷挖掘节点手册 数据准备

**节点用途:**标准化节点的功能是对数值型字段进行标准化。 在设置对话框中可以选择要标准化的字段,有三种标准化方法。 操作方法: 配置节点,如图: 图2-33-1 配置选项卡: 说明: Min-max 标准化 Min-max标准化方法是对原始数据进行线性变换。设minA和maxA分别为属性A的最小值和最大值,默认最小值为0.0,最大值为1.0。将A的一个原始值x通过min-max标准化映射成在区间[0,1]中的值x',其公式为: x'=(x –min(x))/(max(x)- min(x)) Z-scor...

延迟

敏捷挖掘节点手册 数据准备

节点用途: 根据指定的延迟和延迟间隔从前面的记录中将字段的值复制到当前记录。一般都是按周期性复制。 说明: 根据指定的延迟_L_确定要生成多少个所选字段的副本,根据延迟间隔_I_确定延迟几条记录。生成延迟字段名称由原字段名加编号组成,编号根据延迟_L_和延迟间隔_I_确定,每个延迟字段的编号为_I_, 2*I, 3*I, ...L*I。例如,如果_L=3_,I=1,则字段的编号为1,2,3;L=3,I=2,则字段的编号为2,4,6。编号也表示该字段第一个不为空的起始行。 延迟节点在做时间序列预测时特别有用,尤其可以...

字段重排

敏捷挖掘节点手册 数据准备

节点用途: 字段重排节点的功能是基于用户定义的设置改变输入表中字段的顺序。 **操作方法:**节点配置如下图: 配置选项卡: 将选中的字段,进行位置上的操作。向上或向下移动一个位置等等。如果选中字段已经移动到了列表的最顶端或最底端,再移动就会移到列表的另一端。

RFM分级

敏捷挖掘节点手册 数据准备

**节点用途:**根据指定的用户最近一次交易间隔、交易频次及交易总金额来得到用户分级。 配置选项卡: 说明: **最近一次交易间隔:**最近一次交易时间间隔,以天为单位 **交易频次:**用户交易的总次数 **交易总金额:**用户交易的总金额

分箱

敏捷挖掘节点手册 数据准备

**节点用途:**这个节点对数值型数据按一定间距进行分组,称为分箱。 节点配置: 配置选项卡: 说明: **选择分箱字段:**列表中显示的是需要进行分箱的字段 **搜索:**字段较多时,可以通过输入要查找字段名称中包含的字符进行模糊查找。重复点击搜索按钮可以逐一标记下一个包含搜索字符的字段。也可以勾选复选框“选中所有匹配字段”选中所有符合条件的字段 分箱的方法: **固定箱数:**通过调整箱数大小,确定自动分箱的数量 **固定宽度:**确定分箱的宽度。程序将根据指定的宽度进行分箱并确定分箱的箱数 **分位数...

日期时间提取

敏捷挖掘节点手册 数据准备

节点用途: 从已有的日期时间字段中提取日期(年、季度、月、周、日)、时间(时、分、秒)等生成可用的字段。例如,生成年份字段、月份字段、日字段等。 **前提条件:**目标数据中需要有日期类型的字段。,如果日期字段是其他类型数据,则需要提前将该字段进行类型转换。 操作方法 如下: 1 节点配置,如图: 图2-38-1 配置选项卡 说明: **提取日期属性:**可供选择提取年,季度,月,日,星期,天,周 **提取时间属性:**可供选择提取时,分,秒 **提取日期时间:**提取日期时间数据后,定义新字段名称。 2 配...