Advanced Search
Search Results
536 total results found
表
节点用途: 在表格视图展示数据。如果行数未知,视图会在打开时计算行数。 节点配置如图: 该节点配置很简单,可在最大显示记录数中设置显示的数据数,如果超出数目设置则只显示设置数目,如果未超出则显示现有数据
概述
(此页面暂无内容)
数据审核
节点用途: 通过数据审核,可以大致了解数据内容,还可以审核数据质量。描述一列数据的特征,可以计算出最大值、最小值、平均数、总数、众数、中位数、方差等数据来进行描述。 操作方法: 配置节点,如下图: 图4-1-1 配置选项卡: 说明: **默认值:**系统默认所有字典被选定,作为描述统计字段。 **自定义字段:**用户可以自行选择需要了解字段,查看数据特征。 颜色交互字段:在自定义字段选择中,可以使用本选项,按照颜色分类查看要考察字段的数据特征 **基本统计量:**输出最大值,最小值,平均值,标准差,偏度,有...
相关分析
**节点用途:**研究两个或两个以上处于同等地位的随机变量间的相关关系,变量之间是否有关系,以及有关系的程度。 操作方法: 配置节点,如下图: 图4-2-1 确认配置后,执行并查看视图 操作示例: 将员工信息表中数据字段,按照图4-2-1配置后,执行,并查看视图,性别,收入之间,相关系数为0.216,相关性小,性别于教育程度的相关系数近0.096,相关性也很小,教育程度于收入的相关系数为0.369,相关性较高一点。
单样本T检验
**节点用途:**检验单个字段的均值与指定的常数检验值的差异是否显著。对于每个检验字段,均可输出该字段的描述性统计量(均值、标准差和均值的标准误)和T检验结果(如P值、置信区间等)。 例如:某生产商可以用此方法检验一批生产线的平均日产量是否等于100。 节点配置: 配置选项卡: 说明: **检验值:**指定一个常数作为检验值,每个检验字段的均值将与此值做比较 置信度(%): 指定一个1到99之间的值作为置信度,用来计算检验字段均值和假设的检验值之差的置信区间,默认是95 检验字段: 选择一个或多个字段。分别为每...
概述
(此页面暂无内容)
分类预测
线性回归 **节点用途:**线性回归可以用来研究一个或多个自变量对一个目标字段的影响重要程度,或者对目标字段进行预测。 使用条件: 该节点的目标字段必须为数值型字段。 使用该节点前需要先用一个类型节点指定参与分析的字段的角色,目标字段的角色定义为目标,其他自变量的角色定义为输入。 节点输出: 通过训练, 节点可以输出预测结果、模型的参数估计以及PMML格式的模型 在该节点之后配合使用分类预测器节点,可以得出未知目标字段的预测结果。通过评估节点还可以评估预测效果。 操作方法: 在配置对话框中可以指定汇总方式...
关联规则
关联规则 **节点用途:**该节点是一种基于Apriori算法的关联分析模型。 Apriori 节点会发现数据中的关联规则。关联规则是下列形式的语句:如果 条件 则 结果。 例如,”if 客户购买剃须刀和剃后产品,then 该客户还会购买剃须泡沫,并且置信度为 80%。” Apriori 从数据中提取一系列规则,提取的规则带有出现频率最高的信息内容。 使用要求: 要创建 Apriori 规则集,您需要一个或多个输入字段和一个或多个目标字段。 输入字段和输出字段(角色为输入、目标或两者的字段)必须是符号型字段。角色为...
聚类分析
DBScan 节点用途: 聚类的一种算法。 DBScan是一个比较有代表性的基于密度的聚类算法。与划分和层次聚类方法不同,本算法将簇定义为密度相连的点的最大集合,能够把具有足够高密度的区域划分为簇,并可在噪声的空间数据库中发现任意形状的聚类。 但是,在配置算法时,同样需要预先设定每个类别的最小样本点的个数和点之间的邻域半径。 DBSCAN聚类算法步骤: 首先在数据库中随机抽取一个点作为一个类 如果抽取的点是核心点,则找出所有从该点密度可达的对象,形成一个类; 如果抽取的点是边界点,则跳出本次循环,寻找下一个点 重...
时间序列
ARIMA **节点用途:**时间序列预测中的一种算法。 **算法逻辑:**ARIMA模型,是指将非平稳时间序列转化为平稳时间序列,然后将因变量仅对它的滞后值以及随机误差项的现值和滞后值进行回归所建立的模型。ARIMA模型根据原序列是否平稳以及回归中所含部分的不同,包括移动平均过程(MA)、自回归过程(AR)、自回归移动平均过程(ARMA)以及ARIMA过程。 节点配置 : 配置选项卡: 说明: **学习方法:**包括条件似然,Yule-Walker,极大似然 **p值:**指定自回归模型AR的阶数。 **d值:...
特征选择
**节点用途:**数据挖掘问题中可能包括成百或者上千的字段可以作为输入字段,从这些字段中挑选出模型应该包含的字段需要耗费很大的精力。为了缩小选择范围,可以使用特征选择节点进行初步筛选。该节点分两步对输入字段进行筛选,首先根据数据的特征质量过滤掉数据质量很差的字段,减少了后面的计算量,然后通过计算剩余的输入字段对目标的重要性对剩余字段进行排序或者过滤。 节点配置: 配置选项卡: 说明: **按重要性分段:**选择根据重要性筛选字段的规则,并指定相应的阀值 **特征质量选择:**按缺失值、单类别所占最大比重、分类数...
降维分析
主成分分析 **节点用途:**该节点对输入数据执行主成分分析。用于提取最大主成份,可以被主成分分析应用节点使用,将输入数据映射到一个更低维度的数据集同时最大限度的保留信息。 节点配置: 配置选项卡: 说明: **提取主成分:**设置降维后的维度数,即主成分数。可以直接指定主成分个数或通过指定保留的最少信息比例来训练。如果直接设置,则该值不能高于参与分析的字段数。 **替换原始数据:**设定是否覆盖原数据 缺失值: 模型数据中,若有缺失值,模型可选择终止执行,停止建模,或者模型仅使用完整记录进行建模。 主成分应...
模型评估
评估 节点用途:分析评估模型质量 节点配置: 配置选项卡: 说明:两种方式输出模型评估结果 案例:建立一下工作流: 配置节点为默认设置,执行后,结果如下图: 信息熵 **节点用途:**根据给定的参考类为聚类结果评分。 该节点有两个输入端口,第一个输入端口连接参考类的表,第二个输入端口连接包含聚类结果的表,且这两个表均需要包含类ID。 从对话框中选择两个表中相应的列。成功执行之后,视图中会显示熵值和质量值,其中熵值越小越好,质量值属于[0,1],越趋于1越好。 节点配置: 配置选项卡: 说明: 参考字段:选...
概述
(此页面暂无内容)
噪声词过滤
节点用途: 噪声词过滤节点的功能是将分词字段中的无关词汇或者不重要的词过滤掉,进而筛选出重要的词汇,可过滤中文或者英文。 过滤的方法有多种,分别是过滤与内置的噪声词库匹配的词汇、过滤与自定义噪声词库匹配的词汇、过滤所有的标点符号、过滤所有的数字、区分大小写和过滤所有字节长度小于N的词。这些方法可以只选择一个进行过滤,也可以选择全部进行过滤。过滤后输出表中的列数保持不变,只会过滤掉匹配条件的记录。 节点配置: 配置选项卡 说明: 选择过滤字段:选择文档中所需过滤字段 **使用内置噪声词库:**如果勾选此项,将会过...
字符串匹配
**节点用途:**字符串匹配节点的功能是对两个字符串字段进行比较,计算两个字段中字符串之间的距离,并在输出表中列出最相似的字符串。 该节点需要两个输入表,一个表包含用于比较的字符串字段,一个表包含一个词典字段。字符串匹配节点会寻找词典字段中与指定的字符串字段中最相似的元素。 节点配置: 配置选项卡 说明: **选择字符串字段:**选择数据表中所需要的字符串字段。该列来自于第一个输入表 **选择匹配字段:**选择一个与字符串列对比的词匹配字段。该匹配字段来自于第二个输入表(词典表)。程序将会从这个词典列中找出与目...
语句提取
**节点用途:**语句提取节点的功能是提取文档中的语句并返回一个包含文档字段、语句字段和表示语句中包含的词量字段的表。 节点配置: 配置选项卡 **选择文档字段:**选择数据表中所需要的字符串字段
分词
节点用途: 分词节点的功能是用于对中文,英文文本进行分词,进而从非结构化数据中提取结构信息。 分词的对象都是每列字段。分词后将在输出表中追加分词、计数和词性三个字段。分词字段表示从文本字段中提取出词;计数字段表示按照每个文本对得到每个分词出现次数的统计,注意,统计的只是每次词所在文本中出现的次数,并不是所有文本中出现的次数;词性字段显示的每个分词的词性。 节点配置: 配置选项卡 说明: **选择词库:**选择适合分词的词库,中文或者是英文 **选择分词的字段:**请在这里选择要分词的文本字段。分词程序将对该字段...