1.6.1.1.1. 位于同一类的数据点彼此之间的相似度大于与其他类的数据点的相似度
1.6.1.1.2. 在分别对象时不但要考虑对象之间的距离,还要求分别出的类具有某种内涵形貌,从而避免传统技术的某些片面性
1.6.1.2.1. 指对某类数据对象的内涵进行形貌,并概括这类对象的有关特征
1.6.1.2.2. 特征性形貌
1.6.1.2.2.1. 形貌某类对象的*共同特征
1.6.1.2.3. 区别性形貌
1.6.1.2.3.1. 形貌不同类对象之间的*区别
1.6.1.3.1. 关联规则形貌在一个数据集中一个数据与其他数据之间的相互依存性和关联性
1.6.1.3.2. 数据关联是数据库中存在的一类紧张的可被发现的知识
1.6.1.3.3. 若两个或多个变量的属性值之间存在某种规律性,就称为关联
1.6.1.3.4. 关联可分为简朴关联、时序关联、因果关联
1.6.1.3.5. 关联规则挖掘则是从事件、关系数据中的项集合对象中发现频繁模式、关联规则、相关性或因果布局
1.6.1.4.1. 针对具有时间或顺序上的关联性的时序数据集,序列模式挖掘就是挖掘相对时间或其他模式出现频率高的模式
1.6.1.4.2. 重要针对符号模式,而数字曲线模式属于统计时序分析中的趋势分析和预测范畴
1.6.1.4.3. 时序模式是指通过时间序列搜索出的重复发生概率较高的模式
1.6.2.1.1. 分类算法必要从练习集中获得一个关于种别和其他属性值之间关系的模型,继而在测试集上应用该模型,确定模型的精度
1.6.2.1.2. 一个待处理的数据集可分为练习集和测试集两个部分,前者用于构建模型,后者用于验证
1.6.2.2.1. 研究一个随机变量对另一组变量的相依关系的统计分析方法
1.6.2.2.2. 线性回归是利用数理统计中的回归分析,来确定两种或两种以上变量间相互依赖的定量关系的一种统计分析方法
1.6.2.2.3. 当自变量为非随机变量、因变量为随机变量时,分析它们的关系称为回归分析
1.6.2.2.4. 当两者都是随机变量时,称为相关分析
1.6.2.3.1. 大型数据集中常有异常或离群值,统称为偏差
1.6.2.3.2. 偏差检验的根本方法就是寻找观察结果与参照值之间的差别
2.1.4.2.1. Taverna
2.1.4.2.2. Kepler Project
2.2.3.1.1. 以数据挖掘算法和模型为主,并不针对具体的应用场景或数据类型
2.2.3.1.2. 可视化作为辅助手段,帮助更加直观地展示输入数据和计算结果,或者直接深入模型内部,使用户直接看到模型的核心数据和布局,并进行交互式调整
2.2.3.1.3. 基于黑盒方式的可视化加强方法
2.2.3.1.3.1. 面向输入数据的可视化方法
2.2.3.1.3.2. 面向算法结果的可视化方法
2.2.3.1.3.3. 迭代式可视化方法
2.2.3.1.4. 基于白盒方式的可视化加强方法
2.2.3.2.1. 文本分析
2.2.3.2.1.1. 数据挖掘及可视化方法在文本分析中占有非常紧张的地位
2.2.3.2.2. 图像分析
2.2.3.2.2.1. 谱聚类方法*在图像分析中有着广泛的应用
2.2.3.2.3. 用户行为分析
2.2.3.2.3.1. 用户在同一网站上的页面浏览顺序形成点击流
2.2.3.2.4. 时空数据分析
2.2.3.2.4.1. 时空数据挖掘重点关注带有时间和空间属性的数据
2.2.3.2.5. 深度学习
2.2.3.2.5.1. 随着深度学习在各个领域的爆发式增长,可视化研究者也开始动手利用自己所长,对深度学习模型开展研究和探索
2.2.3.2.5.2. 深度生成模型(DGM,Deep Generative Model)是近几年来深度学习方面最前沿的研究之一,其练习过程相对于其他模型(如CNN、RNN等)来说较为复杂,且非常依赖使用者对深度学习算法的深入理解和实践履历
2.2.3.2.6. 其他应用场景
2.2.3.2.6.1. 在高维数据分析方面,INFUSE系统借助交互式可视化方法对特征选取任务进行辅助和加强
2.2.3.2.6.2. 在回归分析方面,HyperMoVal系统和文献均提出了新的可视化计划,以展示回归分析中的数据分布和模型的练习结果
您需要 登录 才可以下载或查看,没有账号?立即注册
使用道具 举报
登录后关闭弹窗