读数据可视化10数据(下)

[复制链接]
发表于 2026-8-21 06:18:29 | 显示全部楼层 |阅读模式

1. 数据挖掘

1.1. 指计划特定算法,从大量的数据集中去探索发现知识或者模式的理论和方法,是知识工程学科中知识发现的关键步骤
1.2. 直观的定义是通过自动或半自动的方法探索与分析数据,从大量的、不完全的、有噪声的、模糊的、随机的数据中提取隐含在其中的、人们事先不知道的、潜在有用的信息和知识的过程
1.3. 数据挖掘不是数据查询或网页搜索,它融合了统计、数据库、人工智能、模式识别和机器学习理论中的思路,特别关注异常数据、高维数据、异构和异地数据的处理等挑战性问题
1.4. 任务

  • 1.4.1. 基于某些变量预测其他变量的未来值,即预测性方法(例如分类、回归)
  • 1.4.2. 以人类可解释的模式形貌数据(如聚类、模式挖掘、关联规则发现)​
1.5. 数据挖掘指从大量数据中识别有用的、新颖的、潜在有用的、最终可理解的规律和知识
1.6. 重要方法

  • 1.6.1. 形貌性方法
  • 1.6.1.1. 聚类
1.6.1.1.1. 位于同一类的数据点彼此之间的相似度大于与其他类的数据点的相似度
1.6.1.1.2. 在分别对象时不但要考虑对象之间的距离,还要求分别出的类具有某种内涵形貌,从而避免传统技术的某些片面性


  • 1.6.1.2. 概念形貌
1.6.1.2.1. 指对某类数据对象的内涵进行形貌,并概括这类对象的有关特征
1.6.1.2.2. 特征性形貌
1.6.1.2.2.1. 形貌某类对象的*共同特征
1.6.1.2.3. 区别性形貌
1.6.1.2.3.1. 形貌不同类对象之间的*区别


  • 1.6.1.3. 关联规则挖掘
1.6.1.3.1. 关联规则形貌在一个数据集中一个数据与其他数据之间的相互依存性和关联性
1.6.1.3.2. 数据关联是数据库中存在的一类紧张的可被发现的知识
1.6.1.3.3. 若两个或多个变量的属性值之间存在某种规律性,就称为关联
1.6.1.3.4. 关联可分为简朴关联、时序关联、因果关联
1.6.1.3.5. 关联规则挖掘则是从事件、关系数据中的项集合对象中发现频繁模式、关联规则、相关性或因果布局


  • 1.6.1.4. 序列模式挖掘
1.6.1.4.1. 针对具有时间或顺序上的关联性的时序数据集,序列模式挖掘就是挖掘相对时间或其他模式出现频率高的模式
1.6.1.4.2. 重要针对符号模式,而数字曲线模式属于统计时序分析中的趋势分析和预测范畴
1.6.1.4.3. 时序模式是指通过时间序列搜索出的重复发生概率较高的模式


  • 1.6.2. 预测性方法
  • 1.6.2.1. 分类
1.6.2.1.1. 分类算法必要从练习集中获得一个关于种别和其他属性值之间关系的模型,继而在测试集上应用该模型,确定模型的精度
1.6.2.1.2. 一个待处理的数据集可分为练习集和测试集两个部分,前者用于构建模型,后者用于验证


  • 1.6.2.2. 回归
1.6.2.2.1. 研究一个随机变量对另一组变量的相依关系的统计分析方法
1.6.2.2.2. 线性回归是利用数理统计中的回归分析,来确定两种或两种以上变量间相互依赖的定量关系的一种统计分析方法
1.6.2.2.3. 当自变量为非随机变量、因变量为随机变量时,分析它们的关系称为回归分析
1.6.2.2.4. 当两者都是随机变量时,称为相关分析


  • 1.6.2.3. 偏差检测
1.6.2.3.1. 大型数据集中常有异常或离群值,统称为偏差
1.6.2.3.2. 偏差检验的根本方法就是寻找观察结果与参照值之间的差别
2. 数据科学与可视化

2.1. 数据工作流

  • 2.1.1. 工作流是多个用户之间按照某种预定义的规则传递文档、信息或任务的自动过程
  • 2.1.2. 工作流概念开端于生产组织和办公自动化领域,用于形貌一个特定的、现实的过程步骤,在计算机应用情况下属于计算机支持的协同工作的研究范畴
  • 2.1.3. 定义和遵循工作流有助于以标准化、自动化的方式实现某个预期的业务目的,便于协同、分享、发布和传播有用的工作模式
  • 2.1.4. 形式
  • 2.1.4.1. 面向商业流程处理和商业数据处理的商业工作流
  • 2.1.4.2. 面向科学研究过程控制和数据处理流程控制的科学工作流
2.1.4.2.1. Taverna
2.1.4.2.2. Kepler Project


  • 2.1.5. 数据工作流特指为数据处理和分析流程定义的自动过程,其本质是计算业务过程的部分或整体在计算机应用情况下的自动化,与自动化工程学科密切相关
  • 2.1.6. VisTrails*是一个开源的面向计算机仿真、数据浏览和可视化的科学工作流管理系统
  • 2.1.7. DimStiller
  • 2.1.8. 随着机器学习等领域的迅猛发展,以机器学习和数据挖掘为重要数据分析方法的数据科学工作流系统也蓬勃兴起
2.2. 可视数据挖掘

  • 2.2.1. 目的在于使用户能够参与对大规模数据集进行探索和分析的过程,并在参与过程中搜索感兴趣的知识
  • 2.2.2. 可视化技术也被应用来呈现数据挖掘算法的输入数据和输出结果,使数据挖掘模型的可解释性得以加强,从而提高数据探索的效率
  • 2.2.3. 两大类
  • 2.2.3.1. 可视化加强的通用数据挖掘方法
2.2.3.1.1. 以数据挖掘算法和模型为主,并不针对具体的应用场景或数据类型
2.2.3.1.2. 可视化作为辅助手段,帮助更加直观地展示输入数据和计算结果,或者直接深入模型内部,使用户直接看到模型的核心数据和布局,并进行交互式调整
2.2.3.1.3. 基于黑盒方式的可视化加强方法
2.2.3.1.3.1. 面向输入数据的可视化方法
2.2.3.1.3.2. 面向算法结果的可视化方法
2.2.3.1.3.2.1. 数据挖掘算法的输出结果是用户最关心的内容,可视化方法通常用于结果分析、模型验证等方面
2.2.3.1.3.3. 迭代式可视化方法
2.2.3.1.4. 基于白盒方式的可视化加强方法


  • 2.2.3.2. 面向应用场景的方法
2.2.3.2.1. 文本分析
2.2.3.2.1.1. 数据挖掘及可视化方法在文本分析中占有非常紧张的地位
2.2.3.2.2. 图像分析
2.2.3.2.2.1. 谱聚类方法*在图像分析中有着广泛的应用
2.2.3.2.3. 用户行为分析
2.2.3.2.3.1. 用户在同一网站上的页面浏览顺序形成点击流
2.2.3.2.4. 时空数据分析
2.2.3.2.4.1. 时空数据挖掘重点关注带有时间和空间属性的数据
2.2.3.2.5. 深度学习
2.2.3.2.5.1. 随着深度学习在各个领域的爆发式增长,可视化研究者也开始动手利用自己所长,对深度学习模型开展研究和探索
2.2.3.2.5.2. 深度生成模型(DGM,Deep Generative Model)是近几年来深度学习方面最前沿的研究之一,其练习过程相对于其他模型(如CNN、RNN等)来说较为复杂,且非常依赖使用者对深度学习算法的深入理解和实践履历
2.2.3.2.6. 其他应用场景
2.2.3.2.6.1. 在高维数据分析方面,INFUSE系统借助交互式可视化方法对特征选取任务进行辅助和加强
2.2.3.2.6.2. 在回归分析方面,HyperMoVal系统和文献均提出了新的可视化计划,以展示回归分析中的数据分布和模型的练习结果
3. 数据科学的挑战

3.1. 作为数据获取和存储基础的计算机科学,由于数据本钱急剧下降导致的数据量急剧增长、数据复杂程度飞速上升,如何有用地获取数据、有用地处理数据获取的不确定性、对原始数据进行清理、分析,进而高效地完成数据存储和访问,达到去重、去粗取精的目的,是急需解决的问题
3.2. 如何构建布局化数据与非布局化数据之间的有用关联及语义信息,存储异构、多元数据之间的关系并支持后续分析,并提供充足的性能保证,也是面临的挑战之一
3.3. 对于统计、分析、数据挖掘研究者,将大数据变“小”​,即从大数据中获取更加有用的信息和知识,是研究重点
3.4. 可视化作为数据科学中不可或缺的紧张一环,也开始高度关注大数据带来的问题,其中包括:高维数据可视化,复杂、异构数据可视化,针对海量数据的实时交互计划,分布式协同可视化,以及针对大数据的可视分析流程等

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
回复

使用道具 举报

登录后关闭弹窗

登录参与点评抽奖  加入IT实名职场社区
去登录
快速回复 返回顶部 返回列表