
1. 总览
1.1. 数据
1.1.1. 是符号的集合,是表达客观事物的未经加工的*原始素材
1.1.2. 是数据对象和其属性的*集合
1.2. 属性
1.2.1. 可被看成是变量、值域、特征或特性
1.2.2. 属性值可以是表达属性的任意数值或符号,同一类属性可以具有不同的属性值
1.2.3. 不同的属性也可能具有相同的取值和不同的含义
1.3. 数据模型
1.3.1. 是用来描述数据表达的*底层描述模型
1.3.2. 包含数据的定义和类型,以及不同类型数据的操作功能
1.4. 概念模型
1.4.1. 对目标事物的状态和行为进行抽象的语义描述
1.4.2. 并提供构建、推理支持等操作
1.5. 拥有更多的数据意味更多的价值,然而当前的信息处理和分析手段却远落后于数据获取的速度
1.6. 大数据
1.6.1. 指无法在现有能力和工具的支持下,在可接受的时间范围内进行采集、管理和处理的数据
-
1.6.2. 特征
- 1.6.2.1. 海量的数据规模
1.6.2.1.1. 1ZB=109TB
1.6.2.2. 快速的数据流转、动态的数据体系
1.6.2.3. 多样的数据
1.6.2.4. 巨大的数据价值
-
1.6.3. 案例
1.6.3.1. 金融服务类机构同样拥有大量客户数据,通过对大数据进行分析、挖掘,银行能够有效地发现金融欺诈行为
1.6.3.2. 保险公司可以从客户数据中发现潜在的“优质客户”,并分析出适合这些客户的保险产品,进行个性化营销
1.6.3.3. 海量科学数据的产生将科学研究推进到一个新的模式,数据在科学探索中开始发挥越来越大的作用
1.6.3.3.1. 现在科学研究人员遇到了新的挑战,即在拥有大型数据集的同时,他们也需要应对这种数据密度的软件工具和高性能计算资源,以协助进行基于数据的科学研究
1.7. 数据在政府管理、国家安全等领域的价值也越来越明显
- 1.7.1. 国家战略政策方针的制定也开始依赖大数据和数据科学,期望从数据中能够寻找到支持国家决策的有效信息
1.8. 数据即服务(DaaS)
1.9. 数据科学
1.9.1. 以数据为研究对象的电子科学、信息科学、语义网络、数据组织与管理、数据分析、数据挖掘和数据可视化等手段
1.9.2. 可以有效地提取隐藏在数据中有价值的信息,并且将数据利用率提高到传统方法所不能及的高度
1.9.3. 是提炼科学原理、验证科学假设、服务科学探索的新思路
1.9.4. 改变了所有学科个人和协作工作的模式
1.9.5. 使得无论是商业还是科学数据分析处理都上升到一个新的“数据驱动”的阶段,帮助数据分析师和科学家解决尺度、复杂度超越已有的所有工具承受范围的全局问题
1.9.6. 作为数据内涵信息的展示方法和人机交互接口,数据可视化已成为数据科学的核心要素之一
1.10. 海量的数据通过可视化方法变成形象、生动的图形,有助于人类对数据中的属性、关系进行深入探究,利用人类智慧来挖掘数据中蕴含的信息,从表面杂乱无章的海量数据中探究隐藏的规律,为科学发现、工程开发、医学诊疗和商业决策等提供依据
2. 数据基础
2.1. 数据分类
2.1.1. 数据的分类和*信息与知识的分类相关
2.1.2. 数据可被分为实体和关系两部分
2.1.3. 实体是被可视化的对象
-
2.1.4. 关系定义了实体与其他实体之间关系的结构和模式
- 2.1.4.1. 关系可被显式地定义,也可在可视化过程中逐步挖掘
2.1.5. 实体或关系可以配备属性
2.2. 数据属性
-
2.2.1. 离散属性
- 2.2.1.1. 离散属性的取值来自有限或可数的集合,例如邮政编码、等级、文档单词等
-
2.2.2. 连续属性
2.2.2.1. 连续属性则对应于实数域,例如温度、高度和湿度等
2.2.2.2. 实数表示的精度受限于所采用的数值精度
2.3. 交互方法主要有:概括、缩放、过滤、查看细节、关联、查看历史和提取等
2.4. 数据集
2.4.1. 数据集是数据的实例
-
2.4.2. 数据记录集
2.4.2.1. 数据记录由一组包含固定属性值的数据元素组成
2.4.2.2. 数据矩阵
2.4.2.2.1. 如果数据对象具有一组固定的数值属性,则数据对象可视为高维空间的点集,每个维度对应单个属性
2.4.2.2.1.1. 这种数据集可以直接表达为一个m×n的矩阵
2.4.2.2.2. 数据矩阵通常被组织为表格形式
- 2.4.2.3. 文档向量表示
2.4.2.3.1. 文档是单词的集合
2.4.2.3.2. 如果统计文档中所有单词出现的频率,则一个文档可以被表示为一个向量,其长度是单词集的个数,每个分量记录单词集中每个单词在该文档中的频率
- 2.4.2.4. 事物处理数据
2.4.2.4.1. 一类特殊的数据记录,每条记录都包含一组数据项
2.4.2.4.2. 事物处理数据与数据矩阵的差别在于,事物处理数据的每条记录包含的个数和属性不固定,因此无法用矩阵这种大小确定的方式进行表达
-
2.4.3. 图数据集
- 2.4.3.1. 图
2.4.3.1.1. 是一种非结构化的数据结构,由一组节点和一组连接两个节点之间的加权边组成
2.4.3.1.2. 世界航线图
2.4.3.1.3. 万维网链接图
2.4.3.1.4. 化学分子式
- 2.4.3.2. 树
2.4.3.2.1. 是一种没有回路的连通图
2.4.3.2.2. 任意两个顶点间有且只有一条路径的图
-
2.4.4. 有序数据集
2.4.4.1. 有序数据是具有某种顺序的数据集
2.4.4.2. 常见的数据集包括空间数据、时间数据、时空数据、顺序数据和基因测序数据等
2.5. 数据相似度与密度
2.5.1. 相似度(Similarity)是衡量多个数据对象之间相似的数值,通常位于0和1之间
2.5.2. 与之对应的测度是相异度(Dissimilarity),其下限是0,上限与数据集有关,可能超过1
2.5.3. 邻近度是相似度和相异度的统一描述
2.5.4. 欧几里得距离
2.5.5. 明科夫斯基距离(欧几里得距离的推广)
2.5.6. 余弦距离
2.5.7. Jaccard相似度
2.5.8. 欧几里得密度(单位区域内的点的数目)
2.5.9. 概率密度
2.5.10. 基于图结构的密度
2.5.11. 将区域分成等分,统计每个部分所包含的点的数目
2.5.12. 基于中心的欧几里得密度定义为该点固定尺寸邻域内的点的数目
3. 数据精简
3.1. 由高维性带来的维度灾难、数据的稀疏性和特征的多尺度性是大数据时代中数据所特有的性质
3.2. 直接对海量高维的数据集进行可视化通常会产生杂乱无章的结果,这种现象被称为视觉混乱
3.3. 为了能够在有限的显示空间内表达比显示空间尺寸大得多的数据,我们需要进行数据精简
3.4. 在数据存储、分析层面进行的数据精简能降低数据复杂度,减少数据点数目并同时保留数据中的内涵特征,从而减少查询和处理时的资源开销,提高查询的响应性能
3.5. 方法
3.5.1. 统计分析、采样、直方图、聚类和降维
-
3.5.2. 采用各类数据特征抽取方法
- 3.5.2.1. 奇异值分解、局部微分算子、离散小波变换
3.6. 数据精简可用于提升大规模数据查询和管理的交互性
3.7. 由于分析和推理只需要定性的结果,所以可采用近似解提高针对大数据的精简效率
3.8. 使用质量指标优化非视觉因素,如时间、空间等
3.9. 使用质量指标优化数据可视化,称为可视数据精简
3.10. 可视数据精简需要自动分析数据以便选择和衡量数据的不同特征,如关联性、布局和密度
3.11. 尺寸是可量化的量度,如数据点的数量,构成了其他计算的基础
3.12. 视觉有效性用于衡量图像退化(如冲突、模糊)或可视布局的美学愉悦程度
3.13. 常见方法有数据密度和数据油墨比等特征
3.14. 特征保留度是评估可视化质量的核心,它衡量可视化结果在数据、可视化和认知方面正确展现数据特性的程度
4. 数据预处理步骤
4.1. 合并
4.1.1. 将两个以上的属性或对象合并为一个属性或对象
-
4.1.2. 效用
4.1.2.1. 有效简化数据
4.1.2.2. 改变数据尺度
4.1.2.3. 减少数据的方差
4.2. 采样
4.2.1. 采样是统计学的基本方法,也是对数据进行选择的主要手段,在对数据的初步探索和最后的数据分析环节经常被采用
4.2.2. 实施采样操作的根本原因是获取或处理全部数据集的代价太高,或者时间开销无法接受
4.2.3. 最简单的随机采样可以按某种分布随机从数据集中等概率地选择数据项
4.2.4. 采样也可分层次进行:先将数据全集分为多份,然后在每份中随机采样
4.3. 降维
4.3.1. 维度越高,数据集在高维空间的分布越稀疏,从而减弱了数据集的密度和距离的定义对于数据聚类和离群值检测等操作的影响
4.3.2. 将数据属性的维度降低,有助于解决维度灾难,减少数据处理的时间和内存消耗
4.3.3. 可以更为有效地可视化数据
4.3.4. 降低噪声或消除无关特征等
4.3.5. 降维是数据挖掘的核心研究内容,常规的做法有主元分析、奇异值分解、局部结构保持的LLP、ISOMAP等方法
4.4. 特征子集选择
4.4.1. 从数据集中选择部分数据属性值可以消除冗余的特征、与任务无关的特征
4.4.2. 特征子集选择可达到降维的效果,但*不破坏原始的数据属性结构
4.4.3. 特征子集选择的方法包括:暴力枚举法、特征重要性选择、压缩感知理论的稀疏表达方法等
4.5. 特征生成
4.5.1. 特征生成可以在原始数据集基础上构建新的能反映数据集重要信息的属性
4.5.2. 特征抽取
4.5.3. 将数据应用到新空间
4.5.4. 基于特征融合与特征变换的特征构造
4.6. 离散化与二值化
4.6.1. 将数据集根据其分布划分为若干个子类,形成对数据集的离散表达,称为*离散化
4.6.2. 将数据值映射为二值区间,是数据处理中的常见做法
4.6.3. 将数据区间映射到[0,1]区间的方法称为*归一化
4.7. 属性变换
4.7.1. 将某个属性的所有可能值一一映射到另一个空间的做法称为属性变换
-
4.7.2. 标准化与归一化是两类特殊的属性变换
4.7.2.1. 标准化将数据区间变换到某个统一的区间范围
4.7.2.2. 归一化则变换到[0,1]区间