
1. 数据不确定性的可视化
1.1. 数据从采集到使用的过程中不可避免地会带来误差和不确定性(Uncertainty)
1.2. 不确定性可视化被认为是数据可视化的关键问题之一,迄今为止仍存在重要问题亟待解决
1.2.1. 不确定性的清晰表示
1.2.2. 降低或避免因不确定性可视化所带来的视觉混乱
1.2.3. 降低可视化不确定性所引起的对确定性数据可视化结果的负面影响
1.2.4. 不确定性表达的可视隐喻
1.3. 不确定性
1.3.1. Uncertainty
1.3.2. 源于拉丁语certus(确定的、固定的、已解决的)
1.3.3. 是现代统计学的核心
1.3.4. 在物理学、金融学、经济学等领域,都涉及不确定性的概念
1.4. 可变性
1.4.1. Variability
1.4.2. 不一致性
1.4.3. 如果一组数据的两个或多个元素的值不相等,那么这组数据是可变的
1.4.4. 数据的可变性将导致未知的不确定性
1.5. 噪声
1.5.1. Noise
1.5.2. 指由平稳随机过程产生的不一致性,一个显著的例子是线性系统中的高斯白噪声
1.5.3. 通常导致不确定性,因为噪声本身具有很大的随机性
1.6. 不完整性
1.6.1. 设备故障、保密限制等因素是造成数据丢失、不完整的主要原因
1.6.2. 不完整的数据往往伴随着不确定性,是不可信的
1.7. 不定性
1.7.1. Indeterminacy
1.7.2. 指针对给定的模型及其相关数据,存在多种参数设置
1.8. 偏倚
1.8.1. Bias
1.8.2. 是一种系统偏差
1.8.3. 测量偏倚是真实值与测量值之间的系统偏差
1.9. 误差
1.9.1. Error
1.9.2. 是真实值与测量值之间的随机偏差
-
1.9.3. 误差可以*在真实值左右等概率地变动
- 1.9.3.1. 偏倚通常会偏向于某一个方向
1.10. 准确性
1.10.1. 没有偏倚和误差即为准确
1.10.2. 实际的测量值通常是真实值与偏倚、误差的和
1.11. 精确度
1.11.1. 没有误差即为精确
1.11.2. 一种非常精确的测量通常可能存在一定的偏倚
1.11.3. 常通过使用更多的有效数字来提高数据的精确度
1.12. 可信度
1.12.1. 可信度表示随着时间的变化,测量结果的可重复性
1.12.2. 测量结果之间的差异越小,数据越可信
1.13. 有效性
1.13.1. 有效性表征了真实测量值与测量过程之间的关系
1.13.2. 为了提高有效性,通常不仅需要测量变量本身,还需要测量与实际被测变量相关的一些事物或变量
1.14. 质量
- 1.14.1. 质量是完整性、可信度和有效性的综合
1.15. 不确定性的来源
1.15.1. 在数据的收集、处理和可视化过程中都存在不确定性,而且不确定性在可视化流水线的不同阶段也存在并不断传播
1.15.2. 测量仪器的优劣和测量者知识水平的高低,都将给实际测量获得的数据带来极大的不确定性
1.15.3. 在对原始数据进行可视化之前,通常需要对数据进行过滤、简化、采样等操作
2. 不确定性的可视化方法
2.1. 统计学家发明了众多不确定性可视化方法,如误差条形图、盒须图等
2.2. 大致分为4大类:图标法、视觉元素编码法、几何体表达法和动画表达法
2.3. 图标法
2.3.1. 首先将不确定性编码为基本图标,再将图标在数据场上进行标识和布局,直接表达不确定性
2.3.2. 用图标来编码不确定性符合人们长期以来采用符号和图标表示信息的习惯,是一种简单的、易于理解的方法
2.3.3. 误差条(Error Bar)*是常见的图标法之一,用于可视化一维的不确定性数据
-
2.3.4. 盒须图(Box Plot)
2.3.4.1. 箱型图
2.3.4.2. 因其由一系列线和框组成而得名
2.3.4.3. 最基本的盒须图是一种五数统计图(五数统计是一种常用的数据分布特征描述方法,包括最大值、上四分位数、中位数、下四分位数和最小值),编码了数据的最基本的一阶统计特征
2.3.4.4. 传统的盒须图是对一维数据而言的,表现形式简单,主要使用的是分位数、极值等关键信息
2.3.5. 误差条和盒须图是统计学家等专业用户常用的不确定性可视化方法
-
2.3.6. 流场雷达图
2.3.6.1. Flow Radar Glyph
2.3.6.2. 是一种非稳定流场的静态可视化方法
2.3.6.3. 允许用户在一个静态可视化结果中直接观察、对比和探索非稳定流场中与时间相关的现象和特征
-
2.3.7. 高夹角分辨率扩散影像
2.3.7.1. High-Angular-Resolution Diffusion Imaging,HARDI
2.3.7.2. 是近年来发展起来的一种新兴的磁共振成像技术
2.3.7.3. 与弥散张量成像技术相比(Diffusion Tensor Imaging,DTI)相比,该技术能捕获更多的细节信息,如纤维交叉等
2.3.7.4. 易受噪音、梯度脉冲数等因素的影响,致使HARDI数据具有极大的不确定性
2.3.7.5. 常用的ODF(Orientation Distribution Function)方法以图标的方式呈现了HARDI数据的确定性,但却无法刻画数据采集、可视化过程中的不确定性
2.4. 视觉元素编码法
2.4.1. 可视化的各种视觉元素(如颜色、尺寸)亦可用于表现不确定性
2.4.2. 是一种非常直接的不确定性可视化方法,因为其采用视觉元素作为不确定性的表达载体,所以用户可以快速地定位可视化结果中不确定性所在的区域和大小
2.4.3. 以视觉元素作为不确定性编码的基本载体是众多不确定性可视化方法的*基本思想
2.4.4. 基本的视觉标量包括位置、形状、亮度、颜色、方向和纹理等
2.4.5. 颜色是表达不确定性的常用视觉元素之一
2.4.6. 通过将不确定性映射为不同的颜色,即可实现不确定性的可视编码
2.4.7. 纹理是一个比较复杂的视觉元素,它是颜色、尺寸、形状和方向等视觉元素的综合体现
2.4.8. 纹理合成是一种重要的流场可视化方法。传统的纹理合成方法,如线卷积积分(LIC)、纹理平流(Texture Advection),并不适用于存在不确定性的流场可视化
2.5. 几何体表达法
2.5.1. 通过在可视化结果中引入代理性的几何体(如点、线、包围体等)表达不确定性
2.5.2. 利用代理性的几何物体可提供额外的视觉表达,借以表达数据的不确定性
2.5.3. 多次模拟计算结果称为集合数据(Ensemble Data),特定的一次模拟计算结果称为集合数据的一个成员
2.5.4. 集合数据是研究不确定性的重要工具之一
2.5.5. 意大利面图(Spaghetti Plot)是一种经典的集合数据可视化方法,因其可视化结果类似于一盘杂乱的意大利面而得名
2.5.6. 集合数据(Ensemble Data)这种多维数据要复杂得多,抽取其关键信息也复杂得多
2.5.7. 在一定程度上与图标法有着一定的相似性*,其可视化结果比较形象、直观、易于理解
2.5.8. 在引入代理几何体表示不确定性时,也极大地影响了原有的确定性数据的可视化结果
2.6. 动画表达法
2.6.1. 生成可视化结果序列,以动画的形式让观者发现其中的差异和运动,进而理解不确定性
2.6.2. 在人类视觉系统的前注意处理过程(Preattentive Process)中,运动具有极高的处理优先级
2.6.3. 用户需要长时间、连续地查看动画,才能找到不同动画帧之间的差异性
2.6.4. 动画中的跳动、闪烁等不确定性表达方式还容易引起视觉疲劳
2.7. 图(网络)的不确定性可视化
-
2.7.1. 主要方法
2.7.1.1. 对不确定图用Monte Carlo Process对图边权重独立地进行采样
2.7.1.2. 对采样出来的图用力引导算法进行布局
2.7.1.3. 对某个节点在2D空间的分布,用其在不同采样结果的位置的对齐操作进行逼近
-
2.7.2. AmbiguityVis
- 2.7.2.1. 一个分析图布局结果中歧义性(Ambiguity,也可以视为一种不确定性)的可视分析系统