信息统数的插补法和理报告提绷:§1:信息系统数据的缺失数据缺失的原因数据缺失机制缺值处理的重要性和复杂性数据的插补·插补的方法比较与总结问题与挑战§2:信息系统的决策处理§1:信息系统数据的缺失在各种实用的数据库或者信息管理系统里,数据属性缺失的情况经常发生且不可避免。因此在大多数情况下,信息系统是不完备的,或者说存在某种程度的不完备。缺失值的插补是一个非常具有挑战性的任务,因为插补效果的好坏会极大的影响信息的可信度及决策的后续处理过程。如果丢失了大量信息,并且会产生偏倚,使不完全观测数据与完全观测数据间产生系统差异。:数据嶔失的原因:·(1)有些信息暂时无法获取。例如在医疗数据库中,并非所有病人的所有临床检验结果都能在给定的时间内得到,就致使一部分属性值空缺出来。又如在申请表数据中,对某些问题的反映依赖于对其他问题的回答(2)有些信息是被遗漏的。可能是因为输入时认为不重要、忘记填写了或对数据理解错误而遗漏,也可能是由于数据采集设备的故障、存储介质的故障、传输媒体的故障、一些人为因素等原因而丢失了。(3)有些对象的某个或某些属性是不可用的。也就是说,对于这个对象来说,该属性值是不存在的,如一个未婚者的配偶姓名、一个儿童的固定收入状况等。·(4)有些信息(被认为)是不重要的。如一个属性的取值与给定语境是无关的,或训练数据库的设计者并不在乎某个属性的取值(称为dontcarevalue)·(5)获取这些信息的代价太大。·(6)系统实时性能要求较高,即要求得到这些信息前迅速做出判断或决策。二:薮据缺失机袆·在对缺失数据进行处理前,了解数据缺失的机制和形式是十分必要的。将数据集中不含缺失值的变量(属性)称为完全变量,数据集中含有缺失值的变量称为不完全变量,Little和Rubin定义了以下三种不同的数据缺失机制,这缺失的数据从缺失的分布来讲的·(1)完全随机缺失(pletelyatRandom,MCAR)。数据的缺失与不完全变量以及完全变量都是无关的。(2)随机缺失(MissingatRandom,MAR)。数据的缺失仅仅依赖于完全变量。(3)非随机、不可忽略缺失(NotMissingatRandom,NMARornonignorable)。不完全变量中数据的缺失依赖于不完全变量本身,这种缺失是不可忽略的。·从缺失值的所属属性上讲,如果所有的缺失值都是同一属性,那么这种缺失为单值缺失,如果缺失属于不同的属性,称为任意缺失,另外对于时间列类的数据,可能存在随着时间的缺失,这种的缺失称为单调缺失三:缺值处理的重要咝和复糸唑数据缺失在许多研究领域都是一个复杂的问题。对数据挖掘来说,空值的存在,造成了以下影响:首先,系统丢失了大量的有用信息;第二,系统中所表现出的不确定性更加显著,系统中蕴涵的确定性成分更难把握;第三,包含空值的数据会使挖掘过程陷入混乱,导致不可靠的输出。数据挖掘算法本身更致力于避免数据过分适合所建的模型,这一特性使得它难以通过自身的算法去很好地处理不完整数据。因此,空缺的数据需要通过专门的方法进行推导、填充等,以减少数据挖掘算法与实际应用之间的差距。四:薮据的插补·数据插补就是给每一个缺失数据一些替代值,如此得到“完全数据集”后,再使用完全数据统计分析方法分析数据并进行统计推断。·80年代以后,人们开始重视数据缺失问题,着力研究插补方法。迄今为止,提出并发展了30多种的插补方法。在抽样调查中应用的主要是单一插补和多重插补。
信息系统数据的缺失 来自淘豆网m.daumloan.com转载请标明出处.