如何做好数据预处理(二)

在上一篇文章中我们提到的数据预处理的数据清洗,数据清洗就是对于肮脏数据的清除,而肮脏数据主要有异常值和缺失值,我们在进行数据预处理的时候不但要注意数据的清洗,还需要注意数据的集成、数据变换、数据规范的内容,只有这样,我们才能够为下一步工作做好铺垫。 首先说说数据集成吧,所谓数据集成就是将多个数据源合并放到一个数据存储中,当然如果所分析的数据原本就在一个数据存储里就不需要数据的集成了。一般来说,数据
相关文章
相关标签/搜索