[Kaggle实战] Titanic 逃生预测 (3) - Age离散化

昨天的文章大致构建了一个data matrix, 并进行了数据清理。有一个遗留问题就是,如何将连续的Age属性离散化?   对于连续属性离散化,可以参考《数据挖掘导论》 2.3.6小节。 首先,我们试着将数据图形化,看看是否有明显的间隔区间。 画图依然使用JFreeChart来进行。 从肉眼的角度来分析,虽然没有太明显的区间,但是从分布上看,基本上能如下图进行划分:   再来一张书上的原图进行对比
相关文章
相关标签/搜索