)
二十、数据科学导论——数据预处理第3关数据集成-海纳百川任务描述本关任务编写一个能够将两个数据集合并的程序。相关知识为了完成本关任务你需要掌握1. 如何使用 python2. 如何使用 pandas 。数据集成数据集成指将多个数据源中的数据整合到一个一致的存储中。模式集成指整合不同数据源中的元数据实体识别问题匹配来自不同数据源的现实世界的实体比如 A.cust-id B.customer_no。我们需要检测并解决数据值的冲突。对现实世界中的同一实体来自不同数据源的属性值可能是不同的。可能的原因不同的数据表示或不同的度量等等。下面是对数据预处理-数据集成的介绍视频课程视频《数据预处理-数据集成》冗余数据处理集成多个数据库时经常会出现冗余数据同一属性在不同的数据库中会有不同的字段名一个属性可以由另外一个表导出如“年薪”。有些冗余可以被相关分析检测到仔细将多个数据源中的数据集成起来能够减少或避免结果数据中的冗余与不一致性从而可以提高挖掘的速度和质量。编程要求请仔细阅读右侧代码结合相关知识在 Begin-End 区域内进行代码补充读入数据 Task2/diabetes_null.csv 和 Task2/diabetes_zero.csv 合并两个数据并输出 shape。测试说明平台会对你编写的代码进行测试预期输出 (1536, 9)。提示使用 concat 合并数据。开始你的任务吧祝你成功import numpy as npimport pandas as pddef student():#********* Begin *********#a pd.read_csv(Task2/diabetes_null.csv)b pd.read_csv(Task2/diabetes_zero.csv)data pd.concat([a, b])print(data.shape)#********* End *********#第4关数据变换-同源共流任务描述本关任务学习掌握常见的数据变换完成给定数据的规范化的输出。相关知识数据变换即对数据进行规范化处理以便于后续的信息挖掘。下面是对数据预处理-数据变换的介绍视频课程视频《数据预处理-数据变换》数据变换常见的数据变换包括特征二值化、特征归一化、连续特征变化定性特征哑编码等。下面简单介绍常用的数据变换平滑去除数据中的噪声 分箱、聚类、回归聚集汇总数据立方体的构建数据概化沿概念分层向上汇总规范化将数据按比例缩放使之落入一个小的特定区间。最小最大规范化、z-score规范化、小数定标规范化属性构造通过现有属性构造新的属性并添加到属性集中以增加对高维数据的结构的理解和精确度数据变换 —— 规范化下面介绍三种规范化的方法最小最大规范化z-score规范化小数定标规范化编程要求请仔细阅读右侧代码结合相关知识在 Begin-End 区域内进行代码补充计算并输出数据集 diabetes_null.csv 的 z-score 规范化和最小最大规范化。 z-score 需设置参数 axis0 以标准化每个特征测试说明平台会对你编写的代码进行测试提示#z-score规范化和最小最大规范化from sklearn.preprocessing import normalize,MinMaxScaler预期输出z-score规范化[[0.04235974 0.04706315 0.04102167 ... 0.03770165 0.00535162 0.06108472][0.00705996 0.02702951 0.0376032 ... 0.02110571 0.03318003 0. ][0.05647966 0.05819295 0.03646371 ... 0.04040751 0.03425035 0.06108472]...[0.03529979 0.0384773 0.04102167 ... 0.01473191 0.00321097 0. ][0.00705996 0.04006728 0.00341847 ... 0.02098545 0.0503052 0.06108472][0.00705996 0.02957347 0.00398822 ... 0.01894102 0.02461744 0. ]]最小最大规范化[[0.35294118 0.74242424 0.58677686 ... 0.22715517 0.02564103 1. ][0.05882353 0.42424242 0.53719008 ... 0.10818966 0.35897436 0. ][0.47058824 0.91919192 0.52066116 ... 0.24655172 0.37179487 1. ]...[0.29411765 0.60606061 0.58677686 ... 0.0625 0. 0. ][0.05882353 0.63131313 0.04132231 ... 0.10732759 0.56410256 1. ][0.05882353 0.46464646 0.04958678 ... 0.09267241 0.25641026 0. ]]开始你的任务吧祝你成功import numpy as npimport pandas as pdfrom sklearn.preprocessing import normalize, MinMaxScalerdef student():train pd.read_csv(Task3/diabetes_null.csv, na_values[#NAME?])train[Insulin] train[Insulin].fillna(100)train[SkinThickness] train[SkinThickness].fillna(train[SkinThickness].median())train[BloodPressure] train[BloodPressure].fillna(train[BloodPressure].median())train[BMI] train[BMI].fillna(train[BMI].mean())train[Glucose] train[Glucose].fillna(train[Glucose].mean())#********* Begin *********## suppressTrue 关闭科学计数法precision8保留8位小数np.set_printoptions(threshold6, edgeitems3, linewidth200, precision8, suppressTrue)# 本关z‑score用normalize列归一化看样例数值不是StandardScalerz_data normalize(train, axis0)print(z‑score规范化)print(np.array2string(z_data, separator ))scaler MinMaxScaler()mm_data scaler.fit_transform(train)print(最小最大规范化)print(np.array2string(mm_data, separator ))#********* End *********#有任何问题都可以随时关注私信