Python对多属性的重复数据去重实例

python中的pandas模块中对重复数据去重步骤：

1）利用DataFrame中的duplicated方法返回一个布尔型的Series,显示各行是否有重复行，没有重复行显示为FALSE，有重复行显示为TRUE；

2）再利用DataFrame中的drop_duplicates方法用于返回一个移除了重复行的DataFrame。

注释：

如果duplicated方法和drop_duplicates方法中没有设置参数，则这两个方法默认会判断全部咧，如果在这两个方法中加入了指定的属性名（或者称为列名），例如：frame.drop_duplicates(['state']),则指定部分列（state列）进行重复项的判断。

具体实例如下：

									>>> import pandas as pd 

									>>> data={'state':[1,1,2,2],'pop':['a','b','c','d']} 

									>>> frame=pd.DataFrame(data) 

									>>> frame 

									 pop state 

									0 a  1 

									1 b  1 

									2 c  2 

									3 d  2 

									>>> IsDuplicated=frame.duplicated() 

									>>> print IsDuplicated 

									0 False 

									1 False 

									2 False 

									3 False 

									dtype: bool 

									>>> frame=frame.drop_duplicates(['state']) 

									>>> frame 

									 pop state 

									0 a  1 

									2 c  2 

									>>> IsDuplicated=frame.duplicated(['state']) 

									>>> print IsDuplicated 

									0 False 

									2 False 

									dtype: bool 

									>>>

以上这篇Python对多属性的重复数据去重实例就是小编分享给大家的全部内容了，希望能给大家一个参考，也希望大家多多支持服务器之家。

原文链接：https://blog.csdn.net/IAlexanderI/article/details/79023154

秒客网

Python对多属性的重复数据去重实例

相关文章