python pandas dataframe 去重函数

本文详细介绍了如何使用Python的Pandas库进行数据去重,包括使用duplicated()方法标识重复行,以及使用drop_duplicates()方法删除重复行。通过具体代码示例展示了如何针对特定列进行去重操作。

摘要生成于 C知道 ,由 DeepSeek-R1 满血版支持, 前往体验 >

转自:https://blog.csdn.net/xinxing__8185/article/details/48022401

 

今天笔者想对pandas中的行进行去重操作,找了好久,才找到相关的函数

先看一个小例子

from pandas import Series, DataFrame
 
data = DataFrame({'k': [1, 1, 2, 2]})
 
print data
 
IsDuplicated = data.duplicated()
 
print IsDuplicated
print type(IsDuplicated)
 
data = data.drop_duplicates()
print data
 

执行结果是:

   k
0  1
1  1
2  2
3  2
0    False
1     True
2    False
3     True
   k
0  1
2  2

 

 

DataFrame的duplicated方法返回一个布尔型Series,表示各行是否重复行。

 

而 drop_duplicates方法,它用于返回一个移除了重复行的DataFrame

 

这两个方法会判断全部列,你也可以指定部分列进行重复项判段。

例如,希望对名字为k2的列进行去重,

data.drop_duplicates(['k2'])

 

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值