数据框的合并排序、描述统计、分箱
数据框的合并排序、描述统计、分箱一、表合并二、数据框排序三、描述性统计四、变量与索引的相互转化五、分箱六、分类变量转虚拟变量七、数据框对象的复制八、字符串变量的常用方法九、删除重复项十、数据抽样一、表合并1、纵向合并# 导入库 import pandas as pd import numpy as np #建立两个表 data1pd.DataFrame(np.random.rand(4,3),columns[x1,x2,x3]) data2pd.DataFrame(np.random.rand(4,3),columns[x2,x3,x4]) # append 纵向合并 data1.append(data2,ignore_indexTrue) # ignore_indexTrue 表示忽略本来的索引合并后生成新的索引默认False按原有索引 # 如果data1和data2的index值有重复的话就会提示出错。verify_integrity参数的默认值为False # pd.concat 纵向合并 pd.concat([data1,data2],axis0,ignore_indexTrue) #合并的两个表要放在一个列表中2、横向合并# 建两个表 data1pd.DataFrame(np.random.rand(4,3),columns[x1,x2,x3]) data2pd.DataFrame(np.random.rand(4,3),columns[x4,x5,x6],index(range(1,5))) pd.concat([data1,data2],axis1,joininner) #加上join参数的设定如果为’inner’表示两表的交集如果是outer(默认)表示两表的并集#横向合并pd.merge方法 # 导入三表 individual1pd.read_excel(D:\\CDA数分学习资料\\python\\数据清洗\\pandas\\individual1.xlsx) individual2pd.read_excel(D:\\CDA数分学习资料\\python\\数据清洗\\pandas\\individual2.xlsx) familypd.read_excel(D:\\CDA数分学习资料\\python\\数据清洗\\pandas\\family.xlsx) # 补齐pid列 # 方法1 individual1[pid]individual1[pid].astype(str).map(lambda x:x.zfill(7)) # zfill 零填充 #方法2 def f1(x): return 0*(7-len(str(x)))str(x) individual1[pid]individual1[pid].map(f1) individual2[pid]individual2[pid].map(f1) # 一表和一表合并 data1pd.merge(individual1,individual2,left_onpid,right_onpid,howouter,suffixes(_1,_2)) # 处理重复列 data1[fid_1].fillna(data1[fid_2],inplaceTrue) # 将fid_2的值赋值给fid_1 data1.drop(columns[fid_2],errorsignore,axis1,inplaceTrue) # 删除 fid_2 data1.rename(columns{fid_1:fid},inplaceTrue) # fid_1重命名为fid data1[年龄_2].fillna(data1[年龄_1],inplaceTrue) data1.drop(columns[年龄_1],errorsignore,axis1,inplaceTrue) data1.rename(columns{年龄_2:年龄},inplaceTrue) #多表和一表合并表的前后位置不影响结果 data2pd.merge(data1,family,left_onfid,right_onfid,howouter) data2.to_excel(整理好后的数据.xlsx,indexFalse) # 导出表格参数how表示连接方式有四个可能取值’left’, ‘right’, ‘outer’, ‘inner’, 默认的取值是 ‘inner’。 left_on是设定左表的连 接变量right_on是设定右表的连接变量。 suffixes是设定重复列的变量名后缀以便知道重复列来自哪张表二、数据框排序data1pd.DataFrame(np.random.rand(4,3), columns[x1,x2,x3],indexnp.arange(4)[::-1]) # 数据框实例的sort_values方法 data1.sort_values(byx1,ascendingTrue) # 按x1列升序排序 data1.sort_values(by[x1,x2],ascending[True,False]) #先按x1升序再按x2降序经常x2没用 #需要知道的是ascendingTrue是升序ascendingFalse是降序。 #inplace 参数的默认取值是False,如果设定为True则会直接作用于原数据框实例。 #数据框实例的sort_index方法 data1.sort_index(ascendingTrue,inplaceTrue)三、描述性统计data1.describe() #如果括号内不设定任何参数则会对所有数值类型的变量进行描述统计。 data1.describe(exclude[object],percentiles[0.1,0.2]) #通过include参数可以选择对哪些类型的变量进行描述统计。 #通过exclude参数可以选择不对哪些类型的变量进行描述统计。 #percentiles参数可以设定报告哪些分位数默认是[.25, .5, .75] data1.describe(exclude[object],percentiles[0.1,0.2]) #中位数是不用设定也会报的。# 变量的值统计 data1[地域编码].value_counts() # 默认计算频数并降序排序 data1[年龄].groupby(data1[性别]).max() #按性别分组后求年龄最大值 #除了max还有min,mean,median,sumquantile,var,std,skew等 data1[年龄].groupby(data1[性别]).describe() #分组多个描述统计# 聚合方法 agg() 指定描述统计 data1[[年龄,受教育程度]].groupby(data1[性别]).agg([mean,max,min]) data1[年龄].groupby(data1[性别]).agg([lambda x:np.quantile(x,0.1)]) #可放入自定义匿名函数 # 分组对象的transform方法 data1[年龄].groupby([data1[性别]]).transform(np.mean) data1[年龄].groupby([data1[性别]]).transform(lambda x:x.count()) # transform 也可以放入自定义匿名函数lambda #和agg方法的区别在于transform方法返回的对象的长度和原数据框的行数相等。而且索引和原数据框或者序列的索引保持一致。行数相同这样就可以做合并做缺失值处理。# 数据透视表 data1.pivot_table(values[年龄,受教育程度],index[地域编码,性别], aggfunc{年龄:[np.mean,np.max],受教育程度:np.mean}) # aggfunc 可以对某列做单独的统计四、变量与索引的相互转化# 列变成索引 data1.set_index([pid],dropFalse) #将pid列设为索引drop参数False表示保留pid原有列反之删除 # inplace参数默认值为False #索引变列 temp.reset_index() # 将temp中索引转换成列 temp.reset_index().reset_index() # 新增索引原有索引变成列五、分箱# cut 分箱 缺点不能保证每个组分的均匀 pd.cut(data1[年龄],3) #cut 自动生成了大概3个等距的离散区间 data1[年龄段]pd.cut(data1.年龄, [0,45, 59, 74, 89,120], # 指定划分区域并添加标签 labels[青年, 中年, 老年前期,老年,长寿老人]) # pd.qcut 用分位数分箱 均匀分布 pd.qcut(data1[年龄],4,labels[1,2,3,4]) #均匀分成4个区间六、分类变量转虚拟变量pd.get_dummies(data1[性别],prefix性别) # 如果写上参数drop_firstTrue,删除第一个虚拟变量也就是会删除‘性别_女’列 pd.concat([data1,pd.get_dummies(data1[性别],prefix性别)],axis1) # 横向合并data1和新增的性别两列[外链图片转存失败(img-Rmsi9mzF-1567323775307)(D:\学习知识整理\Python\图片\数据框的合并图片.png)]七、数据框对象的复制#浅复制,一个改变另一个也会改变。 data2data1 #深复制单独改变一方另一方不受影响 data3data1.copy(deepTrue)八、字符串变量的常用方法data1.fid.str.len() #计算字符串的长度 data1.fid.str.replace(f,a) #对字符串变量进行查找替换 data1.fid.str.count(0) #计算字符串出现次数 data1.pid.astype(str).str.zfill(5) #填补字符串 #想查看更多函数请运行下面的命令 print(dir(data1.fid.str)) series1pd.Series([河北省衡水市,河北省石家庄市,河南省郑州市]) #正则表达式匹配。 series1.str.extract(r(.省)) # 将--省提出来九、删除重复项# duplicated()判断是否是重复的项 data1.duplicated() # 第一次出现False,第二次出现就是True返回布尔值 data1.drop_duplicates(subset[数学,英语],keepfirst) # 判断‘数学’‘英语’两列有没有重复值 # 参数keep 默认是first表示保留第一次出现的这个方法有inplace参数。十、数据抽样data2.sample(frac0.1) #设定抽取样本比例为10%。 #参数replaceFalse表示无放回抽样。 #参数random_state是设定随机种子保证每次运行代码抽取到的样本一样t’) # 判断‘数学’‘英语’两列有没有重复值参数keep 默认是first表示保留第一次出现的这个方法有inplace参数。#### 十、数据抽样data2.sample(frac0.1) #设定抽取样本比例为10%。#参数replaceFalse表示无放回抽样。#参数random_state是设定随机种子保证每次运行代码抽取到的样本一样

相关新闻

抖音下载器完全指南:三步掌握无水印视频批量下载技巧

抖音下载器完全指南:三步掌握无水印视频批量下载技巧

抖音下载器完全指南:三步掌握无水印视频批量下载技巧 【免费下载链接】douyin-downloader A practical Douyin downloader for both single-item and profile batch downloads, with progress display, retries, SQLite deduplication, and browser fallback suppor…

2026/9/20 11:21:20 阅读更多 →
基于Web的餐饮食品安全监管平台的设计与实现

基于Web的餐饮食品安全监管平台的设计与实现

目 录 1绪论 1.1研究背景 1.2目的和意义 1.3国内外研究现状 1.4本文的组织结构 2开发技术与环境配置 2.1 SpringBoot框架 2.2 Vue框架 2.3 MySQL数据库介绍 2.4 B/S架构 3系统分析 3.1可行性分析 3.1.1技术可行性 3.1.2操作可行性 3.1.3经济可行…

2026/9/19 21:00:58 阅读更多 →
KMS智能激活工具:Windows和Office永久激活的全面解决方案

KMS智能激活工具:Windows和Office永久激活的全面解决方案

KMS智能激活工具:Windows和Office永久激活的全面解决方案 【免费下载链接】KMS_VL_ALL_AIO Smart Activation Script 项目地址: https://gitcode.com/gh_mirrors/km/KMS_VL_ALL_AIO 还在为Windows系统激活和Office软件激活而烦恼吗?KMS_VL_ALL_AI…

2026/9/16 13:59:25 阅读更多 →

最新新闻

5个crud操作避坑指南:面试官最爱问的底层逻辑

5个crud操作避坑指南:面试官最爱问的底层逻辑

5个crud操作避坑指南:面试官最爱问的底层逻辑 面试时最怕什么?不是代码写不出来,而是被问“为什么这么写”时脑子一片空白。很多兄弟平时 CRUD…

2026/9/22 1:25:33 阅读更多 →
游戏显卡跑渲染慢? 3个最佳实践让帧率翻倍

游戏显卡跑渲染慢? 3个最佳实践让帧率翻倍

游戏显卡跑渲染慢? 3个最佳实践让帧率翻倍 盯着屏幕上一片惨白的 StackTrace 报错,或者看着 GPU 占用率卡在 99% 但帧数只有 20…

2026/9/22 1:25:33 阅读更多 →
红米手机开不了机避坑指南:面试突击与故障排查实战

红米手机开不了机避坑指南:面试突击与故障排查实战

红米手机开不了机避坑指南:面试突击与故障排查实战 屏幕黑着,Logo 卡死,报错一堆看不懂 StackTrace?别慌。这不仅是手机故障,更是你理解系统启动流程、异常处理与底层机制的绝佳契机。今天这篇 避坑指南…

2026/9/22 1:25:33 阅读更多 →
杀手数独算法速查手册:3个核心逻辑搞定项目落地

杀手数独算法速查手册:3个核心逻辑搞定项目落地

杀手数独算法速查手册:3个核心逻辑搞定项目落地 你是不是也经历过这种绝望?教程视频看了十几个,逻辑听起来头头是道,结果一上手写代码,连最基本的线索判断都卡壳。这种“看会了,手废了”的困境,在算法学习里太常见了。别慌,这不是你笨,而是缺少一份…

2026/9/22 1:25:33 阅读更多 →
银联支付是什么意思速查手册:3步搞定API变更

银联支付是什么意思速查手册:3步搞定API变更

银联支付是什么意思速查手册:3步搞定API变更 版本升级后 API 全变了,别慌。 这是后端转岗支付业务最真实的噩梦。 我整理了一份【速查手册】,专治各种“接口对不上”。 很多人听到 银联支付是什么意思 ,脑子里只有“刷卡”。 错了。…

2026/9/22 1:25:33 阅读更多 →
游戏退款系统源码解析:3步搞定支付逆向工程

游戏退款系统源码解析:3步搞定支付逆向工程

游戏退款系统源码解析:3步搞定支付逆向工程 别再把时间浪费在翻几百页的《支付网关接入指南》上了。官方文档里全是合规废话,真正能跑通的逻辑藏在几行核心代码里。 很多后端新手接到“游戏退款”需求时,第一反应是去查 API…

2026/9/22 1:24:32 阅读更多 →

日新闻

3台商务办公笔记本实测:手写实现环境配置,告别卡半天

3台商务办公笔记本实测:手写实现环境配置,告别卡半天

3台商务办公笔记本实测:手写实现环境配置,告别卡半天 配置环境就卡半天?别怪机器慢,多半是你没选对工具链。在Java、Go或Python的项目现场, 手写实现…

2026/9/22 0:00:41 阅读更多 →
剑帝加点速查手册:3分钟搞懂核心逻辑

剑帝加点速查手册:3分钟搞懂核心逻辑

剑帝加点速查手册:3分钟搞懂核心逻辑 面试被问原理答不上来,是不是常态?别慌。很多开发者对着 GitHub 开源仓库里的代码发呆,看似简单实则暗藏玄机。今天这份【剑帝加点】速查手册,直接带你拆解核心实现,把面试必考的原理讲透。…

2026/9/22 0:00:41 阅读更多 →
手写实现图片压缩网站核心:搞定WebP转换与质量调优

手写实现图片压缩网站核心:搞定WebP转换与质量调优

手写实现图片压缩网站核心:搞定WebP转换与质量调优 复制来的代码跑不通不知道怎么调?别慌,这种“复制粘贴地狱”在开发圈太常见了。尤其是做 图片压缩网站…

2026/9/22 0:00:41 阅读更多 →

周新闻

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

Flutter for OpenHarmony游戏卡片渐变背景实战:从原理到性能优化

直接铺开项目本身吧。这几个月我一直在折腾一件事:用Flutter给OpenHarmony做一款游戏集合类的App,说白了就是把若干小游戏塞进一个壳里,用统一入口分发。这个方向本身不算新鲜,真正让我花了不少心思的,是首页那堆游戏卡…

2026/9/21 3:13:20 阅读更多 →
Word表格编号全攻略:从列表编号到题注交叉引用

Word表格编号全攻略:从列表编号到题注交叉引用

写Word文档,最让人头疼的往往是那些“看起来不起眼”的小问题。比如表格编号这事:今天在表后面多加了两个空白行,明天给客户交稿前发现整个章节的编号全部错位,光是挨个改序号就能耗掉大半个下午。我前阵子帮人整理一份上百页的技…

2026/9/21 2:19:36 阅读更多 →
从第一个站到第二个站:独立开发者的静态网站选型与落地实践

从第一个站到第二个站:独立开发者的静态网站选型与落地实践

1. 项目概述1.1 核心需求解析做独立开发者这几年,说实话,第一个网站上线的那天晚上我兴奋得没睡着。但等它跑了半年,流量惨淡、功能臃肿、代码自己都懒得看第二遍之后,我才慢慢琢磨明白一个道理:第一个网站是练手&…

2026/9/21 4:51:05 阅读更多 →

月新闻

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

2026/9/21 15:36:51 阅读更多 →
容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…

2026/9/21 15:36:51 阅读更多 →
容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步

容器 容器化技术与镜像安全管理:核心链路应该先拆哪一步分类:[工程技术]细分主题:Docker 容器化技术与镜像安全管理:核心链路的逐步实现与关键代码取舍面对一个积累了五六年历史包袱的单体架构应用(包含 Web 接口、后台…

2026/9/19 23:35:34 阅读更多 →