数据量太大?散点图装不下怎么办?用Python解决数据密度过大难题
cac55 2024-10-26 08:10 16 浏览 0 评论
当我们需要观察比较2个变量间的关系时,散点图是我们首选图表。
可当数据量非常大,数据点又比较集中在某个区间中,图表没法看,密密麻麻的怎么看?
怎么办?这时候就得看密度图了
什么是密度图?
所谓的密度图 (Density Plot) 就是数据的分布稠密情况,它常用于显示数据在连续时间段内的分布状况。严格来说,它是由直方图演变而来,类似于把直方图进行了填充。
一般是使用平滑曲线来绘制数值水平来观察分布,峰值数值位置是该时间段内最高度集中的地方。
它比直方图适用性更强,不受分组数量(直方图的条形数量不宜过多)的影响,能更好地界定分布形状 。
本篇文章不谈论直方图,之后老海会专门总结关于直方图的使用。
什么是2D密度图?
说完了密度图和直方图,它们都是一维数据变量。
这下我们来看看2D密度图,它显示了数据集中两个定量变量范围内值的分布,有助于避免在散点图中过度绘制。
如果点太多,则2D密度图会计算2D空间特定区域内的观察次数。
该特定区域可以是正方形或六边形(六边形),还可以估算2D内核密度估算值,并用轮廓表示它。
本篇文章主要描述一下2D密度图的使用。
2D密度图的基本数据样式
2D密度图的使用建议
- 密度图是一种直方图的代替方案,常用来观察连续变量的分布情况
- 2D密度图主要用来解决数据点密度过大的问题,要注意密度分割是否合理。
- 当数据范围都非常集中,数据间变化不大时,密度图往往很难观察效果。
下面开始具体的操作案例
准备工作
还是和之前一样,引入必要的工具包
## 初始字体设置,设置好可避免很多麻烦
plt.rcParams['font.sans-serif']=['Source Han Sans CN'] # 显示中文不乱码,思源黑体
plt.rcParams['font.size'] = 22 # 设置图表全局字体大小,后期某个元素的字体大小可以自行调整
plt.rcParams['axes.unicode_minus'] = False # 显示负数不乱码
## 初始化图表大小
plt.rcParams['figure.figsize'] = (20.0, 8.0) # 设置figure_size尺寸
## 初始化图表分辨率质量
plt.rcParams['savefig.dpi'] = 300 # 设置图表保存时的像素分辨率
plt.rcParams['figure.dpi'] = 300 # 设置图表绘制时的像素分辨率
## 图表的颜色自定义
colors = ['#dc2624', '#2b4750', '#45a0a2', '#e87a59',
'#7dcaa9', '#649E7D', '#dc8018', '#C89F91',
'#6c6d6c', '#4f6268', '#c7cccf']
plt.rcParams['axes.prop_cycle'] = plt.cycler( color=colors)
path = 'D:\\系列文章\\'
# 自定义文件路径,可以自行设定
os.chdir(path)
# 设置为该路径为工作路径,一般存放数据源文件
设定图表样式和文件路径
Financial_data = pd.read_excel('虚拟演示案例数据.xlsx',sheet_name='二维表')
Financial_data
读入数据
Financial_data = pd.read_excel('虚拟演示案例数据.xlsx',sheet_name='二维表')
Financial_data
常见的6种密度图表类型
from scipy.stats import kde # 引入核密度计算方法
# 为方便演示,创建6个子图的画板
fig, axes = plt.subplots(3,2, figsize=(20, 20))
# 第一个子图,我们来画一个基本的散点图
# 散点图是最经典的观察2个变量关系,但数据量非常大就会出数据点堆叠交错,当值我们无法进一步探索
axes[0][0].set_title('散点图') # 设置标题
axes_0 = axes[0][0].plot(Financial_data['材料'], Financial_data['管理'], 'ko') # 画出散点图
# 第二个子图,我们画出六边形蜂巢图
# 当寻找2个数值型变量的关系,数据量很大且不希望数据堆叠在一起,就可以按照蜂巢形状切割数据点,计算每个六边形里的点数来表达密度
num_bins = 50 # 设置六边形包含的距离
axes[0][1].set_title('蜂巢六边形图') # 设置标题
axes_1= axes[0][1].hexbin(Financial_data['材料'], Financial_data['管理'],
gridsize=num_bins, # 设置六边形的大小
cmap="Blues" # 设置颜色组合
)
fig.colorbar(axes_1,ax=axes[0][1]) # 设置颜色显示条
# 第三个子图,我们画出2D直方图。
# 我们您需要分析两个数据量比较大的数值变量关系时,2D直方图非常有用,它可以避免在散点图中出现的的数据密度过大问题
num_bins = 50
axes[1][0].set_title('2D 直方图')
axes_2 = axes[1][0].hist2d(Financial_data['材料'], Financial_data['管理'],
bins=(num_bins,num_bins),
cmap="Blues")
# fig.colorbar(axes_2,ax=axes[1][0])
# 第四个子图,我们画出高斯核密度图
# 考虑到想研究具有很多点的两个数值变量之间的关系。可以考虑绘图区域每个部分上的点数,来计算2D内核密度估计值。
# 就像平滑的直方图,这个方法不会使某个点掉入特定的容器中,而是会增加周围容器的权重,比如颜色会加深。
k = kde.gaussian_kde(Financial_data.loc[:,['材料','管理']].values.T) # 进行核密度计算
xi, yi = np.mgrid[Financial_data['材料'].min():Financial_data['材料'].max():num_bins*1j, Financial_data['管理'].min():Financial_data['管理'].max():num_bins*1j]
zi = k(np.vstack([xi.flatten(), yi.flatten()]))
axes[1][1].set_title('高斯核密度图')
axes_3 = axes[1][1].pcolormesh(xi,
yi,
zi.reshape(xi.shape),
cmap="Blues")
fig.colorbar(axes_3,ax=axes[1][1]) # 设置颜色显示条
# 第五个子图,我们画出带阴影效果的2D密度图
axes[2][0].set_title('带阴影效果的2D密度图')
axes[2][0].pcolormesh(xi,
yi,
zi.reshape(xi.shape),
shading='gouraud',
cmap="Blues")
# 第六个子图,我们画出带轮廓线的密度图
axes[2][1].set_title('带阴影+轮廓线的2D密度图')
axes_5 = axes[2][1].pcolormesh(xi,
yi,
zi.reshape(xi.shape),
shading='gouraud',
cmap="Blues")
fig.colorbar(axes_5,ax=axes[2][1]) # 设置颜色显示条
# 画出轮廓线
axes[2][1].contour(xi,
yi,
zi.reshape(xi.shape))
plt.show()
特别提一下:2D核密度估计图
sns.kdeplot(Financial_data['材料'],Financial_data['管理'])
sns.despine() # 默认无参数状态,就是删除上方和右方的边框,matplotlib貌似做不到
sns.kdeplot(Financial_data['材料'],Financial_data['管理'],
cmap="Reds",
shade=True, # 若为True,则在kde曲线下面的区域中进行阴影处理,color控制曲线及阴影的颜色
shade_lowest=True, # 如果为True,则屏蔽双变量KDE图的最低轮廓。
# bw=.15
)
sns.despine() # 默认无参数状态,就是删除上方和右方的边框,matplotlib貌似做不到
写在最后
之前介绍了散点图、热力图,这次的2D密度图,也是观察数据分布的好图表
它同样符合图表演变原则,符合直方图→1D密度图→2D密度图的变化过程
在解决数据点密度大,造成数据堆叠无法观察的问题上,密度图非常有用。
OK,今天先到这里了,老海日常随笔总结,码字不易,初心不改!
如果觉得喜欢,请动动小手关注和转发,鼓励一下我们。
我是老海,来自数据炼金术师
相关推荐
- 微信AI搜索接入DeepSeek,超级流量入口开始拥抱开源模型
-
第一财经记者获悉,微信已接入DeepSeek-R1模型,部分用户在微信搜索框选择AI搜索,可使用DeepSeek-R1的深度思考功能,该功能还未覆盖所有微信用户。腾讯方面向记者回应称,微信搜一搜在调用...
- 夸克升级“超级搜索框” 推出一站式AI服务
-
7月10日,夸克升级“超级搜索框”,推出以AI搜索为中心的一站式AI服务,为用户提供从检索、创作、总结,到编辑、存储、分享的一体化信息服务价值。“能回答、能创作、能总结的超级搜索框,是夸克对AI搜索的...
- AI与搜索深度融合 夸克推出能回答、能创作、能总结的“超级搜索框”
-
【CNMO科技新闻】互联网时代,搜索已经成为了我们获取信息的主要途径之一。随着大模型时代的到来,搜索也开始发生了新的变化。CNMO注意到,7月10日,夸克迎来了全新版本,将其搜索升级至“超级搜索框”,...
- 字节跳动入局全网搜索:从0到1打造通用搜索引擎
-
8月1日午间消息,字节跳动通过“字节跳动招聘”公众号公开了布局搜索引擎的动作。文章提到,字节跳动已建立搜索部门,搜索团队正在全力打造出一个理想的搜索中台架构。而该搜索引擎是今日头条、抖音、西瓜、火山、...
- 电脑硬盘很卡格式化有用吗?
-
答案是有一定作用,不一定能根本解决问题。硬盘很卡,表明硬盘有坏道,在读写过程中产生较大延时变化,导致操作系统卡顿。简单的高级格式化只能达到初始化硬盘、清除分区中文件的一个操作,仅对硬盘性能保持优化。这...
- 「吐槽」爱国者电源G6 600w翻车 毁硬盘,拯救便宜电源
-
Hi,我是潘多拉1号避难所的服主火线兔这篇文章是2020年11月6日写的吐槽文写这篇文章的目的是近期有朋友反映我的服务器已经成了“土豆服务器”了,劳资要解释一下发生了什么,当然还有一个目的就是电源买了...
- 如何销毁硬盘数据,使用硬盘销毁机方法,硬盘销毁方法,淼一科技
-
三种数据销毁方式的安全性?首先我们先了解一下数据销毁的三种方式是什么?第一、覆盖,用新的数据把旧数据进行覆盖;第二、消磁,把储存介质的磁场消除;第三、破坏(也叫物理破坏)、利用物理的方式把数据进行销毁...
- 电脑常见的硬件故障和解决方法
-
一、常见的故障问题1、CPU问题:是一个精密的配件,但CPU出现问题的几率极小,一般可以排除CPU的问题,它出问题往往是因为CPU风扇出了问题或者安装不到位导致CPU温度过高烧毁,所以温度是CPU常见...
- 西数硬盘分区显示0字节,提示格式化,该怎么办?
-
硬盘容量为0,提示格式化,注意谨慎操作,不要反复尝试,这种情况可能是硬盘有坏道或者磁头性能不良。用户需要及时找专业的数据恢复公司检测。下面给大家带来爱特近期处理的一个相关案例,告诉你遇到这样的硬盘故障...
- 重装系统误分区,物理故障又遇逻辑故障,有种淡淡的忧伤
-
电脑经常出现一些情况,像经常死机、经常蓝频、变卡变慢等等情况,很多用户总会想到通过重装系统来解决,包括一些单位的技术人员也有这样的想法。一般地,重做系统可以解决变卡变慢的问题。但是如果问题本身不在软件...
- 电脑蓝屏不要手忙脚乱瞎判断,蓝屏故障处理流程
-
我们在电脑日常使用过程中,经常会遇到电脑蓝屏的情况发生,而很多用户遇到蓝屏故障时总会手忙脚乱,瞎判断,电脑蓝屏虽然可能性非常多,但总规还是两大类,一类软件原因,一类硬件原因。不管哪种原因,判断问题原则...
- 硬盘常见物理故障之硬盘坏道!硬盘坏道用户注意事项!
-
硬盘坏道是硬盘常见的物理故障之一,什么是硬盘坏道?当扇区内容不能正常读写,此扇区失效,它所在的磁道成为坏道,这就是硬盘坏道。出现硬盘坏道,我们一般不易察觉,坏道不像磁头损坏,磁头损坏一般伴随着异响声,...
- 机械硬盘C5黄牌警告,不要慌,可以先修复试试
-
很多年前,第一次买电脑就被硬盘问题搞得崩溃。当时只要进行磁盘扫描就会死机,重启绝对丢失数据的那种。我找老板换过两块硬盘,再换第三块的时候,我用的是软件检测结果。老板说,软件的结果怎么能算数呢?最后,老...
- MHDD 软件应用六 硬盘的隐藏,切割坏扇区
-
硬盘如果有一部分损坏不能用了,我们可以尝试把坏扇区隐藏,也就是切割成不可见,我们来了解一下具体的方法。1HPA命令。这个命令是更改硬盘的大小。他实际上是通过修改扇区的数量,来改变硬盘的大小。它有什么...
- 移动硬盘频繁使用,小心各种故障找上来
-
你会使用移动硬盘吗?小编相信很多人都对这个提问嗤之以鼻,但真到了移动硬盘出现各种故障,重要数据丢失了的时候,你还能不以为然吗。六安孙先生有一款500G的西数移动硬盘,用来存储一些重要的文档资料。孙先生...
你 发表评论:
欢迎- 一周热门
- 最近发表
- 标签列表
-
- 如何绘制折线图 (52)
- javaabstract (48)
- 新浪微博头像 (53)
- grub4dos (66)
- s扫描器 (51)
- httpfile dll (48)
- ps实例教程 (55)
- taskmgr (51)
- s spline (61)
- vnc远程控制 (47)
- 数据丢失 (47)
- wbem (57)
- flac文件 (72)
- 网页制作基础教程 (53)
- 镜像文件刻录 (61)
- ug5 0软件免费下载 (78)
- debian下载 (53)
- ubuntu10 04 (60)
- web qq登录 (59)
- 笔记本变成无线路由 (52)
- flash player 11 4 (50)
- 右键菜单清理 (78)
- cuteftp 注册码 (57)
- ospf协议 (53)
- ms17 010 下载 (60)