在线客服
扫描二维码
下载博学谷APP
扫描二维码
关注博学谷微信公众号
意见反馈

原创如何提高Pandas的运行速度？四大性能优化方法

发布时间：2019-12-23 11:00:02 浏览 12732 来源：博学谷作者：照照

Pandas作为数据分析的屠龙宝刀，毫不夸张的说，功能和优势都极其强大。像是支持GB数据处理，多样的数据清洗方法；支持多种开源可视化工具包，更加丰富的数据成果展示等等。因此如果能做好性能优化，就可以极大的提高Pandas的运行速度。本文为大家总结了四大优化Pandas性能的方法，感兴趣的朋友就赶紧看下去吧！

Pandas性能优化方法

1、数据读取的优化

读取数据是进行数据分析前的一个必经环节，pandas中也内置了许多数据读取的函数，最常见的就是用pd.read_csv()函数从csv文件读取数据。pkl格式的数据的读取速度最快，所以对于日常的数据集（大多为csv格式），可以先用pandas读入，然后将数据转存为pkl或者hdf格式，之后每次读取数据时候，便可以节省一些时间。代码如下：

import pandas as pd

#读取csv

df = pd.read_csv('xxx.csv')

#pkl格式

df.to_pickle('xxx.pkl') #格式另存

df = pd.read_pickle('xxx.pkl') #读取

#hdf格式

df.to_hdf('xxx.hdf','df') #格式另存

df = pd.read_hdf('xxx.pkl','df') #读取

2、进行聚合操作时的优化

在使用 agg 和 transform 进行操作时，尽量使用Python的内置函数，能够提高运行效率。（数据用的还是上面的测试用例）

（1）agg+Python内置函数

Pandas性能优化方法

（2）agg+非内置函数

Pandas性能优化方法

可以看到对 agg 方法，使用内置函数时运行效率提升了60%。

（3）transform+Python内置函数

Pandas性能优化方法

（4）transform+非内置函数

Pandas性能优化方法

对 transform 方法而言，使用内置函数时运行效率提升了两倍。

3、对数据进行逐行操作时的优化

假设我们现在有这样一个电力消耗数据集，以及对应时段的电费价格。数据集记录着每小时的电力消耗，如第一行代表2001年1月13日零点消耗了0.586kwh的电。不同使用时段的电费价格不一样，我们现在的目的是求出总的电费，那么就需要将对应时段的单位电费×消耗电量。下面给出了三种写法，我们分别测试这三种处理方式，对比一下这三种写法有什么不同，代码效率上有什么差异。

#编写求得相应结果的函数

def get_cost(kwh, hour):

if 0 <= hour < 7:

rate = 0.6

elif 7 <= hour < 17:

rate = 0.68

elif 17 <= hour < 24:

rate = 0.75

else:

raise ValueError(f'Invalid hour: {hour}')

return rate * kwh

#方法一：简单循环

def loop(df):

cost_list = []

for i in range(len(df)):

energy_used = df.iloc[i]['energy_kwh']

hour = df.iloc[i]['date_time'].hour

energy_cost = get_cost(energy_used, hour)

cost_list.append(energy_cost)

df['cost'] = cost_list

#方法二：apply方法

def apply_method(df):

df['cost'] = df.apply(

lambda row: get_cost(

kwh=row['energy_kwh'],

hour=row['date_time'].hour),

axis=1)

#方法三：采用isin筛选出各时段，分段处理

df.set_index('date_time', inplace=True)

def isin_method(df):

peak_hours = df.index.hour.isin(range(17, 24))

simple_hours = df.index.hour.isin(range(7, 17))

off_peak_hours = df.index.hour.isin(range(0, 7))

df.loc[peak_hours, 'cost'] = df.loc[peak_hours, 'energy_kwh'] * 0.75

df.loc[simple_hours,'cost'] = df.loc[simple_hours, 'energy_kwh'] * 0.68

df.loc[off_peak_hours,'cost'] = df.loc[off_peak_hours, 'energy_kwh'] * 0.6

测试结果：

可以看到，采用 isin() 筛选出对应数据后分开计算的速度是简单循环的近606倍，这并不是说 isin() 有多厉害，方法三速度快是因为它采用了向量化的数据处理方式（这里的isin() 是其中一种方式，还有其他方式，大家可以尝试一下），这才是重点。

4、使用numba进行加速

如果在你的数据处理过程涉及到了大量的数值计算，那么使用numba可以大大加快代码的运行效率，numba使用起来也很简单，下面给大家演示一下。（代码处理不具有实际意义，只是展示一下效果）

首先需要安装numba模块

>>>pip install numba

我们用一个简单的例子测试一下numba的提速效果

import numba

@numba.vectorize

def f_with_numba(x):

return x * 2

def f_without_numba(x):

return x * 2

#方法一：apply逐行操作

df["double_energy"] = df.energy_kwh.apply(f_without_numba)

#方法二：向量化运行

df["double_energy"] = df.energy_kwh*2

#方法三：运用numba加速

#需要以numpy数组的形式传入

#否则会报错

df["double_energy"] = f_with_numba(df.energy_kwh.to_numpy())

从测试结果来看，再次凸显出向量化处理的优势，同时numba对原本速度已经很快的向量化处理也能提高一倍多的效率。更多numba的使用方法请参考numba的使用文档。

以上就是提高Pandas运行速度的优化方法，大家都get到了吗？如果想要学习Pandas的实战教程，可以上博学谷官网在线学习《数据分析进阶必备技能：Pandas》课程，想要了解课程的更多内容，可以点击课程链接https://www.boxuegu.com/promote/detail-1480.html

Python基础 Python开发 Python学习常见问题

— 申请免费试学名额 —

在职想转行提升，担心学不会？根据个人情况规划学习路线，闯关式自适应学习模式保证学习效果
讲师一对一辅导，在线答疑解惑，指导就业！

上一篇：利用Python数据分析可以做什么？下一篇： Python学习笔记之列表的用法总结

相关推荐 更多

自学机器学习应该避免的三大误区与陷阱

作为人工智能的核心，机器学习成为炙手可热的概念。很多朋友都开始进入机器学习的大军之中，不知道大家在学习的过程中是否注意到“自学机器学习应该避免的三大误区与陷阱”呢？下面小编就和大家一起探讨一下。

9440

2019-08-07 18:11:22

Python入门Python学习人工智能
Python工程师常见面试题集锦--网络编程（2）

Python编程语言应用领域极其广泛，目前被广泛应用于人工智能、数据分析、自动化运维、自动化测试、全栈开发领域。对于全栈开发工程师而言，网络编程是非常重要的一个环节。在面试过程中遇到网络编程的问题怎么办？下面小编整理了几个Python网络编程相关的问题与大家分享。

9627

2019-07-03 17:49:56

Python开发网络编程
Python基础语法学习之变量与赋值

近几年Python飞速发展，开始学习Python的人群不在仅仅局限于编程开发者，许多其他行业的从业者也开始将Python作为自己的职业技能。本文仍然是针对零基础的初学者，继续学习Python的基础语法——变量与赋值。主要内容包括变量和赋值的概念、代码演示、变量的特点和命名规范以及=符号。

6854

2020-04-16 10:53:42

Python基础Python入门Python学习
适合多数人的Python学习路线

适合多数人的Python学习路线,Python已经成为了一门常用的编程语言，许多人想要自学Python，但是不知道如何开始。其实，对于过了很长时间都不知道从何下手的初学者，建议还是报个班，简单快捷。如果你觉得自己自控力比较强，也有兴趣和毅力，那么下面这个Python学习路线应该能给你一些帮助。

5551

2020-06-02 10:22:23

Python学习学习路线
Python应用方向有哪些？

Python应用方向：Python支持函数式编程和 OOP的面向对象编程，开放源码云计算，以海量数据为基础，结合科学计算、机器学习等技术，对数据进行清洗、去重、规范化和有针对性的分析，人工智能领域Python是机器学习、神经网络、深度学习。

6832

2020-07-02 14:59:58

Python学习应用场景