还在抱怨Pandas运行速度慢？这几个方法会颠覆你的看法

发布时间：2018-12-31 22:14:34 所属栏目：教程来源：知乎

导读：副标题#e# 前言当大家谈到数据分析时，提及最多的语言就是Python和SQL。Python之所以适合数据分析，是因为它有很多第三方强大的库来协助，pandas就是其中之一。pandas的文档中是这样描述的：快速，灵活，富有表现力的数据结构，旨在使关系或标记数据的使

对于那些写Pythonic风格的人来说，这个设计看起来很自然。然而，这个循环将会严重影响效率，也是不赞同这么做。原因有几个：

首先，它需要初始化一个将记录输出的列表。
其次，它使用不透明对象范围(0，len(df))循环，然后在应用apply_tariff()之后，它必须将结果附加到用于创建新DataFrame列的列表中。它还使用df.iloc [i] ['date_time']执行所谓的链式索引，这通常会导致意外的结果。
但这种方法的最大问题是计算的时间成本。对于8760行数据，此循环花费了3秒钟。接下来，你将看到一些改进的Pandas结构迭代解决方案。

使用itertuples() 和iterrows() 循环

那么推荐做法是什么样的呢?

实际上可以通过pandas引入itertuples和iterrows方法可以使效率更快。这些都是一次产生一行的生成器方法，类似scrapy中使用的yield用法。

.itertuples为每一行产生一个namedtuple，并且行的索引值作为元组的第一个元素。nametuple是Python的collections模块中的一种数据结构，其行为类似于Python元组，但具有可通过属性查找访问的字段。

.iterrows为DataFrame中的每一行产生(index，series)这样的元组。

（编辑：惠州站长网）

【声明】本站内容均来自网络，其相关言论仅代表作者个人观点，不代表本站立场。若无意侵犯到您的权利，请及时与联系站长删除相关内容!