免费在线看一级黄色网站,亚洲欧美网址你懂的 ,2022最新韩国理伦片在线观看

主頁 > 知識庫 > python數(shù)據(jù)分析之DataFrame內(nèi)存優(yōu)化

python數(shù)據(jù)分析之DataFrame內(nèi)存優(yōu)化

1. pandas查看數(shù)據(jù)占用大小

給大家看一下這么查看自己的內(nèi)存大?。?mark>user_log是dataframe的名字）

#方法1 就是使用查看dataframe信息的命令
user_log.info()
#方法2 使用memory_usage()或者getsizeof(user_log)
import time
import sys
print('all_data占據(jù)內(nèi)存約: {:.2f} GB'.format(user_log.memory_usage().sum()/ (1024**3)))
print('all_data占據(jù)內(nèi)存約: {:.2f} GB'.format(sys.getsizeof(user_log)/(1024**3)))

我這里有個dataframe文件叫做user_log，原始大小為1.91G，然后pandas讀取出來，內(nèi)存使用了2.9G。

看一下原始數(shù)據(jù)大?。?.91G

pandas讀取后的內(nèi)存消耗：2.9G

2. 對數(shù)據(jù)進行壓縮

數(shù)值類型的列進行降級處理（‘int16', ‘int32', ‘int64', ‘float16', ‘float32', ‘float64'）
字符串類型的列轉(zhuǎn)化為類別類型（category）
字符串類型的列的類別數(shù)超過總行數(shù)的一半時，建議使用object類型

我們這里主要采用對數(shù)值型類型的數(shù)據(jù)進行降級，說一下降級是什么意思意思呢，可以比喻為一個一個抽屜，你有一個大抽屜，但是你只裝了鑰匙，這就會有很多空間浪費掉，如果我們將鑰匙放到一個小抽屜里，就可以節(jié)省很多空間，就像字符的類型int32 比int8占用空間大很多，但是我們的數(shù)據(jù)使用int8類型就夠了，這就導致數(shù)據(jù)占用了很多空間，我們要做的就是進行數(shù)據(jù)類型轉(zhuǎn)換，節(jié)省內(nèi)存空間。

壓縮數(shù)值的這段代碼是從天池大賽的某個項目中看見的，查閱資料后發(fā)現(xiàn)，大家壓縮內(nèi)存都是基本固定的函數(shù)形式

def reduce_mem_usage(df):
    starttime = time.time()
    numerics = ['int16', 'int32', 'int64', 'float16', 'float32', 'float64']
    start_mem = df.memory_usage().sum() / 1024**2
    for col in df.columns:
        col_type = df[col].dtypes
        if col_type in numerics:
            c_min = df[col].min()
            c_max = df[col].max()
            if pd.isnull(c_min) or pd.isnull(c_max):
                continue
            if str(col_type)[:3] == 'int':
                if c_min > np.iinfo(np.int8).min and c_max  np.iinfo(np.int8).max:
                    df[col] = df[col].astype(np.int8)
                elif c_min > np.iinfo(np.int16).min and c_max  np.iinfo(np.int16).max:
                    df[col] = df[col].astype(np.int16)
                elif c_min > np.iinfo(np.int32).min and c_max  np.iinfo(np.int32).max:
                    df[col] = df[col].astype(np.int32)
                elif c_min > np.iinfo(np.int64).min and c_max  np.iinfo(np.int64).max:
                    df[col] = df[col].astype(np.int64)
            else:
                if c_min > np.finfo(np.float16).min and c_max  np.finfo(np.float16).max:
                    df[col] = df[col].astype(np.float16)
                elif c_min > np.finfo(np.float32).min and c_max  np.finfo(np.float32).max:
                    df[col] = df[col].astype(np.float32)
                else:
                    df[col] = df[col].astype(np.float64)
    end_mem = df.memory_usage().sum() / 1024**2
    print('-- Mem. usage decreased to {:5.2f} Mb ({:.1f}% reduction),time spend:{:2.2f} min'.format(end_mem,
                                                                                                           100*(start_mem-end_mem)/start_mem,
                                                                                                           (time.time()-starttime)/60))
    return df

用壓縮的方式將數(shù)據(jù)導入user_log2中

#首先讀取到csv中如何傳入函數(shù)生稱新的csv
user_log2=reduce_mem_usage(pd.read_csv(r'/Users/liucong/MainFiles/ML/tianchi/tianmiao/user_log_format1.csv'))

讀取成功：內(nèi)訓大小為890.48m 減少了69.6%，效果顯著

查看壓縮后的數(shù)據(jù)集信息：類型發(fā)生了變化，數(shù)量變小了

3. 參考資料

《天池大賽》
《kaggle大賽》
鏈接: pandas處理datafarme節(jié)約內(nèi)存.

到此這篇關(guān)于python數(shù)據(jù)分析之DataFrame內(nèi)存優(yōu)化的文章就介紹到這了,更多相關(guān)python DataFrame內(nèi)存優(yōu)化內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家！

您可能感興趣的文章:

python切片中內(nèi)存的注意事項總結(jié)
用python監(jiān)控服務器的cpu,磁盤空間,內(nèi)存,超過郵件報警
總結(jié)python 三種常見的內(nèi)存泄漏場景
Python numpy大矩陣運算內(nèi)存不足如何解決
Python內(nèi)存泄漏和內(nèi)存溢出的解決方案
Python中的內(nèi)存管理之python list內(nèi)存使用詳解

標簽：西寧宜昌潮州上饒佳木斯珠海盤錦湖北

巨人網(wǎng)絡通訊聲明：本文標題《python數(shù)據(jù)分析之DataFrame內(nèi)存優(yōu)化》，本文關(guān)鍵詞 python,數(shù)據(jù)分析,之,DataFrame,；如發(fā)現(xiàn)本文內(nèi)容存在版權(quán)問題，煩請?zhí)峁┫嚓P(guān)信息告之我們，我們將及時溝通與處理。本站內(nèi)容系統(tǒng)采集于網(wǎng)絡，涉及言論、版權(quán)與本站無關(guān)。

python數(shù)據(jù)分析之DataFrame內(nèi)存優(yōu)化

目錄

1. pandas查看數(shù)據(jù)占用大小

2. 對數(shù)據(jù)進行壓縮

3. 參考資料

四合一精品企业网站建设

¥888元限时抢购

立即咨询快速购买

企业400电话

合计11份范本：公司章程+合伙协议+出资协议+合作协议+股权转让协议+增资扩股协议+股权激励+股东会决议+董事会决议