這篇文章主要講解了“python怎么進行數據加載”,文中的講解內容簡單清晰,易于學習與理解,下面請大家跟著小編的思路慢慢深入,一起來研究和學習“python怎么進行數據加載”吧!
首先,你要先學會安裝軟件,anaconda軟件,安裝成功后,你點擊jupyter notebook打開代碼框。
現在可以開始嘗試做數據分析了。
數據集下載 https://www.kaggle.com/c/titanic/overview
導入numpy和pandas
import pandas as pd import numpy as np
如果出錯了,需要注意大小寫、有沒有單詞寫錯了
(1) 使用相對路徑載入數據
(2) 使用絕對路徑載入數據
df = pd.read_csv('train.csv') df.head(3)
df = pd.read_csv('/Users/Documents/train.csv') df.head(3)
注意絕對路徑的 “ / ” 方向不要錯。
每1000行為一個數據模塊,逐塊讀取
chunker = pd.read_csv('train.csv', chunksize=1000)
對著整個表修改列名:將表頭改成中文,索引改為乘客ID ,要注意的是,要記得把名字跟列一一對上,數量對上、順序對上
PassengerId => 乘客ID
Survived => 是否幸存
Pclass => 乘客等級(1/2/3等艙位)
Name => 乘客姓名
Sex => 性別
Age => 年齡
SibSp => 堂兄弟/妹個數
Parch => 父母與小孩個數
Ticket => 船票信息
Fare => 票價
Cabin => 客艙
Embarked => 登船港口
df = pd.read_csv('train.csv', names=['乘客ID','是否幸存','倉位等級','姓名','性別','年齡','兄弟姐妹個數','父母子女個數','船票信息','票價','客艙','登船港口'],index_col='乘客ID',header=0) df.head()
導入數據后,我們可以對數據的整體結構和樣例進行概覽,比如說,數據大小、有多少列,各列都是什么格式的,是否包含null等。info 后面加()跟不加()會 有不同的內容。
print(df.info())
如想在python的查看數據,可以用head
df.head(10) df.tail(15)
判斷數據是否為空,為空的地方返回True,其余地方返回False
df.isnull().head()
在工作目錄下保存為一個新文件train_chinese.csv,如不希望表格自帶index,可以加入index=false
df.to_csv('train_chinese.csv',index=flase)
感謝各位的閱讀,以上就是“python怎么進行數據加載”的內容了,經過本文的學習后,相信大家對python怎么進行數據加載這一問題有了更深刻的體會,具體使用情況還需要大家實踐驗證。這里是億速云,小編將為大家推送更多相關知識點的文章,歡迎關注!
免責聲明:本站發布的內容(圖片、視頻和文字)以原創、轉載和分享為主,文章觀點不代表本網站立場,如果涉及侵權請聯系站長郵箱:is@yisu.com進行舉報,并提供相關證據,一經查實,將立刻刪除涉嫌侵權內容。