科学の箱

科学・IT・登山の話題

Python

連続データのビジュアル

投稿日:2018年6月5日 更新日:

Kaggle TitanicのFareを使っていくつかビジュアル

金額別ヒストグラム-1
  • titanic_df['Fare'].plot(kind='hist', figsize=(15,3),bins=100, xlim=(0,50))

xlimが簡単に設定できる

 

金額別ヒストグラム-2
  • sns.distplot(d_train[“Fare”], kde=False, rug=False, bins=100)
 
xlimは軸で設定するのでひと手間かかる
生存別金額-1
  • avgerage_fare = pd.DataFrame([fare_not_survived.mean(), fare_survived.mean()])
  • std_fare = pd.DataFrame([fare_not_survived.std(), fare_survived.std()])
  • avgerage_fare.plot(yerr=std_fare,kind=’bar’,legend=False)

みやすい。

 

生存別金額-2
  • sns.boxplot(x=’Survived’, y=”Fare”, data=d_train, palette=”PRGn”)

外れ値に左右される→外れ値を削除する。

 

生存別金額-3

  • sns.violinplot(x=’Survived’, y=”Fare”, data=d_train)

概要をつかむにはboxplotよりよい。

メタ情報

inarticle



メタ情報

inarticle



-Python
-

執筆者:


comment

メールアドレスが公開されることはありません。 * が付いている欄は必須項目です

関連記事

no image

numpy.random.standard_normal()を使って標準分布の配列を生成する

numpy.random numpyにはいろいろな種類の分布関数から配列をランダムに生成するモジュールが用意されている。このモジュールはnumpy.randomと呼ばれる。 マニュアルはこちら : R …

no image

配列のインデックス

インデックスとは配列に対して[]で要素を抜き出す方法である。 マニュアルは以下になる。 Indexing Indexing Routines インデックスの方法としては以下がある。 整数値を使ったイン …

no image

Heroku + Python Day 1

Pythonでの機械学習の勉強が少し一段落したので、別の側面からPythonをさらに利用してみる。 現在はpythonを利用できるのはローカルの環境だけである。これを将来的にはインターネット上でスケジ …

no image

kaggle Titanic Tutorial – 3

DecitionTreeのパラメータを調整する。 まずはMaxDepthから from sklearn.model_selection import LeaveOneOut from sklearn. …

no image

配列を利用した四則演算とuniversal関数

四則演算 import numpy as np arr = np.arange(1,11) arr arr + arr arr * arr arr – 100 arr – arr [/cde] np. …

2018年6月
« 5月   9月 »
 123
45678910
11121314151617
18192021222324
252627282930  

side bar top



アーカイブ

カテゴリー