- データを取り込む
- data frameに変換する
- desdribe()メソッドで要約統計量を出力
- 各項目について残差分析(ここでは各データが平均値からどの程度離れているか、要するに分散の傾向を把握する、χ2の残差分析ではない)
- 各項目について例外値分析
- カテゴラルデータはグループごとに集計(件数が多い値、少ない値について見てみる)
- 時系列データは時間ごとの変化をプロット
- regression分析
- ヒストグラムやボックスプロットで比較
科学・IT・登山の話題
投稿日:2018年3月22日 更新日:
執筆者:admin
関連記事
Core Concept in Data Analysis – Week 2
1D analysis summary ヒストグラム ヒストグラムのタイプ:gaussian/power law 中心極限定理 確率分布 ブートストラップによる検証 gaussian 測定誤差もしくは …
用語 線形回帰 データから平均二乗誤差を最低にするパラメータΘを求めて、直線で回帰すること $$ y = Θ_0 + Θ_1 \times x $$ コスト関数 損失関数とも呼ばれる。実際のデータと予 …
カーネル密度分布とは カーネル密度分布とは一言でいうと滑らかなヒストグラムであり曲線になっている。標本データから確率密度を計算することにより標本がない部分についても確率密度を計算できる。 例えば犯罪の …
DecitionTreeのパラメータを調整する。 まずはMaxDepthから from sklearn.model_selection import LeaveOneOut from sklearn. …