科学の箱

科学・IT・登山の話題

機械学習

dataanalysis-002-week1

投稿日:2013年12月9日 更新日:

Rstudioを開発に使う

  • 開発が用意
  • Forumがある
  • 標準
  • フリー

Help

  • R Mailling list
  • Stackoverflow
  • CrossValidated

R-Help

  • ?rnorm
  • args(rnorm)
  • rnorm

Rで的確なサポートを受けるために

  • 回答がほしい質問は何か
  • どんなツールを使っているか
  • 予期していたのは何か
  • 何が得られたか
  • 他にworkaroundは

Dataとはなにか

  • 集合に含まれる変数の値、定量もしくは定性。

値の表現方法

  • H1, W1
  • X11, X12
  • Y

ランダム値

  • 正規分布から取得された値
  • 正規分布のパラメータは平均と分散
  • 正規分布における大事な値 期待値、分散、標準偏差
  • 条件付け x | μ   Xは条件μにおけるランダム値

分布の種類

  • 二項分布
  • 正規分布
  • 一様分布

DataAnalysisで解決する問題

  • Descriptive
  • Exploratory
    • 変数間に関係があることがわかればよい、主なツールはチャート
  • Infer
  • Predictive
    • Exploratoryで明らかになった関連がある変数について回帰分析を行う
  • Causal
  • Machine

Vector, List, matrices, data frameの違い

  • vector: 同じクラスの複数の値
  • list: 異なるクラスの複数の値
  • matrices: 同じクラスで多次元
  • data frmae: 異なるクラスで同じ長さ

メタ情報

inarticle



メタ情報

inarticle



-機械学習
-,

執筆者:


comment

メールアドレスが公開されることはありません。 * が付いている欄は必須項目です

関連記事

no image

売り上げデータの分析

利益 = 売り上げ – コスト 売り上げ = 客数 x 客単価 コスト ≒ 人件費 + 廃棄コスト 客数 客単価 = Σ 品物i x 購入数 客数を増やす方法 来てもらう方法 安売りキャン …

no image

線形解析の基本手順

線形解析の基本手順 データの読み込み データフォーマット確認 EDA データクレンジング トレーニングデータ構築 モデル構築 モデル評価 予想 メトリック Related posts:データ分析の基本 …

no image

DictVectorizerを使ってカテゴリデータについて特徴抽出をする

都市における温度データを考える。 measure = [ {‘city’: ‘Dubai’, ‘temperature’: 33.}, {‘city’: ‘London’, ‘temperature’ …

no image

Pythonではじめる機械学習 – KDE

カーネル密度分布とは カーネル密度分布とは一言でいうと滑らかなヒストグラムであり曲線になっている。標本データから確率密度を計算することにより標本がない部分についても確率密度を計算できる。 例えば犯罪の …

no image

手書き数字のデータセットについてイメージを確認

sklearnには手書き数字のデータが用意されている。このデータはイメージの分類モデルを学ぶためによいスタートである。今回はこのバイナリデータを読み込み、イメージとして確認する。 内容 load_di …

2013年12月
« 11月   1月 »
 1
2345678
9101112131415
16171819202122
23242526272829
3031  

side bar top



アーカイブ

カテゴリー