科学の箱

科学・IT・登山の話題

機械学習

仕事で始める機械学習 – 1. 機械学習プロジェクトの始め方

投稿日:

機械学習プロジェクトの流れ

  1. 問題の定式化
  2. 機械学習を利用しない方法
  3. システム設計
  4. アルゴリズム選定
  5. 特徴量・教師データ・ログの設計
  6. 前処理
  7. 学習・パラメータチューニング
  8. システム統合

問題の定式化

目的+KPI+解き方

目的 KPI 解き方
ECサイトの売り上げを向上 ユーザー一人当たりの売り上げ ユーザーにお勧め商品の掲示
工場のコスト削減 工場の電力消費量 消費電力予測
ECサイトの売り上げを向上 有料会員数 有料会員への変わる確率予測

機会学習をしなくてもよい方法

機械学習には様々な技術的負債がある

機械学習に向いているシステム

  • 大量データから高速・安定した出力(予測、分類など)
  • 一定数の間違いは許容

MVPによりPOCを進めて、既存オペレーションとの相性を確認する

システム設計

予測結果の配布

  • Web経由
  • データベース
  • API

撤退方針

  • 時間軸に対して予測結果を決めておく。例)2か月で90%の予測

アルゴリズム選定

過去の類似問題の解き方、正解ラベルが利用できるか、問題の種類による絞り込み

EDAによる絞り込み

特徴量・教師データ・ログの設計

特徴量 – 選定したアルゴリズムに対する説明変数

教師データ – 選定したアルゴリズムに対する実際のデータ(目的変数・説明変数)

ログ – 教師データの取得方法

前処理

NAの変換

異常値の処理

テキストデータの変換

数値データのとりあつかい

ダミー変数生成

学習・パラメータチューニング

シンプルなモデル

適切なパラメータ

  • Grid Search

過学習を避ける

  • Cross Validation
  • 正則化
  • Learning Curveの検証

システムへの組み込み

メタ情報

inarticle



メタ情報

inarticle



-機械学習

執筆者:


comment

メールアドレスが公開されることはありません。 * が付いている欄は必須項目です

関連記事

no image

実践ワークショップExcel徹底活用ビジネスデータ分析

メモ 相関係数の行列で傾向が似ている変数を探すことができる。例えば過去データとして商品A,B,C,D,E,Fがあるとする。今商品Xを開発し、マーケティング方法を決めたい。この時A~Fについてはすでに売 …

no image

research pipeline

Related posts:データ分析について評価するExcelによる単回帰分析Core Concept in Data Analysis – Week 2

no image

Mahout in Action/chap2

2.1 レコメンドには2種類ある。 collaborative filtering contents based filtering collaborative filteringではコンテンツの内容 …

no image

独立性の検定 2つ

ニートの年齢別割合が1996年と2012年で関連性があるか独立性の検定をしてみる。 ニートの割合  1996 2012 15~19歳 9 9 20~24歳 12 17 25~29歳 10 18 30~ …

no image

モンベルダウンジャケットについて売れ筋商品を分析してみる。

幾何平均が値付けに利用されているという話を聞いたので実際の商品を例にして分析してみる。 調査の目的 適切なダウンジャケットを選ぶことで冬季にあるいは夏季の3000m級の高山で気持ちよく過ご巣ことができ …

2019年11月
« 10月   12月 »
 123
45678910
11121314151617
18192021222324
252627282930  

side bar top



アーカイブ

カテゴリー