科学の箱

科学・IT・登山の話題

R

rvestで読み込むcssを調べる方法

投稿日:2018年3月25日 更新日:

rvestで対象とするhtmlのブロックは下記のように取得できる。

http://blog.rstudio.com/2014/11/24/rvest-easy-web-scraping-with-r/


<span class="hljs-keyword">library</span>(rvest)

lego_movie <- html(<span class="hljs-string">"http://www.imdb.com/title/tt1490017/"</span>)

lego_movie %>% html_node(<span class="hljs-string">"strong span"</span>) %>% html_text()

この時に問題になるのがどうやってnode “strong span”を見つけるかである。

見つける方法としては2つある。一つ目はgoogle developer toolsを利用する。

  1. 開いたページで目的とする個所を選ぶ→ここで右クリック→inspectを選ぶ。
  2. これで該当箇所のhtmlスクリプトが開く。
  3. 次に対象項目を囲んでいるタグを2つ取得。
  4. html_node()を実行してみる。もし予想した値が返っていない場合にはタグが2つでは絞り込みができていない。その場合にはタグを順番に増やしてあげる。

 

 

 

 

2つ目の方法としてはSelectorGadgetを利用する。これは項目のすぐ上の階層についてはcssセレクタが取得できる。selectorGadgetについては下記で詳細に説明している。

http://selectorgadget.com/

またセレクタはタグ、class、idにより表記方法が変わる

  • class : .クラス名
  • id : #ID名
  • タグ : タグ名

表記方法についてはこちらから参照できる。

Webscraping with rvest: So Easy Even An MBA Can Do It!

メタ情報

inarticle



メタ情報

inarticle



-R
-

執筆者:


comment

メールアドレスが公開されることはありません。 * が付いている欄は必須項目です

関連記事

no image

Rで日付データをhistgramで表示するときのポイント

Rでヒストグラムはhist()関数を使って描画する。この時与えるデータによりブレーク引数が異なることがわかった。 まず下記がデフォルトのhist()関数のヘルプである。 hist(x, breaks …

no image

tracertの分析

tracertを繰り返し実行した結果を分析し、経路上のホストについてどの程度時間がかかっているかを分析してみる。 tracertの結果は以下のように取得される。 $ tracert www.googl …

no image

splineを利用する

データが連続していない時には、となりあうデータを使ってその間の値を予測できる。簡単な例では1と2という値があり、この間を一つの値で補完すると1.5となる。補間する値を増やしていけば滑らかな曲線になる。 …

no image

Rによるやさしい統計学/5-統計的検定-1

5章で学ぶこと 5章では検定方法について紹介している。以下の方法について検定対象と検定する条件を理解する。 Z検定 t検定 無相関検定 独立性の検定 また検定の手順についてもまとめている。 検定方法 …

no image

ジニ係数

計量経済学の本を読んでいたら、ジニ係数の利用について記述されていたのでRで実データを使って計算してみる。 経済学の勉強でジニ係数というのは知っていたが、その利用方法としては所得の分配がどの程度平等であ …

2018年3月
« 2月   4月 »
 1234
567891011
12131415161718
19202122232425
262728293031  

side bar top



アーカイブ

カテゴリー