科学の箱

科学・IT・登山の話題

R

rvestで読み込むcssを調べる方法

投稿日:2018年3月25日 更新日:

rvestで対象とするhtmlのブロックは下記のように取得できる。

http://blog.rstudio.com/2014/11/24/rvest-easy-web-scraping-with-r/


<span class="hljs-keyword">library</span>(rvest)

lego_movie <- html(<span class="hljs-string">"http://www.imdb.com/title/tt1490017/"</span>)

lego_movie %>% html_node(<span class="hljs-string">"strong span"</span>) %>% html_text()

この時に問題になるのがどうやってnode “strong span”を見つけるかである。

見つける方法としては2つある。一つ目はgoogle developer toolsを利用する。

  1. 開いたページで目的とする個所を選ぶ→ここで右クリック→inspectを選ぶ。
  2. これで該当箇所のhtmlスクリプトが開く。
  3. 次に対象項目を囲んでいるタグを2つ取得。
  4. html_node()を実行してみる。もし予想した値が返っていない場合にはタグが2つでは絞り込みができていない。その場合にはタグを順番に増やしてあげる。

 

 

 

 

2つ目の方法としてはSelectorGadgetを利用する。これは項目のすぐ上の階層についてはcssセレクタが取得できる。selectorGadgetについては下記で詳細に説明している。

http://selectorgadget.com/

またセレクタはタグ、class、idにより表記方法が変わる

  • class : .クラス名
  • id : #ID名
  • タグ : タグ名

表記方法についてはこちらから参照できる。

Webscraping with rvest: So Easy Even An MBA Can Do It!

メタ情報

inarticle



メタ情報

inarticle



-R
-

執筆者:


comment

メールアドレスが公開されることはありません。 * が付いている欄は必須項目です

関連記事

no image

Rで%>%を利用する。

rvestでスクレイピングをしようとしたら、%>%という記述が大量頻出。これ何かということで調べてみた。 https://stackoverflow.com/questions/24536154 …

no image

Rでのランダムデータ作成 – 上級編 (改)

Rでのランダムデータ作成 – 上級編にコメントをいただいたので調べてみた。結果を対比するためにプロットも入れた。 まずデータフレームを使う方法が以下である。 lm1 <- lm(galton$c …

no image

サンプルサイズによる有意の違い

こちらでサンプル数について指摘をいただいたのでサンプル数によりp値がどのように変わるかをみてみる。  1996 2012 15~19歳 9 9 20~24歳 12 17 25~29歳 10 18 30 …

no image

データフレームで層別に操作をする

Rでデータベースに似たデータを取り扱う際には、データフレームを使うことがおおい。JavaはPHPなどのプログラミング言語では、層別に集計作業をする際にはデータベース上のSQLか、データを読み込んでから …

no image

Rでのランダムデータ作成 – 上級編

平均が異なるランダムデータを作成する > x <- rnorm(12, mean=rep(1:3,each=4), sd=0.2) > y <- rnorm(12, mean= …

2018年3月
« 2月   4月 »
 1234
567891011
12131415161718
19202122232425
262728293031  

side bar top



アーカイブ

カテゴリー