2015-12-29 5 views
5

私はrvestを使用しています。そして私は、データフレームに結果を変換したい:xml_nodesetをdata.frameに変換してください。

> links <- pgsession %>% jump_to(urls[2]) %>% read_html() %>% html_nodes("a")  
> links 
{xml_nodeset (114)} 
[1] <a href="/Mitglieder/Detail/1213412">Date</a> 
[2] <a href="/Account/ChangePassword">Kennwort ändern</a> 
[3] <a href="/Account/BenutzernamenAendern/124312234">Benutzernamen ändern</a> 
[4] <a href="/Account/LogOff">Abmelden</a> 
...  

私は次のメソッドを使用:しかし、私はエラーを取得する

library(plyr) 
ldply(xmlToList(links), data.frame) 
Error in UseMethod("xmlSApply") : 
    no applicable method for 'xmlSApply' applied to an object of class "xml_nodeset" 
df1 <- data.frame(character(13000)) 
df1 <- rbind(df1, data.frame(links))# append to data.frame 

を:

Error in UseMethod("xmlSApply") : 
    no applicable method for 'xmlSApply' applied to an object of class "xml_nodeset" 

何任意の提案を私は間違っている?

返信いただきありがとうございます。

+2

'data.frame(hrefs = as(リンク、"文字 "))'はどうでしょうか? – lukeA

答えて

9

これにより、リンクのすべての属性がtbl_dfになります。 bind_rowsは、あなたが自由のために、「塗りつぶし」を取得:

library(rvest) 
library(dplyr) 

pg <- read_html("https://en.wikipedia.org/wiki/Main_Page") 
links <- html_nodes(pg, "a") 
bind_rows(lapply(xml_attrs(links), function(x) data.frame(as.list(x), stringsAsFactors=FALSE))) 

## Source: local data frame [310 x 10] 
## 
##  id       href     title class dir accesskey rel lang hreflang style 
## (chr)      (chr)     (chr) (chr) (chr)  (chr) (chr) (chr) (chr) (chr) 
## 1 top       NA      NA NA NA  NA NA NA  NA NA 
## 2  NA      #mw-head      NA NA NA  NA NA NA  NA NA 
## 3  NA     #p-search      NA NA NA  NA NA NA  NA NA 
## 4  NA    /wiki/Wikipedia    Wikipedia NA NA  NA NA NA  NA NA 
## 5  NA   /wiki/Free_content   Free content NA NA  NA NA NA  NA NA 
## 6  NA   /wiki/Encyclopedia   Encyclopedia NA NA  NA NA NA  NA NA 
## 7  NA /wiki/Wikipedia:Introduction Wikipedia:Introduction NA NA  NA NA NA  NA NA 
## 8  NA  /wiki/Special:Statistics  Special:Statistics NA NA  NA NA NA  NA NA 
## 9  NA  /wiki/English_language  English language NA NA  NA NA NA  NA NA 
## 10 NA   /wiki/Portal:Arts   Portal:Arts NA NA  NA NA NA  NA NA 
## .. ...       ...     ... ... ...  ... ... ...  ... ... 

代わりに、あなたはpurrrを使用することができます。私は、より機能的に慣用的かつ総合的なクリーナーアプローチだと思う

library(rvest) 
library(purrr) 

pg <- read_html("https://en.wikipedia.org/wiki/Main_Page") 
html_nodes(pg, "a") %>% 
    map(xml_attrs) %>% 
    map_df(~as.list(.)) 

## # A tibble: 342 × 10 
##  id       href     title class dir accesskey rel hreflang lang style 
## <chr>      <chr>     <chr> <chr> <chr>  <chr> <chr> <chr> <chr> <chr> 
## 1 top       <NA>     <NA> <NA> <NA>  <NA> <NA>  <NA> <NA> <NA> 
## 2 <NA>      #mw-head     <NA> <NA> <NA>  <NA> <NA>  <NA> <NA> <NA> 
## 3 <NA>     #p-search     <NA> <NA> <NA>  <NA> <NA>  <NA> <NA> <NA> 
## 4 <NA>    /wiki/Wikipedia    Wikipedia <NA> <NA>  <NA> <NA>  <NA> <NA> <NA> 
## 5 <NA>   /wiki/Free_content   Free content <NA> <NA>  <NA> <NA>  <NA> <NA> <NA> 
## 6 <NA>   /wiki/Encyclopedia   Encyclopedia <NA> <NA>  <NA> <NA>  <NA> <NA> <NA> 
## 7 <NA> /wiki/Wikipedia:Introduction Wikipedia:Introduction <NA> <NA>  <NA> <NA>  <NA> <NA> <NA> 
## 8 <NA>  /wiki/Special:Statistics  Special:Statistics <NA> <NA>  <NA> <NA>  <NA> <NA> <NA> 
## 9 <NA>  /wiki/English_language  English language <NA> <NA>  <NA> <NA>  <NA> <NA> <NA> 
## 10 <NA>   /wiki/Portal:Arts   Portal:Arts <NA> <NA>  <NA> <NA>  <NA> <NA> <NA> 
## # ... with 332 more rows 

+0

私は、同じ結果を持つページがあり、それをデータフレームに追加したいと考えています。同様に 'bind_rows'をどうすれば使えますか? – mrquad

+0

'bind_rows'もそれらを「満たす」でしょう。 – hrbrmstr

関連する問題