2012-03-01 4 views
1

http://wiki.apache.org/nutch/NutchTutorialNutchのパスエラー

私は、コマンドに取るhttp://www.nutchinstall.blogspot.com/

bin/nutch crawl urls -dir crawl -depth 3 -topN 5 

私はNutchの実行に、cygwinの窓を使用して

LinkDb: adding segment: file:/C:/cygwin/home/LeHung/apache-nutch-1.4-bin/runtime/local/crawl/segments/201203
LinkDb: adding segment: file:/C:/cygwin/home/LeHung/apache-nutch-1.4-bin/runtime/local/crawl/segments/201203
Exception in thread "main" org.apache.hadoop.mapred.InvalidInputException: Input path does not exist: file:/C:/cygwin/home/LeHung/apache-nutch-1.4-bin/runtime/local/crawl/segments/20120301221729/parse_data 
Input path does not exist: file:/C:/cygwin/home/LeHung/apache-nutch-1.4-bin/runtime/local/crawl/segments/20120301221754/parse_data 
Input path does not exist: file:/C:/cygwin/home/LeHung/apache-nutch-1.4-bin/runtime/local/crawl/segments/20120301221804/parse_data 
     at org.apache.hadoop.mapred.FileInputFormat.listStatus(FileInputFormat.java:190) 
     at org.apache.hadoop.mapred.SequenceFileInputFormat.listStatus(SequenceFileInputFormat.java:44) 
     at org.apache.hadoop.mapred.FileInputFormat.getSplits(FileInputFormat.java:201) 
     at org.apache.hadoop.mapred.JobClient.writeOldSplits(JobClient.java:810) 
     at org.apache.hadoop.mapred.JobClient.submitJobInternal(JobClient.java:781) 
     at org.apache.hadoop.mapred.JobClient.submitJob(JobClient.java:730) 
     at org.apache.hadoop.mapred.JobClient.runJob(JobClient.java:1249) 
     at org.apache.nutch.crawl.LinkDb.invert(LinkDb.java:175) 
     at org.apache.nutch.crawl.LinkDb.invert(LinkDb.java:149) 
     at org.apache.nutch.crawl.Crawl.run(Crawl.java:143) 
     at org.apache.hadoop.util.ToolRunner.run(ToolRunner.java:65) 
     at org.apache.nutch.crawl.Crawl.main(Crawl.java:55) 

このエラーが発生している

+0

必要なparse_dataサブフォルダのないセグメント内にいくつかのディレクトリがあるように見えます。以前にクロールを実行してから、そこにいくつかのディレクトリを削除しましたか? – javanna

+0

私は同じ問題があります – Aftershock

答えて

0

私にも同様の問題がありました。 dbとディレクトリを削除しました。その後、それはうまくいきました。

+0

それは私のために働くようです。しかし、もし私が数日間クロールしたら、それはあまり良くないでしょう。 – MrROY