Hiveに保存されているデータに対してPigクエリを実行する

Hiveフォーマットで保存されたPigクエリを実行する方法を知りたいと思います。圧縮データを格納するようにHiveを構成しました（このチュートリアルhttp://wiki.apache.org/hadoop/Hive/CompressedStorageを使用しています）。Hiveに保存されているデータに対してPigクエリを実行する

以前は、Hiveのデリミタ（^ A）で普通のPigロード機能を使用していました。しかし、Hiveはデータを圧縮してシーケンスファイルに保存します。どのロード機能を使用するのですか？

Using Hive with Pigのような密接な統合は必要ありません。ハイブによって生成された圧縮されたシーケンスファイルを読み込むためのロード機能です。

すべての回答ありがとうございます。

出典

2011-04-21 wlk

ここで私が見つけたことは次のとおりです。データをRCFileとして保存すると、HiveColumnarLoaderを使用することは意味があります。あなたは（前の例のように）貯金箱を使用する必要があり、シーケンスファイルからデータをロードするには

register /srv/pigs/piggybank.jar 
register /usr/lib/hive/lib/hive-exec-0.5.0.jar 
register /usr/lib/hive/lib/hive-common-0.5.0.jar 

a = LOAD '/user/hive/warehouse/table' USING org.apache.pig.piggybank.storage.HiveColumnarLoader('ts int, user_id int, url string');

：あなたが最初のいくつかのjarファイルを登録する必要があり、これを使用してテーブルをロードします。貯金箱からSequenceFileローダーは、圧縮されたファイルを処理する必要があります。

register /srv/pigs/piggybank.jar 
DEFINE SequenceFileLoader org.apache.pig.piggybank.storage.SequenceFileLoader(); 
a = LOAD '/user/hive/warehouse/table' USING SequenceFileLoader AS (int, int);

それはBytesWritable種類を読んで、豚の型にキャストすることができないのです、あなたは、この例外を取得するので、これは豚0.7では動作しません：

2011-07-01 10:30:08,589 WARN org.apache.pig.piggybank.storage.SequenceFileLoader: Unable to translate key class org.apache.hadoop.io.BytesWritable to a Pig datatype 
2011-07-01 10:30:08,625 WARN org.apache.hadoop.mapred.Child: Error running child 
org.apache.pig.backend.BackendException: ERROR 0: Unable to translate class org.apache.hadoop.io.BytesWritable to a Pig datatype 
    at org.apache.pig.piggybank.storage.SequenceFileLoader.setKeyType(SequenceFileLoader.java:78) 
    at org.apache.pig.piggybank.storage.SequenceFileLoader.getNext(SequenceFileLoader.java:132) 
    at org.apache.pig.backend.hadoop.executionengine.mapReduceLayer.PigRecordReader.nextKeyValue(PigRecordReader.java:142) 
    at org.apache.hadoop.mapred.MapTask$NewTrackingRecordReader.nextKeyValue(MapTask.java:448) 
    at org.apache.hadoop.mapreduce.MapContext.nextKeyValue(MapContext.java:67) 
    at org.apache.hadoop.mapreduce.Mapper.run(Mapper.java:143) 
    at org.apache.hadoop.mapred.MapTask.runNewMapper(MapTask.java:639) 
    at org.apache.hadoop.mapred.MapTask.run(MapTask.java:315) 
    at org.apache.hadoop.mapred.Child$4.run(Child.java:217) 
    at java.security.AccessController.doPrivileged(Native Method) 
    at javax.security.auth.Subject.doAs(Subject.java:396) 
    at org.apache.hadoop.security.UserGroupInformation.doAs(UserGroupInformation.java:1063) 
    at org.apache.hadoop.mapred.Child.main(Child.java:211)

piggybankをコンパイルする方法については、こちらをご覧ください：Unable to build piggybank -> /home/build/ivy/lib does not exist

出典

2011-07-01 08:45:31 wlk

Hiveに保存されているデータに対してPigクエリを実行する

答えて

関連する問題