Hadoop & Hadoop Streaming 自定义输出格式

时间:2021-06-08 20:57:41

    在用Hadoop处理大量的日志文件的时候,有时候会将错误的或者不符合要求的日志输出到另外一个目录,以备后来进行查验,这里给出个简单的例子,并简单说明下如何在Hadoop Streaming中使用这种方法将错误格式的日志输出到自定义的路径。

    例子中类MultiFilesOutput继承自MultipleTextOutputFormat<Text, Text>,可以自己定义不同的keyType,然后输出到不同的目录下。


 在Hadoop Streaming,使用扩展的jar文件格式如下:

其中CustomOutputFormats.jar 为生成的jar文件名称,MultiFormats.MultiFilesOutput对应于package name和类名。