zoukankan      html  css  js  c++  java
  • MapReudce源码分析之Mapper

     Mapper是MapReduce编程模型中一个将输入的key/value对映射成一组中间key/value对的组件。Map是将输入记录转换成中间记录的单个任务。被转换的中间记录不需要与输入记录一样的类型。一个给定的输入对可能被映射成0个货多个输出对。Hadoop的MapReduce框架为作业中输入格式InputFormat产生的每个输入分片InputSplit产生一个Map任务。通过JobContext的getConfiguration()方法,Mapper的实现者可以获得任务的配置信息。MapReduce框架中Map部分首先会调用setup()方法,然后接着为输入分片的每个KeyValue对调用map()方法进行处理,最见后再调用cleanup()方法。所有给定输出key相关的中间值随后会被框架进行分组,继而被传递给Reducer以确定最终的输出。通过指定两个关键的RawComparator类,用户可以控制排序和分组。Mapper输出被每个Reducer分区。通过实现一个定值分区器Partitioner,用户可以控制哪些key和相关记录进入哪个Reducer。

            Mapper的执行主流程在其run()方法内,代码如下:

    [java] view plain copy
     
     在CODE上查看代码片派生到我的代码片
    1.  /** 
    2.   * Expert users can override this method for more complete control over the 
    3.   * execution of the Mapper. 
    4.   * 熟练或者老练的用户可以覆写该方法,以便更完整的控制Mapper的运行 
    5.   * @param context 
    6.   * @throws IOException 
    7.   */  
    8.  public void run(Context context) throws IOException, InterruptedException {  
    9.      
    10. // task开始运行时调用setup()方法进行初始化    
    11. setup(context);  
    12.    try {  
    13.       
    14.      // 当context中仍有KeyValye对的话,一直循环  
    15.      while (context.nextKeyValue()) {  
    16.         
    17.     // 取出context中当前key、valye,连同context本身,调用map()方法处理  
    18.        map(context.getCurrentKey(), context.getCurrentValue(), context);  
    19.      }  
    20.    } finally {  
    21.      // task结束运行时调用cleanup()方法进行清理    
    22.      cleanup(context);  
    23.    }  
    24.  }  

            run()方法执行的流程很简单,大体如下:

            1、task开始运行时setup()初始化方法;

            2、在try模块中,当context中仍有KeyValye对的话,一直循环:

                  取出context中当前key、valye,连同context本身,调用map()方法处理;

            3、在finally模块中,task结束运行时调用cleanup()方法进行清理 。

            是不是很简单,就像一个模板一样,按照setup()--map()--map()--......--map()--cleanup()的执行主线运行。而且,熟练或者老练的用户可以覆写该方法,以便更完整的控制Mapper的运行。

            我们接下来再看下进行初始化的setup()方法和进行清理的cleanup()方法,代码如下:

    [java] view plain copy
     
     在CODE上查看代码片派生到我的代码片
    1. /** 
    2.  * Called once at the beginning of the task. 
    3.  * task开始运行时调用一次,做初始化工作 
    4.  */  
    5. protected void setup(Context context  
    6.                      ) throws IOException, InterruptedException {  
    7.   // NOTHING  
    8. }  
    [java] view plain copy
     
     在CODE上查看代码片派生到我的代码片
    1. /** 
    2.  * Called once at the end of the task. 
    3.  * task结束运行时调用一次,做清理工作 
    4.  */  
    5. protected void cleanup(Context context  
    6.                        ) throws IOException, InterruptedException {  
    7.   // NOTHING  
    8. }  

            这两个函数分别在task开始运行或结束运行时调用一次,一遍完成初始化或清理工作,用户可覆写这两个方法,以便实现自己的初始化或清理逻辑,或者,干脆不用管,那么这两个方法是空方法,什么都不会做。

            再来看下实现KeyValue对转换的核心功能map()方法,代码如下:

    [java] view plain copy
     
     在CODE上查看代码片派生到我的代码片
    1. /** 
    2.  * Called once for each key/value pair in the input split. Most applications 
    3.  * should override this, but the default is the identity function. 
    4.  * 针对输入分片split的每个key/value对都会调用一次。大多数应用程序应该覆写该方法,而默认实现是一个类似恒等式的功能,原样输出key、value 
    5.  */  
    6. @SuppressWarnings("unchecked")  
    7. protected void map(KEYIN key, VALUEIN value,   
    8.                    Context context) throws IOException, InterruptedException {  
    9.   context.write((KEYOUT) key, (VALUEOUT) value);  
    10. }  

            map()方法针对输入分片split的每个key/value对都会调用一次。大多数应用程序应该覆写该方法,而默认实现是一个类似恒等式的功能,原样输出key、value。

            另外,Mapper中还有一个抽象内部类Context,它实现了MapContext接口,代表了Map任务运行时的上下文信息,我们后续再讲。

  • 相关阅读:
    js 自定义方法 实现停留几秒 sleep
    java 通过sftp服务器上传下载删除文件
    iOS开发系列--音频播放、录音、视频播放、拍照、视频录制
    iOS JavaScriptCore使用
    UIWebView和WKWebView的使用及js交互
    WKWebView的新特性与使用
    OC与JS的交互详解
    iOS开发支付集成之微信支付
    iOS开发之支付宝集成
    React-Native学习指南
  • 原文地址:https://www.cnblogs.com/jirimutu01/p/5556333.html
Copyright © 2011-2022 走看看