zoukankan      html  css  js  c++  java
  • hadoop小知识札记

    hadoop实现全局变量: 只读的可以,可修改的不行,只读的可以通过configuration 或者分布式缓存实现。
     

    hadoop做图像处理时,每个map读入一个图片,每个map读入一张图片,然后所有的map还要读取一张全局图片再两张图片一起处理
    每个map读取一个,会产生太多的map,可以一个map读取多个。
    但最好,把文件放到HBase中,用MR处理。因为hdfs存大量小文件 效率很低
     
    hadoop一般处理十亿数据,要达到秒级,需要5-7个节点,节点用是16C 24G的服务器
     
    Paritioner接口设计与实现
    TotalOrderPartitioner就是一个partitioner,使用这个parittioner就能完成整体排序。多reduce
     
     
    HashPartitions
    简单join关联,等值join可以有多个reduce,不等值,不行,只能有一个
     
     
     
  • 相关阅读:
    nproc 查看系统可用处理单元数
    c++内存泄露的坑
    内存泄露脚本
    c++内存问题(转)
    tmp
    kprobe
    内存对齐算法
    正则
    P3261 [JLOI2015]城池攻占有趣的做法
    CF1620C BAString题解
  • 原文地址:https://www.cnblogs.com/cl1024cl/p/6205552.html
Copyright © 2011-2022 走看看