zoukankan      html  css  js  c++  java
  • hive严格模式

    说真的,这个模式在我做sql开发的岁月里,从未用到过。用的都是动态分区非严格模式。

    我的好友东岳同学在车上问我。确实问到了我 。体现出了我基本功不扎实的情况。

    1.what is Hive严格模式

    Hive提供了一个严格模式,可以防止用户执行那些可能产生意向不到的不好的效果的查询。说通俗一点就是这种模式可以阻止某些查询的执行。通过如下语句设置严格模式:

    hive> set hive.mapred.mode=strict;

    2.why and how

    设置为严格模式后,可以禁止3种类型的查询:

    (1):带有分区的表的查询

    如果在一个分区表执行hive,除非where语句中包含分区字段过滤条件来显示数据范围,否则不允许执行。换句话说就是在严格模式下不允许用户扫描所有的分区。

    进行这个限制的原因是,通常分区表都拥有非常大的数据集,而且数据增加迅速。如果不进行分区限制的查询会消耗巨大的资源来处理,如下不带分区的查询语句:

    hive> SELECT DISTINCT(planner_id) FROM fracture_ins WHERE planner_id=5;

    执行后会出现如下错误:

    FAILED: Error in semantic analysis: No Partition Predicate Found for Alias "fracture_ins" Table "fracture_ins

    解决方案是在where中增加分区条件:

    hive> SELECT DISTINCT(planner_id) FROM fracture_ins
           > WHERE planner_id=5 AND hit_date=20120101;

    (2)带有orderby的查询 
    对于使用了orderby的查询,要求必须有limit语句。因为orderby为了执行排序过程会讲所有的结果分发到同一个reducer中 
    进行处理,强烈要求用户增加这个limit语句可以防止reducer额外执行很长一段时间:

    hive> SELECT * FROM fracture_ins WHERE hit_date>2012 ORDER BY planner_id;

    出现如下错误:

    FAILED: Error in semantic analysis: line 1:56 In strict mode,limit must be specified if ORDER BY is present planner_id

    解决方案就是增加一个limit关键字:

    hive> SELECT * FROM fracture_ins WHERE hit_date>2012 ORDER BY planner_id LIMIT 100000;

    (3):限制笛卡尔积的查询

    对关系型数据库非常了解的用户可能期望在执行join查询的时候不适用on语句而是使用where语句,这样关系型数据库的执行优化器就可以高效的将where语句转换成那个on语句了。不幸的是,Hive并不支持这样的优化,因为如果表非常大的话,就会出现不可控的情况,如下是不带on的语句:

    hive> SELECT * FROM fracture_act JOIN fracture_ads WHERE fracture_act.planner_id = fracture_ads.planner_id;

    出现如下错误:

    FAILED: Error in semantic analysis: In strict mode, cartesian product is not allowed. If you really want to perform the operation, +set hive.mapred.mode=nonstrict+

    =======》我感觉整个博客园都存在不加思考的抄袭的现象。要不然就是改一改表名,装作成自己的。连最基础的概念什么是笛卡尔积都不知道

    这才是真正的笛卡尔积,上面根本不会报错。

    hive> SELECT * FROM fracture_act JOIN fracture_ads WHERE 1= 1;

     或者是

    hive> SELECT * FROM fracture_act JOIN fracture_ads;

    解决方案就是加上on语句:

    hive> SELECT * FROM fracture_act JOIN fracture_ads ON (fracture_act.planner_id = fracture_ads.planner_id);

     或者是加上where条件

    hive> SELECT * FROM fracture_act JOIN fracture_ads WHERE fracture_act.planner_id = fracture_ads.planner_id;

    不过on性能更好一些。

  • 相关阅读:
    【C#学习笔记】 IDisposable 接口
    【C#学习笔记】 List.AddRange 方法
    Request a certificate from a certificate vendor
    How to install your SSL Certificate to your Windows Server
    How to generate a CSR in Microsoft IIS 7
    我爱你 肖厦
    OAuth2.0协议之新浪微博接口演示
    重写mouseEvent 事件 怎么实现自定义的无边框窗口移动
    原文地址:Qt数据库总结 作者:ImmenseeT
    QT+MySQL图片插入数据库并显示 2013-03-12 13:58:52
  • 原文地址:https://www.cnblogs.com/wqbin/p/11031201.html
Copyright © 2011-2022 走看看