zoukankan      html  css  js  c++  java
  • Hive的Transform的实现


    Hive 的 TRANSFORM 关键字提供了在 SQL 中调用自写脚本的功能。适合实现 Hive 中没有的 功能又不想写 UDF 的情况,脚本一般都是python写的。

    Json 数据: {"movie":"1193","rate":"5","timeStamp":"978300760","uid":"1"}

    需求:把json的字段timeStamp转换为日期编号。

    1、先加载 rating.json 文件到 hive 的一个原始表 rate_json

    create table rate_json(line string) row format delimited;
    load data local inpath '/home/j.json' into table rate_json;

    2、创建 rate 这张表用来存储解析 json 出来的字段:

    create table rate(movie int, rate int, unixtime int, userid int) row format delimited fields
    terminated by '	';

      解析 json,得到结果之后存入 rate 表: 

    insert into table rate select 
    get_json_object(line,'$.movie') as movie,
    get_json_object(line,'$.rate') as rate,
    get_json_object(line,'$.timeStamp') as unixtime,
    get_json_object(line,'$.uid') as userid
    from rate_json;

      使用 transform+python 的方式去转换 unixtime 为 weekday

      先编辑一个 python 脚本文件

     1 import sys
     2 import datetime
     3 for line in sys.stdin:
     4     #获取每一行的内容并去掉头尾的空格
     5     line = line.strip()
     6     #根据换行符截取对应的字段
     7     movie,rate,timeinfo,userid = line.split('	')
     8     #将timeinfo转成时间格式
     9     weekday = datetime.datetime.fromtimestamp(float(timeinfo)).isoweekday()
    10     #重新拼接拼接新的内容并加入换行符
    11     print '	'.join([movie, rate, str(weekday),userid])

    3,创建最后的用来存储调用 python 脚本解析出来的数据的表:lastjsontable

      

    create table lastjsontable(movie int, rate int, weekday int, userid int) row format delimited
    fields terminated by '	';

       保存文件 然后,将文件加入 hive 的 classpath:

    hive>add file /home/datechange.py;
    hive> insert into table lastjsontable select transform(movie,rate,unixtime,userid)
    using 'python datechange.py' as(movie,rate,weekday,userid) from rate;

    4,最后查询看数据是否正确

    select distinct(weekday) from lastjsontable;
  • 相关阅读:
    Github 上热门的 Spring Boot 项目实战推荐
    深入理解建造者模式 ——组装复杂的实例
    别死写代码,这 25 条比涨工资都重要
    Spring Boot 使用 JWT 进行身份和权限验证
    秋招打怪升级之路:十面阿里,终获offer!
    一问带你区分清楚Authentication,Authorization以及Cookie、Session、Token
    适合新手入门Spring Security With JWT的Demo
    面试官:“谈谈Spring中都用到了那些设计模式?”。
    春夏秋冬又一春之Redis持久化
    Mysql锁机制简单了解一下
  • 原文地址:https://www.cnblogs.com/songweideboke/p/9814604.html
Copyright © 2011-2022 走看看