zoukankan      html  css  js  c++  java
  • 大数据项目——互联网精准营销——数据清洗

    使用kettle进行数据清洗:

     1.新建转换去除手机销售信息表的重复记录
      要求:去除该字段中的所有空格,方便后续聚合统计,字母统一大小写,去除该字段中的所有特殊字符(各种标点符号)

          这里可选用排序加去重组件,也可用哈希去重。然后用字符串操作去括号,大小写统一。字符串替换的正则表达式去除特殊字符。

     2.新建转换去除用户评论信息表的重复记录

      和上面的操作差不多,一个去重

    3. 新建转换处理用户信息表中出生日期字段(将 2019 年 5 月 20 日转换为 2019-5-20)
    这个我仍然用的正则,把年月(填写为“(年|月)”)改成“-”   把 日 替换为空

     效果:

     

     

  • 相关阅读:
    C# 6.0
    C# 4.0
    C# 5.0
    C# 3.0
    C# 2.0
    C# 1.0(2002)
    字典树Trie
    Hadoop——生态体系
    程序是怎样跑起来的
    Redis实战(十七)Redis各个版本新特性
  • 原文地址:https://www.cnblogs.com/zhaochenguang/p/11484272.html
Copyright © 2011-2022 走看看