zoukankan      html  css  js  c++  java
  • 浅析量化分析数据质量

    How can data quality be quantified in the data warehouse?

    如何来量化数据仓库中的数据质量?

    答:在数据仓库项目中,通常通过不规则数据的检测工作(Anomaly Detection)来量化源系统的数据质量。除非成立专门的数据质量调查项目组,否则这个工作应该由ETL项目组完成。通常可以采用分组SQL来检查数据是否符合域的定义规则。

    对于数据量小的表,可以直接使用类似下面的SQL完成。

    select state, count(*) from order_detail group by state

    对于数据量大的表,一般通过采样技术来减少数据量,然后进行不规则数据检测。类似SQL如下。

    select a.* from employee a, (select rownum counter, a.* from employee a) B where a.emp_id = b.emp_id and mod(b.counter, trunc((select count(*) from employee)/1000,0)) = 0

    如果可以采用专门的数据概况分析工具进行的话,可以减少很大的工作量。

  • 相关阅读:
    css盒子模型 ( 基本针对兼容性问题有点帮助 )
    11.5 Array 数组
    11.5笔记 数组去重
    11.5笔记 函数
    11..2笔记 对象
    11.1笔记
    10.31笔记
    10.31笔记 作用域链
    10.15笔记 js
    10.8补
  • 原文地址:https://www.cnblogs.com/sanpoye/p/2659613.html
Copyright © 2011-2022 走看看