热门标签 | HotTags
当前位置:  开发笔记 > 数据库 > 正文

BIFinancialDBDIFFAnalysisIssue

核心公式:DB--ETL--DWvsREFfile错误产生原因:1,DBDWConnectionIssue2,SQLIssue3,ProductBug4,REFfilenotupdated物理需求分析:1,SourceDB:EBS,PSFT,Fusion…DBInstance2,DW:忽略数据源的存储形式,将数据以同一

核心公式:DB -- ETL -- DW vs REF file 错误产生原因: 1, DB/DW Connection Issue 2, SQL Issue 3, Product Bug 4, REF file not updated 物理需求分析: 1, Source DB: EBS, PSFT, Fusion…DB Instance 2, DW: 忽略数据源的存储形式,将数据以同一

核心公式:DB --> ETL --> DW vs REF file

错误产生原因:

1, DB/DW Connection Issue

2, SQL Issue

3, Product Bug

4, REF file not updated

物理需求分析:

1, Source DB: EBS, PSFT, Fusion…DB Instance

2, DW: 忽略数据源的存储形式,将数据以同一的形式存储。

逻辑需求分析:

1, ETL过程:The data stored in Source DB will be extracted, transformed, andloaded to DW.

关键点:

1, Each record in DW can be found in Source DB tables. No matter it isoriginal data or derived data.

2, If it is original data, we need to know which table and which columnin Source DB it comes from.

3, If it is derived data, we need to know the associated record with itin Source DB. In another words, how does this data derive from Source DB byETL.

错误分析:

1, DB/DW Connection Issue: (略);

2, SQL Issue: (略);

3, Product Bug: (分两种类型)

类型一:当OUT file输出的行数和 REF file显示的行数相等(num (out)==num (ref)),但某些字段不同

定义:无论该字段是originaldata 还是 derived data,凡是由Source DB经过ETL过程转化到DW里的,并且转化后的数据与DB中的数据不相等,但是DB中的数据与REF file相等,那么这就是一个Product Bug。

举例: 1. original data:

如果DW中某一个字段值为0,而REF file 中显示为null,通过ETLMAPPING查看到DB中相应的字段为null。这种情况通过核心公式表示为:

null --> ETL --> 0 vs null. 显而易见,这是ETL发生了错误,也就是ProductBug。

2. derived data:

如果DW中某一个字段值为45.2,而REF file中显示为45.3,通过ETLMAPPING查看到这个字段的值是通过两条Source DB中的值相加得到的,i.e. (20.1+25.2), 进过计算,DB中显示的值为45.3。这种情况通过核心公式表示为:

45.3 --> ETL --> 45.2 vs 45.3. 显而易见,这也是ETL发生了错误,也就是ProductBug。

类型二:当OUT file 输出的行数和REF file显示的行数不相等,并且OUTfile输出的行数小于REF file 显示的行数(num (out)

定义:如果ETL Load Plan 没有执行成功,就会出现转化到DW里面的记录缺失,这就是一个Product Bug。

举例:如果DW输出的行数为4,而REF file显示的行数为8,并且DW中输出的这4条记录可以在REFfile这8条记录中找到,那么这就符合num(out)

4, REF file not updated: (分两种类型)

类型一:当OUT file输出的行数和 REF file显示的行数相等(num (out)==num (ref)),但某些字段不同

定义:无论该字段是originaldata 还是 derived data,凡是由Source DB经过ETL过程转化到DW里的,并且转化后的数据与DB中的数据想等,但是DB/DW中的数据与REF file不相等,那么这就属于REF file not updated的问题。

举例:1. original data:

如果DW中某一个字段值为0,而REF file 中显示为null,通过ETLMAPPING查看到DB中相应的字段为0。这种情况通过核心公式表示为:

0 --> ETL --> 0 vs null. 这说明ETL是没有问题的,也就是DBUpdated or REF file not updated。

2. derived data:

如果DW中某一个字段值为45.2,而REF file中显示为45.3,通过ETLMAPPING查看到这个字段的值是通过两条Source DB中的值相加得到的,i.e. (20.1+25.1), 进过计算,DB中显示的值为45.2。这种情况通过核心公式表示为:

45.2 --> ETL --> 45.2 vs 45.3. 这说明ETL是没有问题的, REF file not updated。

类型二:当OUT file 输出的行数和REF file显示的行数不相等,并且OUTfile输出的行数大于REF file 显示的行数(num (out)>num (ref)),并且REF file显示的行在OUT file中可以找到(只适用于INCR,如果FULL中出现这种类型,同样归纳到product bug)

定义:如果OUT file 输出的行数大于 REF File显示的行数,只有在增量的情况下可能出现REF更新的滞后性,因此是REF的问题,而FULL不存在此问题,如出现则是Product Bug。

举例: INCR中,如果DW输出的行数为10,而REF file显示的行数为3,并且REF file中这3条可以在OUT file 10条中找到,那么就是REF更新的滞后性问题。

分析疑难点:

1, 没有ETL MAPPING, 无法确定DW中的data是从Source DB中哪些记录中得到的。


推荐阅读
  • Nacos 0.3 数据持久化详解与实践
    本文详细介绍了如何将 Nacos 0.3 的数据持久化到 MySQL 数据库,并提供了具体的步骤和注意事项。 ... [详细]
  • 本文介绍 DB2 中的基本概念,重点解释事务单元(UOW)和事务的概念。事务单元是指作为单个原子操作执行的一个或多个 SQL 查询。 ... [详细]
  • 在将Web服务器和MySQL服务器分离的情况下,是否需要在Web服务器上安装MySQL?如果安装了MySQL,如何解决PHP连接MySQL服务器时出现的连接失败问题? ... [详细]
  • SQL 连接详解与应用
    本文详细介绍了 SQL 连接的概念、分类及实际应用,包括内连接、外连接、自连接等,并提供了丰富的示例代码。 ... [详细]
  • 本文介绍了如何使用Flume从Linux文件系统收集日志并存储到HDFS,然后通过MapReduce清洗数据,使用Hive进行数据分析,并最终通过Sqoop将结果导出到MySQL数据库。 ... [详细]
  • 本文介绍了如何在 Spring 3.0.5 中使用 JdbcTemplate 插入数据并获取 MySQL 表中的自增主键。 ... [详细]
  • BIEE中的最终用户界面被称为Presentation Layer(展现层)。展现层呈现的内容与用户在Web报表开发界面中看到的一致,使用业务语言进行描述,隐藏了技术细节,如星型模型。本文将详细介绍展现层的设计要点及其与业务模型层的关系。 ... [详细]
  • Hadoop的文件操作位于包org.apache.hadoop.fs里面,能够进行新建、删除、修改等操作。比较重要的几个类:(1)Configurati ... [详细]
  • PHP 使用 Cookie 进行访问授权的方法
    本文介绍了如何使用 PHP 和 Cookie 实现访问授权,包括表单验证、数据库查询和会话管理等关键步骤。 ... [详细]
  • 本文详细介绍了Java代码分层的基本概念和常见分层模式,特别是MVC模式。同时探讨了不同项目需求下的分层策略,帮助读者更好地理解和应用Java分层思想。 ... [详细]
  • 操作系统如何通过进程控制块管理进程
    本文详细介绍了操作系统如何通过进程控制块(PCB)来管理和控制进程。PCB是操作系统感知进程存在的重要数据结构,包含了进程的标识符、状态、资源清单等关键信息。 ... [详细]
  • 基于iSCSI的SQL Server 2012群集测试(一)SQL群集安装
    一、测试需求介绍与准备公司计划服务器迁移过程计划同时上线SQLServer2012,引入SQLServer2012群集提高高可用性,需要对SQLServ ... [详细]
  • DAO(Data Access Object)模式是一种用于抽象和封装所有对数据库或其他持久化机制访问的方法,它通过提供一个统一的接口来隐藏底层数据访问的复杂性。 ... [详细]
  • 深入解析HTML5字符集属性:charset与defaultCharset
    本文将详细介绍HTML5中新增的字符集属性charset和defaultCharset,帮助开发者更好地理解和应用这些属性,以确保网页在不同环境下的正确显示。 ... [详细]
  • com.sun.javadoc.PackageDoc.exceptions()方法的使用及代码示例 ... [详细]
author-avatar
糖糖菓子
这个家伙很懒,什么也没留下!
PHP1.CN | 中国最专业的PHP中文社区 | DevBox开发工具箱 | json解析格式化 |PHP资讯 | PHP教程 | 数据库技术 | 服务器技术 | 前端开发技术 | PHP框架 | 开发工具 | 在线工具
Copyright © 1998 - 2020 PHP1.CN. All Rights Reserved | 京公网安备 11010802041100号 | 京ICP备19059560号-4 | PHP1.CN 第一PHP社区 版权所有