1. 主数据管理1.1. 存储数据只是解决问题的一部分1.2. 主数据管理(MDM)可以理解为一套技术、工具和流程使用户能够创建和维护一致且准确的主数据列表1.3. 涉及从内部和外部数据源及应用程序中为业务中的每个人、地点或事物创建单一的主记录1.4. 可以使用这些主记录来构建更准确的报告、仪表盘、查询和机器学习模型1.5. 大多数MDM产品都有非常成熟的工具来清理、转换、合并和验证数据以执行数据标准1.6. 允许构建层次结构可以使用这些层次结构来改进报告和仪表盘1.7. 将要管理的数据复制到MDM产品中1.8. MDM会清理和标准化数据并为潜在被管理的每个实体比如客户创建一个主记录1.8.1. 会自动删除大多数重复项但有些工作将不得不手动完成需要有人审查可能重复的记录1.9. 主记录会被复制回数据湖或数据仓库1.9.1. 此主记录也被称为“金源”或“可信事实的最佳版本”1.10. 如果正在创建星型模式经过主数据管理的记录将成为维度表然后与未经主数据管理的事实表连接1.11. 主数据管理是一种重要方法专注于管理核心业务实体以确保跨多个系统和流程的数据准确性、统一性和一致性2. 数据虚拟化和数据联邦2.1. 数据虚拟化又称为逻辑数据仓库、虚拟数据仓库或去中心化数据库2.2. 一种允许通过创建数据的逻辑视图来访问和组合来自各种来源和格式的数据而无须复制或移动实际数据的技术2.3. 提供了所有数据的单一访问点支持实时数据合并并减少了传统数据合并方法所需的时间和成本2.4. 数据联邦和数据虚拟化是非常相似的术语经常可以互换使用如果混淆它们也不太可能出错2.4.1. 两者之间存在着细微的差异。数据联邦涉及一个由较小的、完全或部分自治的子组织组成的伞状组织这些子组织控制其全部或部分操作2.5. 与数据虚拟化一样数据联邦创建了来自多个数据源的统一数据视图2.6. 数据虚拟化是一个更宽泛的概念包括数据联邦以及数据转换、缓存、安全性和治理2.7. 更好的数据虚拟化工具提供了有助于提高性能的功能2.8. 数据虚拟化可以取代数据仓库或ETL/数据移动2.9. 数据虚拟化作为数据仓库的替代方案2.9.1. 采用数据虚拟化方案不需要将数据复制并存储在一个中心位置2.9.2. 数据虚拟化解决方案的主要优势在于它能快速推向市场2.9.3. 构建时间比构建数据仓库要短得多因为不需要设计和构建数据仓库以及ETL来复制数据也不需要花费大量时间进行测试2.9.4. 复制数据如数据仓库的做法意味着更高的存储和管理成本、需要构建和维护更多ETL流程以及更多的数据不一致性问题因此使用虚拟化可以节约大量成本2.9.5. 数据虚拟化支持联合查询(federated queries)可以发出单个查询来从多个数据源和多种格式数据中检索数据并将结果合并成一个单一的结果集2.10. 虚拟化作为ETL或数据移动的替代方案2.10.1. 如果计划对数据进行聚合或转换然后多次查询结果或者如果经常需要连接来自多个来源的数据集并需要高性能那么移动数据是好的选择2.10.2. 数据虚拟化提供了全面的数据沿袭确保可以清楚地了解数据从源到表现层的路径2.10.3. 可以无缝包含额外的数据源不需要修改转换包或暂存表2.10.4. 数据虚拟化软件通过统一的SQL接口呈现所有数据2.11. 可能选择数据虚拟化的原因2.11.1. 存在数据移动的法规限制2.11.1.1. 中国数据主权法规规定位于中国的数据必须留在中国只能由当前位于中国的人查询2.11.2. 公司外部的终端用户希望访问客户数据2.11.2.1. 与其向公司外部的终端用户发送数据副本不如让他们使用虚拟化软件来查询数据2.11.2.2. 数据管理员能够控制谁访问哪些数据并了解他们访问了多少数据2.11.3. 数据仓库之外的数据库中存在频繁更改的参考数据2.11.3.1. 与其一次又一次地将这些数据复制到数据仓库中不如使用虚拟化在查询外部数据库的数据时与数据仓库数据联接2.11.4. 如果想要查询来自不同数据存储的数据并将其合并在一起2.11.4.1. 虚拟化软件通常支持许多数据源数据虚拟化可以处理这种情况2.11.5. 希望用户通过虚拟沙盒进行自助分析2.11.5.1. 虚拟沙盒是一个安全且隔离的环境用户可以在其中探索、分析和操作数据而不会影响底层的生产数据或系统2.11.6. 想快速构建一个解决方案来迁移源数据2.11.6.1. 与使用传统ETL工具将源数据复制到中央位置然后从中创建报告不同可以直接使用虚拟化软件创建报告2.11.6.2. 虚拟化软件将针对源数据运行查询并自动完成集中化处理2.11.6.3. 这意味着可以更快地构建解决方案因为*不必使用ETL工具3. 数据目录3.1. 数据目录是一个集中化的存储库通常托管在云中用于存储和组织有关企业的所有数据源、表、模式、列和其他数据资产的元数据3.2. 作为用户发现、理解和管理数据的单一事实来源这些数据可能位于应用数据库、数据湖、关系数据仓库、运营数据存储、数据集市以及其他任何形式的数据存储中3.3. 包含3.3.1. 关于数据源的信息3.3.2. 如果位于关系数据库(RDW)内则包含表和模式信息以及列信息3.3.3. 如果在诸如数据湖等对象存储中则包含文件属性存储位置、文件夹名称、文件名3.3.4. 数据沿袭数据是如何从其源头传递过来的包括数据经历的任何转换、聚合和合并的信息3.3.5. 数据治理和合规性细节例如数据质量、所有权和政策3.3.6. 搜索和发现工具供用户搜索、过滤和查找相关数据3.4. 数据目录通过提供对数据环境的可见性来帮助更有效地管理数据3.4.1. 反过来又促进了团队之间更好的协作和更明智的决策3.5. 还有助于确保数据质量、安全性和合规性因为它可以更轻松地跟踪数据沿袭、执行数据政策并保持对数据资产的清晰理解3.6. 包括Informatica的企业数据目录(EnterpriseData Catalog)、Collibra数据目录和微软的Purview4. 数据市场4.1. 数据市场有时也称为数据交换平台是一个在线平台数据提供商和数据消费者在此买卖和交换数据集4.2. 旨在帮助数据消费者如企业、研究人员和开发人员发现、评估和购买用于分析、机器学习、商业智能和决策制定等目的的数据4.3. 提供商通常包括收集或生成有价值数据集的组织、政府和个人4.4. 数据市场通常包括一个数据目录4.5. 数据市场应该具备健全的安全措施以保护用户数据、确保遵守数据保护法规并维护敏感信息的机密性4.6. 数据市场其他常见的功能和工具包括4.6.1. 数据集的评分和评价4.6.2. 推荐其他可能喜欢的数据集4.6.3. 购买者个人资料方便重新订购、收藏列表等4.6.4. 协作和社区4.6.5. 培训和支持4.7. 从数据提供者的角度来看数据市场为他们提供了一种将数据资产货币化、创造新的收入来源的方式4.8. 对于那些收集了大量数据但缺乏分析和变现能力的组织来说这可能特别有利4.9. 随着对数据驱动见解的需求与日俱增以及越来越多样化的数据集数据市场的受欢迎程度也在不断提高