随着企业数字化转型的深入,数据已从信息化的附属产物演变为核心生产要素。然而,数据分散在数十个业务系统之中,格式各异、标准不一、质量参差——“数据有哪些、在哪里、能不能用"成为困扰企业数据管理者的首要难题。
数据资产管理平台正是在这一背景下诞生的全栈解决方案,它连接数据生产端与消费端,将原始数据经过采集 → 治理 → 融合 → 服务的全链路加工,最终沉淀为可度量、可估值的企业资产。
总体架构:微服务五层分层模型
平台采用经典的 Spring Cloud 微服务分层模式,自底向上划分为五个层次:
| 层次 | 核心职责 | 关键组件 |
|---|---|---|
| 存储层 | 承载系统库和数据源 | Oracle / MySQL / Hive / HBase / MongoDB / HDFS |
| 依赖组件层 | 集成计算和中间件引擎 | Presto、Spark、Redis、Activiti、ES/Solr、XXL-JOB |
| 基础服务层 | 平台底座能力 | Nacos、Gateway、Sentinel、授权中心 |
| 数据处理层 | 数据加工核心逻辑 | 标准化服务、质量评估、融合计算、缓存与消息 |
| 业务应用层 | 面向用户的业务模块 | 元数据管理、数据质量、数据融合、统一调度等7大模块 |
各层要点
- 存储层:系统库支持 Oracle 11g/12c 及 MySQL 5.5~8.0;附件存储支持服务器磁盘、HDFS 和 HBase 三种介质
- 依赖组件层:Presto 做异构数据统一查询,Spark 做大批量运算,Redis 提供高频缓存(支持插拔),XXL-JOB + Quartz 实现统一调度
- 基础服务层:所有微服务通过 Ribbon 负载均衡、Feign 服务间调用,Hystrix + Sentinel 双重熔断保障健壮性
- 数据处理层:封装数据标准化服务(屏蔽异构数据源差异)、缓存与消息服务(Redis + XXL-MQ 异步处理)
多源异构元数据采集:五种归集策略
企业数据资产的首要挑战是"归集”。不同业务系统使用不同数据库、不同数据格式,甚至部分数据以线下 Excel 或外部 API 的形式存在。
平台通过元数据驱动的方式,提供五种归集策略:
| 策略 | 适用场景 | 工作方式 |
|---|---|---|
| 物理接入 | 可直连业务库 | 直接连接数据库,解析元数据并读取数据 |
| 接口调用 | 业务系统提供API | 对接业务系统的API接口获取数据 |
| 逻辑归集 | 数据不宜搬迁 | 保留数据在原库,平台仅注册元数据定义 |
| 线下导入 | Excel / CSV 离线数据 | 通过前台录入或批量导入处理 |
| 文件上传 | 非结构化文件 | 上传标准文档、技术报告等 |
元数据管理要点
元数据不仅描述数据的结构(表名、字段名、数据类型、长度),还承载业务语义(业务含义、数据标准、责任部门、安全等级)。
通过元数据注册与发布机制,企业可以建立起一套统一的"数据字典",解决数据定义不一致、口径不统一的历史顽疾。
支持的数据源类型覆盖了关系型数据库(Oracle、MySQL、SQL Server、达梦、人大金仓、神通、DB2、Greenplum)、大数据生态(HDFS、Hive、HBase)、NoSQL(MongoDB)以及各类API接口和非结构化文件系统。
新接入一种数据源的开发周期,通过数据标准化服务可压缩至原来的二分之一左右。
数据血缘分析:追踪数据的前世今生
数据从源头系统经过采集、清洗、融合、汇总等多个环节最终服务于业务应用,这条链路上每一步的变换都可能产生连锁反应。
三个核心维度
- 血缘分析(正向追溯):回答"这条数据从哪里来?"
- 影响分析(反向评估):回答"源头表结构变了,哪些下游数据和业务会受影响?"
- 全链分析(端到端):展示从数据源到最终应用表的完整流转路径
实现机制
- 平台自动解析数据同步和融合加工任务中产生的血缘关系——当融合任务将 A 表和 B 表关联运算输出到 C 表时,系统自动记录 A→C、B→C 的血缘关系
- 对于平台外部的数据流转(如业务系统内部的 ETL),支持手动补充维护
- 最终通过图形化方式呈现血缘图谱
实战案例:某省民政厅多业务数据集成项目中,数据血缘能力帮助管理者清晰看到社会救助、婚姻登记、优抚管理等12个业务系统的数据如何汇聚到缓冲库(ODS),再经过主题库(DW)和分析库(DM)的加工最终呈现在决策看板上。
数据质量治理:规则引擎 + 双控机制
数据质量是数据资产价值变现的基础。平台构建了一套完整的质量治理体系,核心由规则引擎和**“事前管控 + 事后稽查"双控机制**组成。
规则引擎:11种规则类型全覆盖
| 规则类型 | 检查内容 | 典型场景 |
|---|---|---|
| 非空规则 | 必填字段是否为空 | 身份证号不能为空 |
| 唯一规则 | 字段值是否重复 | 员工工号唯一 |
| 组合唯一 | 多字段联合唯一性 | 姓名+部门联合唯一 |
| 一致规则 | 跨表/跨字段一致性 | 订单表与库存表数量一致 |
| 正则规则 | 格式规范匹配 | 手机号、身份证号格式 |
| 条件规则 | 业务逻辑条件判断 | 年龄>0 且 <150 |
| 阈值规则 | 数值范围校验 | 温度在合理区间内 |
| 核准规则 | 与标准值/参考值比对 | 金额与财务系统核对 |
| 规范规则 | 数据格式标准化 | 日期格式统一为 yyyy-MM-dd |
| 组合规则 | 多规则复合判断 | 复合业务校验逻辑 |
| 自定义规则 | 用户脚本扩展 | 复杂业务校验 |
事前管控:入口拦截
数据进入平台的入口处自动执行预置的质量规则,不符合规则的数据被阻止进入。
类似于"守门人"的角色,将问题数据挡在门外。
事后稽查:周期性评估
对已入库数据定期进行全量或抽样的质量评估:
- 自动输出脏数据明细、低分预警和质量评估报告
- 可按部门、按标准、按时间维度统计分析
- 形成持续改进的治理闭环
实战案例:某研究院项目中,平台协助10个部门完成了52项数据资源的标准制定和质量规则配置,通过周期性评估推动数据质量稳步提升。
数据融合加工与批流一体计算
归集后的原始数据往往不能直接满足业务分析需求,需要经过融合加工才能形成有价值的汇总数据和指标数据。
融合加工工具
平台提供 Web 端可视化、拖拽式的融合加工工具,支持:
- 多表连接:内连接、外连接、交叉连接等
- 行列运算:字段计算、过滤、排序、分组聚合
- 结果发布:输出到新表或已有表
融合任务支持调度执行,写入模式包括全量覆盖、增量追加和更新三种。
底层计算引擎
| 场景 | 引擎 | 能力 |
|---|---|---|
| 批量数据处理 | Spark | 千万级/亿级数据,效率提升一倍以上 |
| 实时处理 | Flink(预留接口) | 实时数据同步、流式质量校验 |
| 统一调度 | XXL-JOB + Quartz | 定时调度 + 依赖触发 |
平台通过封装 Spark 任务提交接口,将上层业务逻辑与底层计算框架解耦,用户无需了解分布式计算细节即可完成大数据量处理。
数据服务层:API封装与批量同步
数据资产的最终价值体现在被业务系统消费和使用。平台提供两种核心输出方式:
API 服务接口
- 用户可在 Web 界面零代码配置:数据范围、返回格式、字段映射、授权对象
- 将底层数据封装为 RESTful API,灵活应对业务端多变的数据集成需求
- 提供 API 权限管理、调用鉴权和流量监控
解决了传统点对点集成中接口维护难、变更响应慢的问题。
批量数据同步
- 适用于大规模数据的定期交换
- 支持全量和增量两种同步策略
- 调度系统自动触发同步任务
实战案例:某机电集团项目中,平台完成了集团总部与多个子公司之间的横向和纵向数据集成,替代了原有的点对点手工对接模式。
数据资产估值:目录、地图与运营度量
数据要成为"资产”,必须可度量、可运营。平台通过两个核心功能实现这一目标:
数据资产目录
基于元数据和归集数据自动生成,随数据资产的积累动态更新。目录展示:
- 企业拥有哪些数据
- 数据如何定义
- 数据在哪里、谁负责
- 如何获取(在线订阅 / API申请)
数据资产地图
从宏观视角展现企业数据资产的全景运营状态:
| 维度 | 度量内容 |
|---|---|
| 资产大盘 | 总量、增量、分布 |
| 元数据覆盖 | 各系统元数据采集率 |
| 标准贯标率 | 数据标准执行程度 |
| 质量评分 | 数据质量综合得分 |
| 交换流量 | 数据流转规模和趋势 |
| 安全态势 | 数据访问与风险分布 |
通过这些运营指标,企业管理者可以量化数据资产的价值贡献,评估数据治理工作的成效。
存储架构选型与弹性设计
平台将存储划分为四个区域,兼顾多种数据形态和不同项目规模:
| 存储区域 | 选型方案 | 适用场景 |
|---|---|---|
| 系统数据 | Oracle / MySQL | 配置、元数据、用户权限 |
| 实体数据 | 关系型 / 非关系型 / 分布式 | 按数据类型灵活选择 |
| 非结构化数据 | 服务器磁盘 / HDFS / HBase | 按文件规模配置 |
| 索引文件 | Elasticsearch / Solr | 分布式或单节点部署 |
缓存层使用 Redis 存储高频查询、低频更新的信息(如数据字典、权限配置)。整个存储架构具备弹性伸缩能力:大型项目可以分布式部署各组件,小型项目可共用数据源实现最小化部署。
安全体系与三员管理模型
数据安全是资产管理平台的底线要求。平台从四个层面构建纵深防御体系:
- 网关安全:统一鉴权、反向代理、熔断控制
- 服务监控:实时感知节点健康状态和资源使用
- 权限管理:细粒度的菜单和接口权限控制
- 数据安全:库级/表级/字段级/记录级/密级多维访问控制
数据安全的关键能力:
- 数据密级与人员密级匹配机制
- 关键字段脱敏处理
- 关键数据加密存储和传输
- 数据操作日志全量记录可追溯
三员管理模型
| 角色 | 职责 | 权限边界 |
|---|---|---|
| 系统管理员 | 功能配置、日常运维 | 不涉及权限分配 |
| 安全管理员 | 权限分配、安全策略制定 | 不涉及系统配置 |
| 审计管理员 | 日志审计、安全检查 | 不涉及操作执行 |
三员分立、相互制衡,任何单一角色都无法独立完成敏感操作,有效防范内部安全风险。
部署模式:两种典型方案
| 维度 | 推荐部署(全分布式) | 最小部署 |
|---|---|---|
| 适用规模 | 大型企业/集团级 | 中小企业/试点项目 |
| 微服务部署 | 各组件独立服务器 | 所有服务同一台服务器 |
| 数据库 | 专用数据库服务器 | 独立服务器(共用) |
| 扩展能力 | 强,支持亿级数据 | 有限 |
| 运维复杂度 | 高 | 低 |
平台还兼容 Kubernetes 容器化部署,支持前后端分离和混合模式两种前端架构,可在 Windows 和 Linux 上运行。
落地实践中的集成挑战与应对
异构数据源适配
不同厂商的数据库在数据类型、函数语法、事务机制上存在差异。平台通过数据标准化服务抽象统一的查询、存储和计算接口,将适配成本从平均两人月压缩到一个月以内。
分布式一致性
参考 Java CAS(Compare and Swap)机制,通过数据表的时间戳字段实现乐观锁校验,确保并发编辑场景下数据不被意外覆盖。跨服务复杂事务通过失败重试、事务补偿和分布式事务框架协同处理。
运维复杂度控制
Nacos 注册中心、Sentinel 监控、Gateway 网关等组件本身也需要高可用部署。
建议:根据数据规模和并发需求合理选择部署模式,避免"杀鸡用牛刀"式的过度架构。
数据资产管理平台的建设不是一蹴而就的工程,而是伴随企业数据战略持续演进的长期投入。关键在于根据企业自身的数据规模、团队能力和业务优先级,选择合适的起点和演进路径,让数据真正成为驱动业务增长的可靠资产。