搞大数据的人,若只沉迷于Spark、Flink、Hadoop这些工具的快感,而忽视了数据仓库的建设,那无异于练了花拳绣腿,却没打好内功根基。数据仓库从来不是过时的古董,它是一套关于数据管理与使用的完整哲学——涵盖ETL、调度、建模、元数据治理等系统化理论,远非单纯“处理海量数据”所能替代。大数据更多是量级跃升与工具革新,两者非但不冲突,反而天然互补。
现实是,不少团队最初图省事,数据粗暴接入后直接对接业务,结果发展一段时间后,数据使用混乱不堪、重复计算严重、资源浪费惊人。这就是不重视分层的代价。清晰的数据分层,能带来数据结构明晰、血缘可追踪、重复开发减少、复杂问题简单化等多重收益。它就像城市规划,先铺好路、分好区,摩天大楼才能安然矗立。
经典分层模型包括:ODS操作数据层(贴近源数据,完成清洗去重)、DW数据仓库层(按主题建模,构建事实与维度)、APP应用层(面向产品和报表,直接输出价值)。实践中还可进一步细化为缓冲层、明细层、轻度汇总层、主题宽表层,以及专门存放国家代码等维度信息的DIM层、存储临时表的TMP层。每一层都有清晰的职责边界,数据流像电路图一样规整可控。
分层设计越早规划,后续的血缘分析、自动特征生成、元数据管理就越顺畅。技术会过时,但对数据本质的理解和管理能力,才是一个数据从业者真正的护城河。别让“搞大数据”的光环,掩盖了“搞懂数据”的初心。