首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏好好学习

    【UML建模】(4) UML建模之时序图

    >0 时执行accept()方法,否则执行 reject()方法 Option fragment (denoted “opt”) 标示Switch, 表示一种单条件分支 当参数校验正确时则调用 保存数据的接口

    3.4K20编辑于 2022-03-31
  • 来自专栏大数据学习与分享

    数据建模-维度建模-维度设计

    作为维度建模的核心,我们在企业级的数据仓库中必须保证维度的唯一性。以淘宝商品维度为例,我们有且只允许有一个维度定义。 第二步:确定主维度表。 (3)同一类数据基于范式建模,拆分成同一类型数据库中多张的物理表,比如商品,有商品主表和商品扩展表,商品主表存商品基本信息;商品扩展表存储商品特殊信息,如不同产品线定制化的信息等;比如会员,有会员主表和会员扩展表 具体体现在如下几个方面: (1)命名规范的统一:表名、字段名等统一;  (2)字段类型的统一:相同和相似字段的字段类型的统一; (3)公共字段及枚举值的统一:公共字段及枚举值的类型、命名方式等统一; (4) 表4:变化前商品表和订单表 商品 Key 商品 ID 商品标题 所属新类目 所属旧类目 其它属性 1000 item1 title1 类目 1 类目 1 ... 但在阿里巴巴数据仓库建设的实践过程中,虽然我们使用的是Kimball的维度建模的理论,但实际并未使用代理键。我们是如何处理缓慢变化维度,如何记录变化历史的呢?为什么不使用代理键呢?  

    2K31编辑于 2023-09-06
  • 来自专栏波波烤鸭

    PowerDesigner数据建模

    PowerDesigner安装 云盘地址:https://pan.baidu.com/s/1MZnQhPZ6ityza9N9nAD3bw 提取码:8qpi 傻瓜式安装 E-R图 E-R图(实体关系图) 1.创建模型 生成数据库脚本 ? ? ? ? ?

    91841发布于 2019-04-02
  • 来自专栏用户8950297的专栏

    Power Pivot数据建模基础:数据表间的4种基本关系类型

    大海:其实2个表之间的关系类型也很简单,莫非就4种。 小勤:4种? 大海:嗯。我们接下来通过数据的方式来看各种关系具体是什么样子的。 1. 其次,就是多对多关系,比如你的订单明细表里因为只有产品名称,而产品表里的产品名称不是唯一的,两个表间通过产品名称来看的话,订单明细表里一条数据,可能在产品表里找到多条数据,而在产品表里的一条数据,也可能在订单明细表里找到多条数据 比如下面2个产品表: 4. 最后,也是最简单的,但可能是最麻烦的,就是两个表间的关系是没有关系。比如订单表和产品表之间,就完全找不到关系。 小勤:知道了。 大海:一般日常看到的数据通常数据量不大,都可以放到一个表里,那样数据也好处理,但是,随着数据量越来越大,有很多时候一张表可能很复杂,可能有几百上千列,如果都放在一张表里的话,可能会极大地影响数据的计算效率 里你只要对订单表和订单明细表、订单明细表和产品表分别建立表间关系,那么就可以在订单表里通过一定的方法得到产品表的相关信息,或在产品表里通过一定方法获得订单表里的信息,不过这方面的内容比较复杂一些,在后续的数据建模中咱们再一起看

    4.5K31发布于 2021-08-30
  • 来自专栏大数据与微服务架构

    数据挖掘与建模

    数据挖掘是基于统计学原理,利用机器学习中的算法工具实现价值信息的发现。机器学习是一种实现人工智能的方法,深度学习是实现机器学习的一种技术。 ? 非线性分类经典算法包括K近邻(KNN)、支持向量机(SVM)、决策树(D Tree)、朴素贝叶斯(NB) 2、回归分析:反映事务数据属性在时间上的特征,预测数据间的相关关系,与分类区别在于,分类是预测目标的离散变量 二、无监督学习(事先没有任何训练数据样本,需要直接对数据进行建模,即不提供经验和训练样本,完全靠自己摸索) 1、关联分析:描述数据库中数据之间存在关系的规则。 关联规则挖掘中有4个指标:置信度、支持度、期望置信度、提升度。 典型算法:Apriori算法、FP-Tree算法、PrefixSpan算法。 模型发现:20世纪90年代的美国沃尔玛超市中,管理人员分析销售数据时发现了一个令人难于理解的现象:在某些特定的情况下,“啤酒”与“尿布”两件看上去毫无关系的商品会经常出现在同一个购物篮中。

    1.2K30发布于 2020-04-11
  • 来自专栏斑斓

    MongoDB的数据建模

    MongoDB是一种面向Document的NoSQL数据库,如果我们还是按照RDB的方式来思考MongoDB的数据建模,则不能有效地利用MongoDB的优势;然而,我们也不能因为Document的灵活性 适度的建模是非常有必要的,尤其对于相对复杂的关联关系。因为在MongoDB中,处理这种关联关系既可以使用Link,也可以使用Embedded。 这种建模方式还带来另一种可能,就是原本Person->Tasks的one-to-N关系就可以变为N-to-N关系,因为一个Task可以被多个Person所拥有。 如果采用Embedded方式,则会导致Task数据的冗余。 one-to-few one-to-many one-to-squillions 但我认为该怎么实现关联,应该从Entity之间的领域关系来判断,我们可以引入DDD的Aggregation设计概念作为建模的依据

    1.3K60发布于 2018-03-07
  • 来自专栏大数据解决方案

    ETL和数据建模

    一、什么是ETL ETL是数据抽取(Extract)、转换(Transform)、加载(Load )的简写,它是将OLTP系统中的数据经过抽取,并将不同数据源的数据进行转换、整合,得出一致性的数据,然后加载到数据仓库中 二、数据仓库的架构 数据仓库(Data Warehouse \ DW)是基于OLTP系统的数据源,为了便于多维分析和 多角度展现将其数据按特定的模式进行存储而建立的关系型数据库,它不同于多维数据库,数据仓库中的数据是细节的 这里我们首先要确定维度的层次(Hierarchy)和级别(Level)(图 四:pic4.jpg),维度的层次是指该维度的所有级别,包括各级别的属性;维度的级别是指该维度下的成员,例如当建立地区维度时我们将地区维度作为一 如客户信息表; 代码参数表:此类源表用于记录源系统中使用到的数据代码和参数; 4. 数据文件的类型: 数据文件大多数以1天为固定的周期从源系统加载到数据仓库。数据文件包含增量,全量以及待删除的增量。 增量数据文件:数据文件的内容为数据表的增量信息,包含表内新增及修改的记录。 全量数据文件:数据文件的内容为数据表的全量信息,包含表内的所有数据。

    1.9K20发布于 2021-11-19
  • 来自专栏机器学习AI算法工程

    【LDA数学八卦-4】文本建模

    4. 文本建模 我们日常生活中总是产生大量的文本,如果每一个文本存储为一篇文档,那每篇文档从人的观察来说就是有序的词的序列 d=(w1,w2,⋯,wn)。 包含M 篇文档的语料库 统计文本建模的目的就是追问这些观察到语料库中的的词序列是如何生成的。 所以在统计文本建模中,我们希望猜测出上帝是如何玩这个游戏的,具体一点,最核心的两个问题是 上帝都有什么样的骰子; 上帝是如何抛掷这些骰子的; 第一个问题就是表示模型中都有哪些参数,骰子的每一个面的概率都对应于模型中的参数 对每一个具体的骰子p→,由该骰子产生数据的概率是 p(W|p→), 所以最终数据产生的概率就是对每一个骰子p→上产生的数据概率进行积分累加求和 p(W)=∫p(W|p→)p(p→)dp→ 在贝叶斯分析的框架下 Unigram Model Unigram Model的概率图模型 回顾前一个小节介绍的 Drichlet 分布的一些知识,其中很重要的一点就是 Dirichlet 先验 + 多项分布的数据

    1.3K30发布于 2018-03-12
  • 来自专栏飞鸟的专栏

    MongoDB的数据建模

    MongoDB是一个基于文档模型的NoSQL数据库,它的数据建模与传统的关系型数据库有很大的不同。在MongoDB中,数据是以文档的形式存储的,文档是一种类似于JSON的数据格式,非常灵活和扩展。 集合中的每个文档都可以有不同的结构,不同于传统数据库中表中的行,它们可以有不同的列和数据类型。 以下是一些关键的设计考虑因素:数据的一致性在MongoDB中,数据的一致性需要通过应用程序来保证。在设计文档模式时,需要确保每个文档都包含完整的数据,以避免应用程序在查询时需要多次访问数据库。 在将数据分布到多个节点时,需要确保数据的相关性。通常可以将数据根据其相关性分组到同一个集合中,这样可以避免在查询时需要访问多个集合。此外,还可以考虑使用分片(sharding)来分散数据负载。 这种设计方式可以减少重复数据,同时也可以提高查询性能和数据一致性。

    1.4K40编辑于 2023-05-09
  • 来自专栏喵叔's 专栏

    RavenDB数据建模--总结

    只需将数据存储进去并通过键访问数据即可。同时我们还学习了使用过期功能来存储与时间相关的数据。 从键/值存储的简单模型开始,我们开始考虑真实的文档模型,学习了如何构建嵌入值来存储本质上是文档一部分的数据,还研学习了如何对关系和集合、多对一和多对多关联进行建模。 然后,我们介绍了更高级的建模技术,例如如何处理引用和配置数据,以及如何处理时态信息和分层结构。 接下来,我们讨论了建模时必须考虑的一些约束,例如如何处理文档的增长以及RavenDB中文档的良好大小。 我们学习了并发控制以及变化向量如何用于乐观并发和缓存,并且学习了为什么我们应该避免在模型中缓存聚合数据。 然后我们学习了如何处理带有附件的二进制数据,以及使用修订功能进行审计和更改跟踪,并且了解了我们可以在 RavenDB 中如何让文档数据过期。简要介绍了索引和查询时的引用处理。

    76130编辑于 2022-05-25
  • 来自专栏文渊之博

    数据仓库建模

    应用层模型由各应用按需自行建设,其中基础数据模型一般采用ER模型,融合数据模型采用维度建模思路。 三、两种经典的数据仓库建模方法 前面的分层设计中你会发现有两种设计方法,关系建模和维度建模,下面分别简单介绍其特点和适用场景。 维度建模以分析决策的需求出发构建模型,构建的数据模型为分析需求服务,因此它重点解决用户如何更快速完成分析需求,同时还有较好的大规模复杂查询的响应性能,更直接面向业务。 运营商以前都是关系建模,现在其实边界越来越模糊,很多大数据业务变化很快,采用维度建模也比较方便,不需要顶层设计。 四、企业建模的三点经验 维度建模就不说了,只要能理解业务过程和其中涉及的相关数据、维度就可以,但自顶向下的关系建模难度很大,以下是关系建模的三个建设要点。

    2K31发布于 2020-06-19
  • 来自专栏数据库

    论道数据仓库维度建模和关系建模

    为什么要数据仓库建模呢? 但这个问题又很重要,因为有标杆认识到差距才能进步,有伙伴邀笔者去讲讲数据建模,说实话,笔者也不知道怎么讲,因为这个跟企业自己的业务和数据太相关了,所谓的业界的标准建模理论和方法也变得无足轻重。 Inmon的ER建模优点体现在规范性较好,冗余小,数据集成和数据一致性方面得到重视,适用于较为大型的企业级、战略级的规划,但缺点是需要全面了解企业业务、数据和关系,对于建模人员要求很高,实施周期非常长, 但Inmon和kimball关于关系建模和维度建模的争论其实也没什么值得探讨的,没有谁更好,在企业内,这两种建模方式往往同时存在,底层用关系建模合适一点,技术的优雅换来了数据的精简,往上维度建模更合适一些 在数据建模上,很多人纠结于如何建模,用关系建模、维度建模亦或其它?

    2.5K80发布于 2018-02-24
  • 来自专栏OpenFPGA

    数字硬件建模SystemVerilog-组合逻辑建模(4)组合逻辑决策优先级

    下面的代码片段演示了一个以if-else-if决策链建模的4-2优先级编码器,其中高阶位优先于低阶位。 同样的优先级编码器也可以通过使用case语句来建模。 这可以通过在case关键字之前添加一个unique的决策修饰符来实现,如下例所示: 示例7-4:具有unique并行编码逻辑的状态解码器 //`begin_keywords "1800-2012" / current_state[2]: get_going = '1; endcase end endmodule: case_with_unique0_decode //`end_keywords 图7-4显示了综合该示例的结果 图7-4:示例7-4的综合结果:使用unique 使用unique会指示综合编译器可以并行计算case项。与图7-3所示的优先级实现相比,这显著减少了该独热码解码器的门数和传播路径的数量。 示例7-3和7-4中所示的reverse case语句编码风格是综合编译器需要决策修饰符以实现最佳结果质量(QoR)的少数例外之一。

    1.9K10编辑于 2023-02-14
  • 数据建模怎么做?一文讲清数据建模全流程

    其实数据建模这事儿,就是把业务需求和技术实现连起来的那根线,看着基础,却藏着不少坑。 今天我就不跟你扯教科书上的理论了,就从实际应用的角度,把数据建模的全流程拆解开,重点说说这四个核心问题:需求该怎么接模型该怎么设计落地时要避开哪些坑后续怎么跟着迭代一、需求分析数据建模第一步,80%人都会踩坑 数据建模的方法不少,像维度建模、实体关系建模、数据湖建模等等。但实际干活的时候,最常用的还是维度建模,特别是星型模型和雪花模型。为啥呢? 4. 第四步:选择模型类型(星型vs雪花)怎么选呢? 别追求一开始就做出“完美模型”,在业务迭代中不断优化,这才是数据建模最实在的经验。

    1.2K10编辑于 2025-08-22
  • 来自专栏PowerBI入门100例

    2.6 PowerBI数据建模-新建列的4种方法及其优先级

    新建列方法新建列的可以在4个环节内完成:数据源、PowerQuery、VAR过程列、DAX计算列。数据源:在上游数据源(数据库或文件)中新建列,然后直接导入PowerBI使用。 PowerQuery:在数据清洗的过程中添加列,处理后加载到模型。VAR过程列:不生成物理列,在计算列的计算过程中,使用VAR现调取现使用,用后抛弃。 3 如果必须新建物理列(数据表中存在的列),能在数据源中新建列,就优先在数据源中新建列。4 数据源不方便调整的话,能在PowerQuery中添加列,就在PowerQuery中添加列。

    74000编辑于 2025-02-24
  • 数据仓库建模基石:维度建模与范式建模深度对比与选型指南

    数据仓库建模概述:为何建模是数据基石 在数字化浪潮席卷各行各业的今天,数据已成为企业最宝贵的资产之一。 数据建模:构建数据世界的蓝图 如果说数据仓库是企业数据的"容器",那么数据建模就是设计这个容器内部结构的"蓝图"。数据建模是通过定义数据结构、关系、约束和规则,将业务需求转化为具体数据模型的过程。 通过实施统一的数据建模标准,该企业建立了企业级数据模型,实现了以下改进: 数据一致性提升85%,消除了部门间的数据争议 报表生成时间从平均4小时缩短到30分钟 决策效率提升60%,管理层能够基于统一数据快速做出判断 AI技术的普及也为数据建模带来了新的可能性。机器学习算法可以辅助建模过程,自动识别数据特征和关系,推荐最优的建模方案。同时,数据建模还需要考虑隐私保护和合规要求,特别是在处理个人敏感数据时。 选型决策的关键因素 基于以上案例分析,建模方法的选择需要考虑多个维度: 数据特征维度: 数据量大小:大数据量场景更适合维度建模 数据更新频率:高频更新场景需要范式建模的支持 数据复杂度:复杂关系数据适合范式建模

    98210编辑于 2025-11-29
  • 来自专栏飞鸟的专栏

    MongoDB的数据关系建模

    简介MongoDB是一种面向文档的数据库,因此在进行数据建模时,其与传统的关系型数据库有所不同。MongoDB支持多种数据关系建模方法,包括嵌入式数据模型和引用式数据模型。 数据关系建模MongoDB中的数据关系建模方法包括嵌入式数据模型和引用式数据模型。嵌入式数据模型在嵌入式数据模型中,一个文档可以包含另一个文档。这种关系称为嵌入式关系。 使用MongoDB数据关系建模的最佳实践以下是在使用MongoDB数据关系建模时的一些最佳实践:使用嵌入式数据模型时,考虑嵌套层数的问题。通常情况下,不建议超过嵌套3层,否则可能会影响查询性能。 当数据需要在多个文档中共享时,使用引用式数据模型可以更好地管理数据。例如,一个订单可能需要关联到多个客户和产品,这时使用引用式数据模型会更加方便。在使用引用式数据模型时,需要仔细考虑引用文档的结构。 引用文档的结构应该尽量简单,以便于使用简单的查询来检索相关数据。在使用引用式数据模型时,可以使用MongoDB的聚合框架来联接多个文档。

    1.1K20编辑于 2023-05-09
  • 来自专栏Python与算法之美

    图片数据建模流程范例

    使用Pytorch实现神经网络模型的一般流程包括: 1,准备数据 2,定义模型 3,训练模型 4,评估模型 5,使用模型 6,保存模型。 对新手来说,其中最困难的部分实际上是准备数据过程。 我们在实践中通常会遇到的数据类型包括结构化数据,图片数据,文本数据,时间序列数据。 我们将分别以titanic生存预测问题,cifar2图片分类问题,imdb电影评论分类问题,国内新冠疫情结束时间预测问题为例,演示应用Pytorch对这四类数据的建模方法。 本篇我们示范cifar2图片数据建模流程。 :使用nn.Sequential按层顺序构建模型,继承nn.Module基类构建自定义模型,继承nn.Module基类构建模型并辅助应用模型容器(nn.Sequential,nn.ModuleList,

    2.1K10发布于 2020-07-20
  • scrapy数据建模与请求

    学习目标:应用 在scrapy项目中进行建模应用 构造... 请注意,本文编写于 1724 天前,最后修改于 993 天前,其中某些信息可能已经过时。 学习目标: 应用 在scrapy项目中进行建模 应用 构造Request对象,并发送请求 应用 利用meta参数在不同的解析函数中传递数据 1. 数据建模 通常在做项目的过程中,在items.py中进行数据建模 1.1 为什么建模 定义item即提前规划好哪些字段需要抓,防止手误,因为定义好之后,在运行过程中,系统会自动检查 配合注释一起可以清晰的知道要抓取哪些字段 /h4/text()').extract_first() item['desc'] = node.xpath('. ,发送payload_post请求时使用(在下一章节中会介绍post请求) 4. meta参数的使用 meta的作用:meta可以实现数据在不同的解析函数中的传递 在爬虫文件的parse方法中,提取详情页增加之前

    80320编辑于 2023-05-17
  • 来自专栏大数据文摘

    用户画像数据建模方法

    本文将用户数据划分为静态信息数据、动态信息数据两大类。 ? 静态信息数据 用户相对稳定的信息,如图所示,主要包括人口属性、商业属性等方面数据。 这类信息,自成标签,如果企业有真实信息则无需过多建模预测,更多的是数据清洗工作,因此这方面信息的数据建模不是本篇文章重点。 3.3 数据建模方法 下面内容将详细介绍,如何根据用户行为,构建模型产出标签、权重。一个事件模型包括:时间、地点、人物三个要素。 上述模型权重值的选取只是举例参考,具体的权重值需要根据业务需求二次建模,这里强调的是如何从整体思考,去构建用户画像模型,进而能够逐步细化模型。 内容地址、行为类型、时间衰减,决定了权重模型是关键,权重值本身的二次建模则是水到渠成的进阶。模型举例偏重电商,但其实,可以根据产品的不同,重新定义接触点。

    2.4K60发布于 2018-05-22
领券