首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏鸿的学习笔记

    数据平台的那些事(2

    调度平台简述 数据平台中的地位 任务调度系统在数据平台中算是非常核心的组件了。 在日常的数据处理中,定时运行一些业务是很常见的事,比如定时从数据库将新增数据导入到数据平台,将数据平台处理后的数据导出到数据库或者是文件系统。 可以这么说,任务调度系统类似于军队的司令,指挥着数据平台上的各个组件的运行,时刻监督着任务的运行情况。 与资源调度系统的区别 在数据平台里,有着另一种调度系统,称为资源调度系统。 说它简单,是因为相对于数据平台的计算引擎、存储系统等分布式系统,它的复杂度很低;说它不简单,是因为一个优秀的任务调度系统不仅需要和数据平台的各种组件对接,甚至还需要引入权限控制、监控报警,质量分析等功能 ,比如大数据开发平台的离线数仓报表处理业务,从数据采集,清洗,到各个层级的报表的汇总运算,到最后数据导出到外部业务系统,一个完整的业务流程,可能涉及到成百上千个相互交叉依赖关联的作业 因此DAG工作流类调度系统在数据平台中使用的更加广泛

    81730发布于 2019-07-08
  • 来自专栏大数据开发

    数据平台搭建:基于Hadoop的数据分析平台

    15.jpg 企业要进行大规模的数据分析,基于开源的Hadoop及其生态圈来搭建起大数据系统平台,无疑是一种低成本高效率的选择。 针对不同的具体需求,采用不同的数据分析架构和框架组件来解决实际问题。 大数据分析平台需求规划 按照数据分析的时效性需求,大数据分析可分为实时数据分析和离线数据分析两种。 实时数据分析一般用于金融、移动和互联网B2C等产品,往往要求在数秒内返回上亿行数据分析,从而达到不影响用户体验的目的。 在Hadoop生态圈,这些需求可以进行合理的规划。 对于大多数反馈时间要求不是那么严苛的应用,比如离线统计分析、机器学习、搜索引擎的反向索引计算、推荐引擎的计算等,可采用离线分析的方式,通过数据采集工具将日志数据导入专用的分析平台。 9.jpg 关于大数据平台搭建,基于Hadoop的数据分析平台,以上就是今天的分享内容了。

    2.4K1410发布于 2020-10-10
  • 来自专栏Albert陈凯

    Hadoop离线数据分析平台实战——320会话分析Hadoop离线数据分析平台实战——320会话分析

    Hadoop离线数据分析平台实战——320会话分析 项目进度 模块名称 完成情况 用户基本信息分析(MR)� 未完成 浏览器信息分析(MR) 未完成 地域信息分析(MR) 未完成 外链信息分析(MR) 未完成 用户浏览深度分析(Hive) 未完成 订单分析(Hive) 未完成 事件分析(Hive) 未完成 模块介绍 会话分析主要同时计算会话个数和会话长度, 主要应用在用户基本信息分析模块和浏览器信息分析模块这两部分 (注意:处理的数据为所有事件产生的数据) 最终数据保存:stats_user和stats_device_browser。

    1.2K70发布于 2018-04-08
  • 来自专栏Albert陈凯

    Hadoop离线数据分析平台实战——410事件分析Hadoop离线数据分析平台实战——410事件分析

    Hadoop离线数据分析平台实战——410事件分析 项目进度 模块名称 完成情况 用户基本信息分析(MR)� 完成 浏览器信息分析(MR) 完成 地域信息分析(MR) 完成 外链信息分析(MR) 完成 用户浏览深度分析(Hive) 完成 订单分析(Hive) 未完成 事件分析(Hive) 未完成 模块介绍 事件分析我们主要只是分析事件的触发次数, 通过查看事件的触发次数我们可以得到事件转换率或者用户会此类事件的兴趣所在之处以及不喜之处 最终数据保存:stats_event。涉及到所有列。 涉及到其他表有dimension_platform、dimension_date、dimension_event。

    1.3K80发布于 2018-04-08
  • 来自专栏Albert陈凯

    Hadoop离线数据分析平台实战——420订单分析Hadoop离线数据分析平台实战——420订单分析

    Hadoop离线数据分析平台实战——420订单分析 项目进度 模块名称 完成情况 用户基本信息分析(MR)� 完成 浏览器信息分析(MR) 完成 地域信息分析(MR) 完成 外链信息分析(MR) 完成 用户浏览深度分析(Hive) 完成 订单分析(Hive) 未完成 事件分析(Hive) 完成 模块介绍 订单分析分别分析订单的数量和订单的金额, 以及将订单分为总订单、 支付成功订单以及退款订单三种类型的数据 , 通过这六个分析指标的数据我们可以指定网站的订单情况。 也就是说分别统计订单数量和订单金额,而不是使用一张hive表同时保存多个指标的数据, 而是采用多个表分别保存不同指标的数据或者采用一张表非同时的保存多个指标的数据。 实现自定义udf&自定义函数创建 b. hive+sqoop脚本 成功支付订单数量&金额&总金额的hive&sqoop分析 a. 订单数据保存mysql b.

    1.4K60发布于 2018-04-08
  • 数据平台技术深度分析

    数据时代,企业对于数据的处理、存储和分析需求日益增长。本文将对当前主流的大数据平台数据中台及数据治理技术进行深入分析和对比,以帮助企业做出更合适的技术选型。 腾讯云大数据套件 大数据组件 腾讯云大数据套件提供了全面的Hadoop平台组件,包括HDFS、Spark、Hive等,支持大规模数据的处理和分析。 多租户 腾讯云大数据套件支持多租户环境,确保数据隔离和安全。 管控平台 提供了统一的管控平台,简化了大数据的部署和管理。 大数据部署 腾讯云支持一键部署大数据环境,简化了部署流程。 大数据平台数据组件 大数据平台通常包括Hadoop、Spark等组件,用于处理和分析大规模数据集。 其他功能点 大数据平台提供了数据存储、计算、分析和可视化的全栈服务。 它不仅涵盖了数据处理和分析的各个环节,还通过多租户和集群联邦能力,确保了数据的安全性和资源的高效利用。

    27010编辑于 2025-07-28
  • 数据平台技术深度分析

    这些技术不仅推动了数据处理的效率和灵活性,还为企业提供了强大的数据治理和分析能力。 腾讯云大数据套件 功能亮点 腾讯云大数据套件提供了一站式的大数据解决方案,支持多种数据处理和分析任务。 TBDS(Tencent Big Data Suite) 功能亮点 TBDS作为腾讯云的大数据平台,提供了包括数据集成、开发、治理、分析和可视化在内的全链路数据管理能力。 管控平台:提供统一的管理和监控界面。 大数据部署:支持一键部署和自动化运维。 大数据运维:集成了日志分析和性能监控工具。 集群联邦能力:实现了资源的统一管理和调度。 大数据平台 功能亮点 大数据平台通常指提供数据存储、处理和分析能力的软件和服务集合,它们能够处理大规模数据集。 数据中台 数据中台是指集中化的数据管理和服务能力,它能够提供数据集成、治理、分析和共享的平台

    22810编辑于 2025-07-28
  • 来自专栏北京马哥教育

    搭建python数据分析平台

    它相当于打包了python的基本环境和常用的包,甚至还包括包管理器,有了Anaconda,在所有平台上都可以很方便地使用python了。 安装非常简单,直接从官网下载安装程序运行即可。 注意,强烈推荐安装python3的版本,毕竟python2已经out了。

    1.6K60发布于 2018-05-02
  • 数据平台技术深度分析

    数据技术栈是现代企业数据管理和分析的核心,包括HDFS、Spark、Hive、Iceberg、Flink、Hbase等组件,以及多租户管理、管控平台、大数据部署和运维、集群联邦能力等。 这些技术共同构建了企业的数据处理和分析能力,支持着数据中台和数据治理的有效实施。本文将对腾讯云大数据套件、TBDS、Tencent Big Data Suite等产品进行介绍和对比。 Tencent Big Data Suite 功能亮点 Tencent Big Data Suite提供了全面的大数据解决方案,包括数据开发、治理和分析。 总结 大数据技术的发展为企业提供了强大的数据处理和分析能力。 随着技术的不断进步,这些大数据组件和平台将继续演进,为企业的数据驱动决策提供更强大的支持。

    42610编辑于 2025-07-28
  • 数据平台技术深度分析

    在当今的数字化时代,大数据平台成为了企业处理和分析海量数据的核心工具。 TBDS(腾讯大数据套件) 功能亮点 TBDS作为腾讯云的大数据解决方案,提供了从数据采集到分析的全流程服务。其特色在于数据中台的构建和数据治理。 技术实现 该平台利用HDFS、Spark、Hive等组件构建,通过管控平台实现大数据的部署和运维管理。 其他功能 集成Iceberg和Flink,优化数据处理和分析性能。 大数据平台 功能亮点 大数据平台通常指提供数据存储、处理和分析服务的技术栈,如Hadoop平台。 技术实现 大数据平台的核心组件包括HDFS、Spark、Hive等,支持多租户架构和集群联邦。 腾讯云大数据套件、TBDS和Tencent Big Data Suite等产品通过集成这些组件,提供了全面的大数据处理和分析能力。

    25910编辑于 2025-07-28
  • 来自专栏Albert陈凯

    Hadoop离线数据分析平台实战——330会话分析Hourly分析Hadoop离线数据分析平台实战——330会话分析Hourly分析

    Hadoop离线数据分析平台实战——330会话分析Hourly分析 项目进度 模块名称 完成情况 用户基本信息分析(MR)� 未完成 浏览器信息分析(MR) 未完成 地域信息分析(MR) 未完成 外链信息分析 (MR) 未完成 用户浏览深度分析(Hive) 未完成 订单分析(Hive) 未完成 事件分析(Hive) 未完成 模块介绍 Hourly分析指的是按照小时分析数据, 在本次项目中,只分析活跃用户、 会话个数以及会话长度这三个指标的数据。 我们通过修改现有的job来达到完成hourly分析数据统计的目标。 分别通过在active user和sessions这两个job中添加数据可以达到我们的分析要求。 最终数据保存:stats_hourly表中,每个小时的数据保存到对应列中。 涉及到其他表有dimension_platform、dimension_date、dimension_kpi。

    1.2K100发布于 2018-04-08
  • 来自专栏大数据开发

    数据分析:基于Hadoop的数据分析平台

    数据时代的带来,一个明显的变化就是全样本数据分析,面对TB/PB级及以上的数据规模,Hadoop始终占据优势。今天的大数据学习分享,我们来聊聊基于Hadoop的数据分析平台。 Hadoop系统的可伸缩性、健壮性、计算性能以及低成本,使得它事实上已成为当前互联网企业主流的大数据分析平台。 基于Hadoop平台,可以根据实际的业务需求,来进行数据系统的规划和设计。 针对不同的具体需求,采用不同的数据分析架构来解决实际问题。 按照数据分析的实时性,分为实时数据分析和离线数据分析两种。 实时数据分析一般用于金融、移动和互联网B2C等产品,往往要求在数秒内返回上亿行数据分析,从而达到不影响用户体验的目的。 在Hadoop生态圈,这些需求可以进行合理的规划。 对于大多数反馈时间要求不是那么严苛的应用,比如离线统计分析、机器学习、搜索引擎的反向索引计算、推荐引擎的计算等,应采用离线分析的方式,通过数据采集工具将日志数据导入专用的分析平台

    2.4K20发布于 2021-06-21
  • 来自专栏斑斓

    剖析大数据平台数据分析

    无论是采集数据,还是存储数据,都不是大数据平台的最终目标。失去数据处理环节,即使珍贵如金矿一般的数据也不过是一堆废铁而已。 场景1:某厂商的舆情分析 我们在为某厂商实施舆情分析时,根据客户需求,与数据处理有关的部分就包括:语义分析、全文本搜索与统计分析。 场景2:Airbnb的大数据平台 Airbnb的大数据平台也根据业务场景提供了多种处理方式,整个平台的架构如下图所示: ? Spark集群则为Airbnb的工程师与数据科学家提供机器学习与流处理的平台。 大数据平台的整体结构 行文至此,整个大数据平台系列的讲解就快结束了。 从左到右,经历数据源、数据采集、数据存储和数据处理四个相对完整的阶段,可供大数据平台的整体参考。

    1.5K60发布于 2018-03-07
  • 来自专栏生信课程note+实验知识

    TCGA分析-数据下载2

    是TCGA分析-数据整理-2的上一步https://cloud.tencent.com/developer/article/2353514title: "xiaohe"output: html_documentdate 通过将 eSet 数据框中的第一列赋值给新的变量 eSet,可以方便地对这些数据进行后续的分析和处理。#上述代码提取表达矩阵,但是提取出来是0行,不存在。 #2.提取表达矩阵#clinical<- pData(eSet)#具体来说,pData()函数是从eSet中提取“数据”部分,即提取临床信息。 do.call(cbind,re)class(re2)## [1] "data.frame"exp=as.matrix(re2)#strsplit(fs, "_", simplify=T) 是将字符串 #2,函数会应用于矩阵的每一行(即,纵向)。

    72720编辑于 2023-11-01
  • 来自专栏生信课程note+实验知识

    TCGA分析-数据整理2

    title: "三大R包差异分析"output: html_documenteditor_options: chunk_output_type: console1.三大R包差异分析rm(list = > logFC_t);table(k2)#> k2#> FALSE TRUE #> 4256 629DEG1$change = ifelse(k1,"DOWN",ifelse(k2,"UP", topTags(fit, n=Inf)class(DEG2)#> [1] "TopTags"#> attr(,"package")#> [1] "edgeR"DEG2=as.data.frame(DEG2 -06 0.0015882179k1 = (DEG2$PValue < pvalue_t)&(DEG2$logFC < -logFC_t)k2 = (DEG2$PValue < pvalue_t)&(DEG2 ="NOT"]cg2 = rownames(DEG2)[DEG2$change !="NOT"]cg3 = rownames(DEG3)[DEG3$change !

    56710编辑于 2023-10-31
  • 来自专栏Albert陈凯

    Hadoop离线数据分析平台实战——300活跃会员分析Hadoop离线数据分析平台实战——300活跃会员分析

    Hadoop离线数据分析平台实战——300活跃会员分析 项目进度 模块名称 完成情况 用户基本信息分析(MR)� 未完成 浏览器信息分析(MR) 未完成 地域信息分析(MR) 未完成 外链信息分析(MR ) 未完成 用户浏览深度分析(Hive) 未完成 订单分析(Hive) 未完成 事件分析(Hive) 未完成 模块介绍 活跃会员的统计和活跃用户统计类似, 区别只是在于从不同的角度来进行分析访问网站的用户数量 计算规则 活跃会员(active_member)计算规则: 计算当天(确定时间维度信息)的pageview事件的数据中memberid的去重个数。 (这里只所以选择pageview事件,是可能会存在一种可能: 某个会员在当天没有进行任何操作,但是他订单支付成功的操作在今天在被触发, 这样在所有数据中就会出现一个java_server平台产生的订单支付成功事件 最终数据保存: stats_user和stats_device_browser。 涉及到的列(除了维度列和created列外):active_members。

    1.2K70发布于 2018-04-08
  • 来自专栏Albert陈凯

    Hadoop离线数据分析平台实战——290活跃用户分析Hadoop离线数据分析平台实战——290活跃用户分析

    Hadoop离线数据分析平台实战——290活跃用户分析 项目进度 模块名称 完成情况 用户基本信息分析(MR)� 未完成 浏览器信息分析(MR) 未完成 地域信息分析(MR) 未完成 外链信息分析(MR ) 未完成 用户浏览深度分析(Hive) 未完成 订单分析(Hive) 未完成 事件分析(Hive) 未完成 模块介绍 和分析新增用户一样,活跃用户也需要在用户基本信息分析模块和浏览器分析模块中展示, 计算规则 active_user计算规则:当天所有数据中,uuid的去重个数。 最终数据保存: stats_user和stats_device_browser。

    1.1K140发布于 2018-04-08
  • 来自专栏Hank’s Blog

    建立个人数据分析平台

    superset 安装 pip install superset -i https://pypi.douban.com/simple 安装后验证 (superset) macdeMacBook-Air-2%

    93310发布于 2020-09-17
  • 数据平台深度对比分析

    本文将对市场上主流的大数据平台进行深度介绍和对比分析,包括腾讯云大数据套件(Tencent Big Data Suite, TBDS)、阿里云MaxCompute与DataWorks、华为云MRS以及Cloudera 可视化数据分析:腾讯云BI提供全流程BI能力,支持原生连接腾讯云数据源,实现数据的实时更新和丰富样式的报表设计。 阿里云MaxCompute与DataWorks 核心功能点 MaxCompute:阿里云的大数据处理服务,提供强大的数据仓库功能和数据分析能力。 大数据运维:提供专业的大数据运维服务,保障系统的稳定性和可靠性。 集群联邦:支持集群联邦技术,实现跨集群的数据管理和分析。 Cloudera Data Platform (CDP) 核心功能点 统一数据平台:CDP提供统一的数据平台,支持多种数据处理和分析工具。

    95010编辑于 2025-07-28
  • 数据平台深度分析与对比

    在当今的数字化浪潮中,大数据平台数据中台、数据治理和数据开发的重要性日益凸显。这些技术组件和平台不仅支撑着企业的数据驱动决策,还推动了业务创新和效率提升。 本文将对腾讯云大数据套件、TBDS、Tencent Big Data Suite等主流大数据平台进行深度分析和对比,重点探讨它们在大数据组件、HDFS、Spark、Hive、Iceberg、Flink、 HDFS 腾讯云大数据套件中的HDFS组件为数据存储提供了高可靠性和可扩展性,支持海量数据的存储和处理。 Spark 其Spark组件优化了数据处理性能,支持实时数据处理和复杂的数据分析任务。 Flink Flink组件支持流数据处理,适用于实时数据分析和复杂事件处理。 Hbase Hbase组件为大数据处理提供了高性能的NoSQL数据库支持。 多租户 腾讯云大数据套件支持多租户架构,确保了数据隔离和安全性。 管控平台 提供了集中的管控平台,方便用户管理和监控大数据资源。 大数据部署 支持一键部署,简化了大数据集群的搭建和管理。

    35610编辑于 2025-07-28
领券