首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏深度学习与python

    一文看懂业界在离线技术

    (注:离在线计划另文阐述) 图 1 示意图 在离线的成本价值 为了更形象的了解在离线的成本价值,我们来看一个中小型企业,4 核 8G 的机器一共有 1000 台,主要计算资源就是 比较典型的是字节跳动的方案,架构图如下所示: 图 4 字节跳动在离线架构图 字节跳动依托于 K8s 与业务 quota 做整机腾挪的在离线,以集群转让节点的方式提高整体资源利用率,主要实现思路为 字节跳动的方案基于公司自身的业务复杂度, 使用自定义 quota 而没有使用 K8s 通用的 hpa;部署方式两阶段:白天离线作业机器给在线服务使用, 晚上在线服务器转让给离线作业使用;仅支持容器部署 比较典型的是百度、腾讯、快手的方案,这里以腾讯方案为例: 图 4 腾讯 Caelus 系统架构图 腾讯在离线系统 Caelus 以 K8s 为依托,在 K8s 节点以容器的方式部署离线任务,实现在线服务节点转让资源给离线作业 BridgX:算力调度引擎,在算力层面为在离线提供基础的算力调度能力,包括跨云调度能力、K8s 容器及大规格裸金属服务器切割能力以及快速弹性伸缩能力。

    1.9K31编辑于 2022-03-22
  • 来自专栏腾讯云原生团队

    今晚直播 | 腾讯基于 K8s 的全场景在线离线解决方案

    腾讯大数据,基于多年在混技术积累的实践经验与基于 Kubernetes 的全场景在线离线解决方案,对 K8s 零入侵,兼容各种场景(容器化、非容器化等),已经在腾讯内部业务多方落地,节约了上亿成本 揭秘有状态服务上  Kubernetes 的核心技术 6月直播专场来了|腾讯基于 K8s 的全场景在离线技术实践 Dapr | 云原生的抽象与实现 用 edgeadm 一键安装边缘 K8s 集群和原生 K8s 集群 使用 Velero 跨云平台迁移集群资源到 TKE ?

    63720发布于 2021-06-17
  • 来自专栏腾讯大数据的专栏

    Caelus—全场景在离线解决方案

    这些方案提出了很多很好的思想,我们也借鉴吸收,如Heracles中资源配置方案,但我们也看到其中的不足,如:1)基于厂商专有自研平台,不是云原生生态,2)对k8s云原生进行定制化改造,不利于开源 基于上述因素,我们决定打造一个基于云原生的在线离线平台(Caelus),零入侵k8s,可移植,覆盖多场景,适用于大规模集群。 Caelus架构 Caelus在线离线架构设计如图3: ? 同时降低对应用的依赖,用户零感知,还要兼容k8s和hadoop生态。具体介绍如下:  1、k8s零入侵 的设计前提是不入侵k8s原生代码逻辑。 大数据on k8s,是直接支持的,对于大数据on Yarn,Caelus也是兼容的。 各家大厂都对投入了相当长的时间研究,才开始放量铺开。随着技术的发展,k8s也越来越成熟,将来也会有更多的场景落地。

    10K71发布于 2020-12-14
  • 来自专栏腾讯云原生团队

    今日Qcon热门分享|腾讯K8s大规模离在线与内核隔离实践

    专题演讲嘉宾 徐蓓 腾讯云专家工程师 11年软件架构与研发经验,其中7年云计算经验,在 IaaS、PaaS、离在线和云原生大数据领域有丰富的研发与落地经验。 Kubernetes 集群下通过技术将在线与离线业务混合部署在一起,以统一调度与提升资源利用率。 分享提纲: 1.腾讯云原生离在线背景、现状及发展趋势 2.腾讯 Kubernetes 隔离架构与实践 腾讯基本原理与核心架构 利用负载预测实现资源超卖 利用资源 QoS 框架实现资源隔离 利用 batch 调度加速调度性能 3.腾讯自研内核隔离技术与实践 CPU 隔离 内存隔离 IO/网络隔离 Quality Monitor 4.技术未来展望 听众收益: 1.了解资源隔离的关键技术 ② 资源利用率提升工具大全 ③ 基于K8s 扩展机制构建云上成本控制系统 后续持续更新中。。。

    1.7K40发布于 2021-05-31
  • 来自专栏腾讯云原生团队

    6月直播专场来了|腾讯基于 K8s 的全场景在离线技术实践

    6月初初到来,我们集结了一批技术专家,为技术爱好者们精心策划了一场大数据云原生专场——腾讯基于K8s的全场景在离线技术实践。 腾讯大数据,基于多年在混技术积累的实践经验与基于 Kubernetes 的全场景在线离线解决方案,对 K8s 零入侵,兼容各种场景(容器化、非容器化等),已经在腾讯内部业务多方落地,节约了上亿成本 · 直播流程 · 19:30-20:15 讲师分享  20:15-20:30 互动问答 · 听众收益 · 了解云原生场景下在线离线的意义、全场景,及设计原则; 了解Caelus方案的整体设计思路 直播主题:K8s 高性能调度器设计与实现 直播时间:2021年6月29日19:30—20:30 · 讲师介绍 · ? · 直播流程 · 19:30-20:15 讲师分享  20:15-20:30 互动问答 · 听众收益 · 了解在离线场景中调度系统的需求与痛点 了解在离线场景中调度系统的整体设计思路,离线调度器的整体架构与优化点

    1.3K20发布于 2021-06-10
  • 来自专栏深度学习与python

    4 个月节省千万成本的机器学习实践

    在今年 9 月份的 QCon 全球软件开发大会(北京站),贝联珠贯 (www.lccomputing.com) 合伙人王元良老师以《增强型 RunC 的最佳实践:克服离线高压力场景的关键挑战》为题, 统一语言,让 K8s、YARN 读得懂资源信息 想要做到事前预防,首先要解决的就是建立单机 (Linux kernel) 与分布式 (K8s) 之间的高效沟通。 二级告警,LCC-Agent 通知 NM NM 会调整心跳时间 NM 会根据任务的优先级,优先 KILL 低优先级任务 三级告警,LCC-Agent 直接 kill 非白名单进程 机器夯死问题得到解决,解决掉最关键的资源卡点问题 集群维度感知,先于业务发现问题 前期为了了解客户集群中的各种资源问题状态,我们采用手动脚本单台机器日志并聚类的方式来拿到结果;这种方式耗时长 (两周一次)、只能分析问题大类、没法观察问题走势和分布等 后单机压力与复杂度指数级上升,需要高频全视角的分析问题,这种方式不再适用。需要一套能分钟级展示、多视角、自动聚类分析的手段,包括时间对比、子系统分布、问题大类、问题子类、业务角度等。

    86910编辑于 2023-10-02
  • 趣丸科技基于TKE集群的实践:CPU利用率从8%提升至50%以上

    应对在线业务潮汐与资源闲置的行业挑战 社交与电竞业务存在显著的流量波峰波谷,导致趣丸科技全网主机CPU平均利用率长期低于10%(实际为8%)。 采用调度优先、隔离为辅的云原生方案 趣丸科技依托腾讯云TKE容器服务,构建了以TTSet调度系统为核心、TencentOS Server提供节点级隔离能力的三层架构解决方案。 实现资源利用率的大幅提升与成本优化 方案实施后,集群CPU利用率从8%提升至50%以上。在业务高峰时段(如17:00、21:00),CPU利用率可稳定在65%,同时保证了在线业务的稳定性。 “依托于云,拥抱社区,通过调度优先、隔离为辅助的总体方案,我们成功实现了高效的资源。”

    16510编辑于 2026-05-30
  • 来自专栏云计算技术笔记

    谷歌Borg论文阅读笔记(二)—— 任务和资源隔离

    相关笔记:谷歌Borg论文阅读笔记(一)—— 集群操作系统 Google的情况 Google几乎所有的机器都是的,在一台机器上,可能运行着不同jobs的tasks。 这里主要讲的是Google对任务对CPU性能影响的研究。 Google为了评估不同任务部署到同一个机器的CPU干扰影响做了一个实验。 资源分类 的一大问题是某个资源不足的情形。但是,不同的资源有不同的特点,有的资源能快速调整,而有的则需要很大的代价来调整。 在内存不足的时候,Linux会进行内存回收,释放PageCache,将匿名页调入Swap。 如果还是没有足够的内存,会进入OOM-KILL流程。这个代价是很大的。 总结 应用,尽可能使用多线程。 使用轻量级的隔离机制,而不是VM。 合理的对资源超分配,以此提高资源利用率。很多任务并不是任何时刻都会用到很多资源。 对任务和资源进行分级。

    1.2K30编辑于 2022-09-07
  • 来自专栏Pengcheng's Blog

    MySQL8

    3306 3、解压安装包 #进入mysql目录 #解压 tar -xvf mysql-8.0.20-1.el7.x86_64.rpm-bundle.tar 4、安装 此处内容需要评论回复后方可阅读 8

    51520编辑于 2023-05-02
  • 趣丸科技基于TKE与TTSet方案将CPU利用率从8%提升至50%以上

    在混实践前,趣丸科技全网主机CPU利用率仅为 8%。 构建基于TKE与TTSet的三层调度体系 趣丸科技采用了“依托于云,拥抱社区”的策略,确立“调度优先、隔离为辅助”的总体方案,通过以下技术架构实现: 集群级调度优化:自研 TTSet调度系统 核心指标提升与资源模型验证 通过实施上述方案,趣丸科技在资源利用上取得了以下量化成果: 利用率提升:全网主机CPU利用率从 8% 提升至 50%以上。 “依托于云,拥抱社区,调度优先、隔离为辅助的总体方案,让我们成功将全网主机CPU利用率从8%提升到50%以上。”

    19710编辑于 2026-05-30
  • yolov8署ROS

    为了将Yolov8署到ROS中,需要进行一些配置和修改。首先,需要安装ROS melodic或Noetic版本,并确保Python版本为3.6.0及以上。 总之,将Yolov8署到ROS中需要一定的技术和经验,但通过仔细的配置和优化,可以实现高效、准确和快速的目标检测功能,为机器人的智能化提供有力支持。 yolov8-ros部署测试环境: 虚拟机中ubuntu18.04 python3.6.9 详情可以看视频: yolov8署在ros机器人操作系统视频演示_哔哩哔哩_bilibili这个是使用最新版本 yolov8署在ROS机器人操作系统演示,演示环境是虚拟机环境ubuntu18.04,调用笔记本摄像头进行演示。 , 视频播放量 21、弹幕量 0、点赞数 1、投硬币枚数 0、收藏人数 1、转发人数 0, 视频作者 未来自主研究中心, 作者简介 未来自主研究中心,相关视频:yolov5-7.0署在ros机器人操作系统视频演示

    69310编辑于 2025-07-17
  • 来自专栏腾讯云原生团队

    之殇-论云原生资源隔离技术之CPU隔离(一)

    导语 ,通常指在离线(也有离在线之说),意指通过将在线业务(通常为延迟敏感型高优先级任务)和离线任务(通常为 CPU 消耗型低优先级任务)同时混合部署在同一个节点上,以期提升节点的资源利用率 (混合部署)因此应运而生。这里的“”,本质上就是“区分优先级”。狭义上,可以简单的理解为“在线+离线”(在离线),广义上,可以扩展到更广的应用范围:多优先级业务混合部署。 (通常)由上层的资源编排/调度框架(典型如 K8s)提供,打算另做系列文章展开,敬请期待。 相关技术起源甚早,颇有渊源,大名鼎鼎的 K8s(前身 Borg)其实源于 Google 的场景,而从的历史和效果看,Google 算是行业内的标杆,号称 CPU 占用率(均值)能做到60%,具体可参考其经典论文 不太适合(云原生)场景。 本质还是:Core scheduling 亦非为云原生场景而设计。 结论 综合前面的分析,可以抽象的总结下当前现有的各种方案的优点和问题。

    4K94发布于 2021-05-10
  • 来自专栏腾讯开源的专栏

    助力成本优化,腾讯全场景在离线系统Caelus正式开源

    对此,业内一直在进行诸多探索,在线离线被认为是解决该问题的终极方案。 .大部分系统只针对云原生场景,无法利用大量非容器化的在线空闲资源; 2. 调度器缺乏在离线应用调度的兼容性、高性能以及SLA保证。 解决这些问题,也是Caelus研发的初衷。 充分兼容的架构设计 Caelus为了适应各种的场景,遵循了几个关键原则,主要包括: 1. 不改变业务使用方式,便于业务迁移到Caelus平台。 比如大数据任务仍然可以使用原有的方式提交job,如果原来是Yarn,Caelus实现了Yarn on k8s。如果大数据已经是on k8s的方式,也可以更方便的使用统一调度; 2. 对基础生态零入侵。

    84341发布于 2021-11-18
  • 来自专栏腾讯大数据的专栏

    助力成本优化,腾讯全场景在离线系统Caelus正式开源

    对此,业内一直在进行诸多探索,在线离线被认为是解决该问题的终极方案。 ,限制了可以的场景; 在内核层、容器层缺乏完善的资源隔离、热迁移等机制,导致容易发生干扰,且处理干扰代价高; 调度器缺乏在离线应用调度的兼容性、高性能以及SLA保证。 解决这些问题,也是Caelus研发的初衷。 充分兼容的架构设计 Caelus Caelus为了适应各种的场景,遵循了几个关键原则,主要包括: 不改变业务使用方式,便于业务迁移到Caelus平台。 比如大数据任务仍然可以使用原有的方式提交job,如果原来是Yarn,Caelus实现了Yarn on k8s。如果大数据已经是on k8s的方式,也可以更方便的使用统一调度; 对基础生态零入侵。

    1.6K40发布于 2021-11-10
  • 来自专栏腾讯云原生团队

    TKE 算力集群:新一代跨集群资源引擎

    针对上述难题,业界公认的解决方式是 “在离线”技术(如 Koordinator,Caelus,Katalyst,Crane)。 但并非“银弹”,当企业将能力从单个集群扩展到全局多个集群时,资源仍然被物理集群边界锁死。 缺乏拓扑感知:虚拟节点抽象屏蔽了 NUMA、Zone 等底层细节,破坏了 K8s 原生的拓扑约束,可能导致 I/O 延迟增加或性能下降 。 方案默认集成了多集群资源管理、Crane 扩展调度 、隔离保障的 RUE 内核以及超大规模集群管控功能,全面降低用户在跨集群管理、资源调度和在离线上的维护复杂度。 为支撑高性能计算、数据处理等超大规模业务场景,TKE 全面增强了 k8s 控制面的处理能力。

    1.3K20编辑于 2025-10-31
  • 来自专栏腾讯云原生团队

    qGPU 容器产品全量上线,重磅发布 GPU 在离线功能

    徐蓓,腾讯云容器技术专家,腾讯云异构计算容器负责人,多年云计算一线架构设计与研发经验,长期深耕 Kubernetes、在离线与 GPU 容器化领域,Kubernetes KEP Memory QoS 除此之外,腾讯云 qGPU 创新性的将在离线混合部署技术与 GPU 相结合,在业界首次实现了 GPU 在离线的方案,将 GPU 容器共享技术推进到了下一个纪元。 在线业务通常指推理业务,离线业务可能是推理、也可能是训练,于是在离线主要形式有 推理 + 推理、推理 + 训练。 在具备 qGPU 在离线能力之后,用户可以安全地将在线业务与其他业务部署在同一张 GPU 卡,在共享复用资源的同时,可以完全保障在线业务健康、稳定运行。 可以说,腾讯云 qGPU 在离线是提升 GPU 利用率的创新性的突破技术。

    1.7K30编辑于 2022-03-10
  • 来自专栏腾讯云原生团队

    年终大禧 | 腾讯云 Crane 国内首批通过云原生技术评估

    2023 年 1 月 9 日云原生产业联盟(CNIA)举办 2022 年度线上年会,中国信通院云大所云计算发布了云原生系列测评成果,腾讯云主导开源的云原生成本优化项目 Crane 首批通过“云原生” 腾讯云自 2015 年起在混领域进行探索,在支撑海量自研业务上云的过程中广泛使用。目前管理规模已达数千万核,能力使服务器资源利用率从30% 提升至 65%。 云原生解决方案依托容器、微服务、平台编排调度等云原生技术,帮助用户将业务负载与大数据分析、人工智能计算等不同优先级的应用混合部署到共享的基础设施上,提高资源利用率,实现“降本增效”。 在此背景下,中国信通院牵头,联合腾讯云等多家云服务商,经过多轮研讨,形成了《云原生技术能力要求》标准。 标准涉及基础设施能力要求、平台能力要求、业务应用能力要求,以及效果评价四个部分,从资源隔离、资源复用、干扰检测、负载反馈、任务调度、资源预测、应用服务质量等不同维度,对产品及解决方案进行全面评估

    1.8K30编辑于 2023-01-30
  • 来自专栏腾讯云原生团队

    【云原生下离在线实践系列】深入浅出 Google Borg

    作者徐蓓,腾讯云专家工程师,长期从事云计算 IaaS、PaaS 架构和研发工作,现负责腾讯云 TKE 资源调度、离在线、大数据云原生化等领域。 Google Borg 是资源调度管理和离在线领域的鼻祖,同时也是 Kubernetes 的起源与参照,已成为从业人员首要学习的典范。 Isolation 由于 Google Borg 天生就考虑场景,所以资源隔离对其尤为重要。 Google Borg 作为 Google 内部的经验结晶,系统的阐述了应有的基本形态,很有启发意义。 后续会持续分享相关的理论和实战经验。

    2.3K21发布于 2020-05-26
  • 来自专栏云原生

    腾讯云Serverless容器实战(如何提升集群利用率至65%)

    本文将深入剖析腾讯云团队如何借助Serverless容器技术与深度策略,在保障核心业务SLA的前提下,将生产集群利用率稳定提升至65%以上,并分享实战中沉淀的关键技术与踩坑经验。 Master组件,团队聚焦业务逻辑图1:Serverless容器核心架构。 四、稳定性守卫:多维熔断与逃生机制的最大风险在于资源争抢导致在线业务抖动。 五、效果验证:从理论到生产的数据飞跃在日均百亿请求的电商核心集群落地方案:指标 后 提升幅度集群CPU利用率 22% 68% 方案需结合业务特性深度调优,不可直接复制参数。

    71310编辑于 2025-07-08
  • 来自专栏实时音视频TRTC从小白到熟练

    实时音视频开发学习8 - 云端流转码

    流方式为MCU流转码集群,其能将多路音视频流进行混合,并将最终生成的视频流分发给直播CDN和云端录制系统。 d.最多两列,每列最多8个小画面。最多支持1个大画面和15个小画面。 e.如果用户只发送音频,仍然会占用画面位置。 代码生成 通过访问StopMCUMixTranscode平台,可以快速配置MCU流输出流编码参数、流布局以及MCU流输出流编码参数等。 由于云端流的本质是将多路流混合到当前(即发起流指令的)用户所对应的音视频流上,因此当前用户本身必须有音频上行才能构成流的前提条件。 由于云端流的本质是将多路流混合到当前(即发起流指令的)用户所对应的音视频流上,因此当前用户本身必须有音视频上行才能构成流的前提条件。

    2.7K51发布于 2020-08-25
领券