首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏SRE运维进阶之路

    K8s 集群巡检

    上次发文 K8s 无备份,不运维!,文章开篇,插入了一张 K8s 集群巡检的图片,好多小伙伴私信留言,问我要开源地址。 什么是平台巡检 平台巡检是一种监测和评估底层系统运行状况的工具,可帮助您快速发现系统中存在的潜在风险并给出相应修复建议。 巡检的意义 我反复思考,有了 metrics/logs/traces + grafana + alert ,还需要巡检做什么? VictorMetric 等组件的状态,拉取最新数据情况,监控是否收集了各个组件的 metrics 是主动式的发现问题,能迅速了解整个集群的核心指标的状态,集中式检查,不用一个个 Grafana 图标检查 K8s 、prometheusOr、prometheusList 四种 bash 对应放置在 K8s Master 节点上指定目录下的 bash 脚本,脚本中有两行返回值,一行是具体结果,一行是正常 Or 异常

    83610编辑于 2024-08-27
  • 来自专栏腾讯云智能顾问

    【云顾问-云巡检】聚焦架构风险,助力卓越治理

    云顾问云巡检功能一直以来着力于打造云上隐患风险发现能力,当前版本已结合云架构可视化能力,全面升级助力客户聚焦云上架构五大类型风险,持续治理优化打造卓越架构! · 当前已上线云巡检插件,在架构图“治理视图”中可随时启用,全面巡检隐患风险。· 聚焦安全、可靠、性能、成本、服务限制 5 大类别巡检项,支持按架构业务特性启停、定制。 · 即时生成巡检报告,聚焦架构相关风险和趋势呈现,治理成果和进展可随时归档到“数字资产”,也可下载、分享。 · 【即将上线】基于自动巡检和各 region 资源自动生成架构图和风险可视化视图,提升架构绘制和治理效率。(敬请期待,相关问题欢迎联系我们)欢迎立即访问云顾问,体验云巡检!

    1.1K10编辑于 2024-07-15
  • IT自动化巡检怎么做?从巡检策略、风险控制到异常闭环的技术实践

    低风险、标准化操作可以自动处置;涉及业务风险的动作则应该进入审批流程。这也是自动化巡检与自动化运维平台结合后的真正价值:巡检负责发现问题,自动化负责执行标准动作。 六、安全控制为什么是巡检平台的核心指标巡检通常需要远程执行脚本,因此存在高危命令和权限风险。安全控制至少需要包含:高危命令识别;脚本版本管理;执行权限隔离;审批流程;全过程审计。 九、如何评价自动化巡检是否有效指标一:巡检覆盖率统计实际纳管对象与应巡检对象的比例,而不是只看任务执行次数。指标二:执行成功率检查巡检任务是否能够稳定完成。脚本大量失败会直接影响结果可信度。 技术标签自动化巡检、自动化运维、IT运维、巡检平台、智能巡检、基线核查、补丁管理、Web页面巡检、信创运维、CMDB发布前风险检查结果广告风险:通过。未设置厂商推荐或产品营销内容。引流风险:通过。 榜单风险:通过。未使用TOP、十大、最好等排名表达。重复风险:通过。结构已重构为“问题—原理—实践—验证—局限”。事实风险:通过。未新增具体数据,产品相关信息均来自原始材料。

    16410编辑于 2026-09-09
  • 来自专栏互联网-小阿宇

    k8s-主节点巡检脚本

    033[42;37m" f="\033[43;37m" g="\033[44;37m" h="\033[45;37m" q="\033[46;37m" echo -e "$h=========本脚本适用K8S 主节点&作者:小韩======"$e echo -e "$a--------自动巡检开启--请把你的小手拿走--" $e linux=$(cat /etc/redhat-release) echo -e kubelet服务状态为正常 else echo -e "$c----Kubelet服务状态异常--请进行检查---" $e #否则kubelet服务状态为异常 fi echo -e "$a----查看K8s 集群状态----"$e #查看k8s集群状态 K8s=$(kubectl get nodes | grep Ready | wc -l) #进行查询k8s集群节点为正常状态的节点 echo - e "$c----K8s集群节点状态为Ready的数量为:$K8s" $e echo -e "$a----查看Etcd集群健康状态----" $e Etcd=$(kubectl get cs | grep

    79230编辑于 2022-11-21
  • 来自专栏运维之路

    风险感知场景(一)之“监控、拨测、巡检、可观测性”

    从发现风险角度,我们经常会从监控、拨测、巡检、可观测性、演练、混沌工程等角度发现风险。 4.巡检 巡检是主动对IT运行风险的评估发现,包括常规巡检与深度巡检,前者是高频、例行的分析,通常融入到常规运维流程;后者主要从成本角度区别于常规巡检,比如加大评估分析面、分析深度、预测分析、协同范围 、问题跟踪等,通常深度巡检带有一定的风险分析主题。 巡检的目标是“主动评估风险”,强调的是一种主动发现风险的数字化思维模式与组织协同文化。 巡检:目标是“主动评估风险”,从风险角度重点关注健康质检,或更深度或广度风险评估,包括多个“点”组合的“面”,偏主动。

    5.1K10编辑于 2022-11-16
  • PL-YOLOv8:基于YOLOv8的无人机实时电力线检测与植被风险预警框架,实现精准巡检与预警

    【导读】传统电力巡检又慢又累还看漏,AI+无人机如何搞定? 这篇论文提出了一个基于前沿YOLOv8的实时检测框架,不仅能用无人机一眼精准锁定细如发丝的电力线,还能当场算出身旁植被的“危险系数”,把山火风险扼杀在萌芽中。 检查如此庞大的基础设施既费力又耗时,依赖于传统方法,如人工巡检和直升机巡查,这些方法已使用数十年。地面巡检可以进行彻底评估,但速度慢且成本高,而直升机巡查可以快速覆盖更多区域,但检测精度较低。 这两种方法都严重依赖人眼视觉观察,增加了漏检或误判的风险。本文提出了一种基于无人机图像的自动实时电力线检测框架。 这一结果证明了所提出的植被侵扰度量在有效识别潜在风险方面的有效性。

    88710编辑于 2025-09-03
  • 靠人工巡检撑着的合规,就是银行最大的隐形风险

    靠人工巡检撑着的合规,看似万无一失,实则危机四伏。一、人工巡检:合规的“纸糊城墙”“数十个设备巡检,需要手工输入账号、密码登录设备,手工完成信息采集和汇总。”“手动执行步骤复杂,耗时耗力效率低。” 二、表面合规,才是最大的风险“人工操作繁琐,耗时耗力效率低。”这句话的背后,是无数运维人员的心酸。但比这更可怕的是——为了应付检查而“做样子”。 三、自动化才是合规的真正“护城河”“自动化巡检确保100%覆盖且数据不可篡改。”一个自动化合规巡检平台,能做到人工巡检做不到的三件事:第一,100%覆盖,不漏一个。 同时,自动化合规巡检可以将等保2.0、行业专项合规等标准化模板内置,巡检过程自动校验合规性,生成带操作留痕的合规报告,满足金融行业严格审计要求。四、写在最后靠人工巡检撑着的合规,不是合规——是“赌”。 别让人工巡检,成为银行最大的隐形风险。

    11200编辑于 2026-08-31
  • 银保监现场检查,运维拿不出完整巡检记录,当场记风险点

    风险点当场记录在案,整改通知书随后送达,而最可怕的不是罚款本身,而是这个风险点会同步到机构评级、业务审批、乃至下一年度的监管频次中——影响深远、代价沉重。一、一张缺失的巡检记录,是如何变成风险点的? 任何一个环节出现漏洞——一段记录的缺失、一个资产被遗漏、一个“正常”背后没有截图支撑——都可能被定性为“巡检制度执行不到位,信息科技风险管控存在隐患”,作为风险点写入检查底稿。 一个完整、连续、可追溯的巡检台账,是你向监管机构证明“信息科技风险可控”的最直接的证据。不要等到检查人员坐在会议室里,你才发现那个月的巡检记录有5天空白,或者那台核心数据库的检查结果丢失了截图。 在超自动化巡检时代,这样的风险点完全可以通过一次工具升级来规避——让系统自动记录每一次检查,让监管审查时,你能拿出没有任何漏洞的完整台账。 让每一次检查都有据可查,不给风险点留下任何模糊地带——这是超自动化巡检,对银保监合规最直接的承诺。

    21200编辑于 2026-07-08
  • 来自专栏东隅已逝

    MySQL巡检

    操作系统层面 cpu监控 1[root@zst data]# sar -u 10 3Linux 2.6.32-642.el6.x86_64 (zst) 09/22/2017 _x86_64_ (8 0.03 93.40 内存监控 1[root@zst data]# sar -r 10 3Linux 2.6.32-642.el6.x86_64 (zst) 09/22/2017 _x86_64_ (8 18774068 37.81 I/O监控 1[root@zst data]# sar -b 10 3Linux 2.6.32-642.el6.x86_64 (zst) 09/22/2017 _x86_64_ (8 MySQL本身 MySQL本身的监控应该包含重点参数的检查,MySQL状态的检查,除此以外还应该包含自增id的使用情况(小心因为自增id使用满了 不能insert写入从而引发报警哦),及主从健康状态的巡检 中间件的巡检 mycat && proxysql 这些中间件的巡检,首先参考系统巡检,再看一下中间件本身的日志类和状态类信息,网络延迟或丢包的检查,也是必须要做工作。

    2.2K40发布于 2019-12-12
  • 来自专栏杨建荣的学习笔记

    业务巡检-系统巡检该怎么做

    系统巡检是对于服务巡检的第一站,所以在这里我们要做好第一班岗,如果系统巡检稀里糊涂,那么后续的数据库服务巡检效果也会大打折扣。 对于系统巡检整体上有如下的一些部分需要注意: ? 可能整体看起来没有太深入的理解,但是和实践结合起来就有很多的注意事项,我们就以硬件信息-ILO状态检查为例来提供一种巡检思路,iLO(Integrated Lights-Out)服务基于惠普的远程控制卡服务 对于iLO服务,我们需要做如下的巡检: (1) 检查ILO可用性和使用情况 (2) ILO模块是否开启 (3) iLO密码检查 (4) iLO超过最大用户连接数限制检查 (5) iLO在不同的硬件产品版本和浏览器的兼容性 在主机层面需要注意如下的两点: (1) 操作系统版本 操作系统的版本也需要提前规划,如果有些服务的版本过旧,需要考虑升级到一个较新的稳定版本,比如RedHat 5是个相对较旧的版本,需要尽可能升级到6U8以上版本

    3.3K20发布于 2019-05-13
  • 来自专栏用户6465593的专栏

    设备巡检的痛点和巡检方案

    如何让设备巡检人员高质量完成巡检工作呢也是管理者头疼的一个问题。设备巡检工作的难点在哪呢? 对巡检人员而言:巡检人员需要按照巡检任务对设备进行巡检,保证按时完成巡检任务。纸质的巡检表格显然不方便开展巡检工作。没有自动提醒功能的话,很容易漏检,纸质表格数据也容易丢失等。 2) 可设置巡检定位和拍照,实现高效巡检管理员创建巡检方案后,系统可根据周期自动生成巡检任务,分配给巡检人员。可设置巡检定位、拍照以及巡检班组、巡检路线、巡检点等。巡检人员根据设置的巡检路线进行巡检。 抵达相应的巡检点和设备存放处后扫码填写巡检项目,现场定位并对设备进行拍照记录,可有效规避未到场的假巡检等;同时,通过易点易动设备巡检解决方案,可以设置自定义提醒,确保巡检班组人员收到巡检提醒,确保巡检没有遗漏 3) 实时掌握巡检数据,多维度巡检数据分析通过易点易动设备巡检解决方案自动生成多维度的巡检数据报表,让管理者可实时掌握设备巡检状态、巡检点统计、班组巡检统计、整改统计、巡检点整改统计等,从而可以进一步优化巡检工作和巡检人员管理

    1.4K30编辑于 2022-09-01
  • 来自专栏安全领域

    8种简单方法降低你的网络风险

    随着我们的生活和工作越来越多地通过网络进行,我们的个人信息受到侵害和非法使用的风险也在相应增加。 加强网络安全并不是指将风险降低到零,而是指填补主要的漏洞,从而解决最大的安全隐患。 以下是八个简单的方法,可以帮助我们降低网络风险。 3.了解使用云服务的风险 在线“云”服务带来了许多便利,它使你能够从任何地方访问或者共享你的数据,而不是局限在某一台计算机上。 请记住,Dropbox等我们常用的文件共享软件也存在风险,比如说,Dropbox文件共享链接是不安全的,任何人都可以访问。 8.不要忘记反恶意软件 几乎每个人都熟悉杀毒软件。我们知道的较少的是具有”反恶意软件“功能的软件。许多杀毒软件都包括扫描和防止恶意软件的功能,但不全都是这样。

    1.8K20发布于 2018-08-01
  • 来自专栏TeamsSix的网络空间安全专栏

    云安全 | k8s 所面临的风险学习

    0x00 前言 Kubernetes 又称 k8s,是 Google 在 2014 年开源的一个用来管理容器的平台,以下是 k8s 架构图。 k8s 主要由以下核心组件组成: etcd 保存了整个集群的状态 API Server 提供了资源操作的唯一入口,并提供认证、授权、访问控制、API 注册和发现等机制 Controller Manager Container Runtime 负责镜像管理以及 Pod 和容器的真正运行(CRI) Kube-proxy 负责为 Service 提供 Cluster 内部的服务发现和负载均衡 这里学习下 k8s 中所面临的一些风险,主要有 5 个部分: 1、容器基础设施存在的风险 2、组件接口存在的风险 3、集群网络存在的风险 4、访问控制机制存在的风险 5、自身的漏洞 其中容器基础设施存在的风险和之前分享的基本一致 AE%BE%E8%AE%A1%E6%9E%B6%E6%9E%84

    1K40编辑于 2022-09-20
  • 来自专栏数据库相关

    SQL Server巡检

    这里简单的补充几个,用python包装一下即可集成到数据库巡检任务平台。 CN.most_recent_sql_handle) AS ST where CN.session_id = ${上一步查出来的BSID} 用python处理下,大致这样,还可以优化下通过钉钉告警出来: 长事务巡检 Committed' WHEN 7 THEN 'Transaction Rolling Back' WHEN 8

    1.7K30编辑于 2023-07-05
  • AR工业巡检:虚实融合的智能巡检技术详解

    一、核心原理:空间锚定与虚实叠加​AR 巡检通过技术手段建立物理巡检场景与数字信息模型的一一对应关系,它可以对真实空间进行数字增强,提神工人的感知能力。​ 边缘计算模块就近处理采集到的海量数据,降低延迟;AI 算法(如目标检测、图像识别)自动分析图像和传感器数据,识别设备缺陷(如螺栓松动、管道腐蚀、绝缘子破损),并标记风险等级。 三、实现流程​以工业设备巡检为例,AR 巡检的典型流程的为:​预处理阶段:采集巡检区域的环境数据,构建数字孪生模型,录入设备参数、检修标准、应急预案等信息,完成 AR 系统的场景标定(即建立虚拟坐标与物理坐标的映射关系 数据反馈阶段:巡检过程中产生的缺陷记录、图像、传感器数据自动上传至后台管理系统,更新设备档案,形成巡检报告,为后续维护计划制定提供数据支撑。​ 将模型绑定到锚点(虚实位置精准对应) AnchorNode anchorNode = new AnchorNode(anchor); 8.

    98510编辑于 2025-10-20
  • 来自专栏作图丫

    8+的基于m6A的lncRNA风险模型构建!

    结果显示,低危组和高危组的免疫指标表达差异显著(图8A)。为了探索基于m6A的模型的潜在分子机制,本研究还进行了基因本体(GO)富集分析,揭示了许多免疫相关生物过程的参与(图8B)。 结果显示,高危组比低风险组对免疫治疗更有可能产生反应,这表明基于m6A的分类器指数可以作为预测肿瘤免疫功能障碍和排斥(TIDE)的指标(图8C)。 图 8 作者还对突变数据进行了分析和总结,高、低风险亚组间变异频率最高的前20个驱动基因如图8D、8E所示。 根据TGCA体细胞突变数据计算TMB评分,结果显示,低危组的TMB超过高危组,表明基于m6A的分类器指数与TMB具有较高的相关性(图8F)。 作者对m6A相关的lncRNA模型是否比TP53突变状态更能预测OS结局进行了测试,结果显示,高危组TP53突变和TP53野生型患者的OS比低危组TP53突变和TP53野生型患者的OS更差(图8G)。

    53530编辑于 2022-06-24
  • 来自专栏数据科学与人工智能

    【应用】信用评分:第8部分 - 信用风险策略

    笔者邀请您,先思考: 1 信用风险策略如何设计和制定? “行动是所有成功的基本钥匙(Pablo Picasso)。” 在信用风险领域,这个问题的答案可以在信用风险策略中找到。 信用风险策略是在评分卡开发之后和实施之前的过程。它告诉我们如何解释顾客分数以及与该分数相对应的适当的可操作行动。 例如,结合两个预测模型(分数和响应率)可以使营销部门能够专注于低风险和高回报的客户。 ? 图3.使用矩阵方法的风险定价 ? 图4.留存和风险的分段策略 使用过于简单化的策略是有危险的; 例如,该战略可以拒绝本来忠诚或高利润的风险客户。 at World Programming, UK 原文链接:https://www.worldprogramming.com/blog/credit_scoring_pt8 版权声明:作者保留权利,

    1.3K20发布于 2018-07-30
  • 来自专栏Python自动化测试

    线上巡检机制

    这种情况下,可以使用线上巡检机制。 线上巡检机制可以把它理解为实时的进行轮训监控,如果一旦服务出现问题,触发报警的机制通知相关的人员进行紧急的处理。 针对线上巡检的机制可以沿着两个维度来思考,一个是单纯的验证服务的可用性,也就是服务返回200的状态码认为服务是可用的,另外一种是结合业务场景来进行,因为服务返回200的状态码不代表服务提供的业务场景是可用的 /usr/bin/env python # -*- coding:utf-8 -*- #author:无涯 import requests def test_service_available():

    1.5K10编辑于 2022-03-29
  • 来自专栏院长运维开发

    Linux巡检脚本

    /bin/bash #主机信息每日巡检 IPADDR=$(ifconfig eth0|grep 'inet addr'|awk -F '[ :]' '{print $13}') #环境变量PATH没设好 #SNMP OK report_NTP="" #NTP ok report_JDK="" #JDK版本 ok function version(){ echo "" echo "" echo "系统巡检脚本 Mounted on/Mounted/'> /tmp/disk join /tmp/disk /tmp/inode | awk '{print $1,$2,"|",$3,$4,$5,$6,"|",$8, sysconfig/i18n | grep -v "^#" | awk -F '"' '{print $2}')" else default_LANG=$LANG fi export LANG="en_US.UTF-8" 执行检查并保存检查结果 check > $RESULTFILE echo "检查结果:$RESULTFILE" echo -e "`date "+%Y-%m-%d %H:%M:%S"` 阿里云PHP企业平台巡检报告

    5.7K51编辑于 2022-03-11
  • 来自专栏用户6465593的专栏

    智能设备巡检系统让设备巡检更加高效

    设备巡检是指对生产设备进行定期的检查、维护和保养,以确保设备的正常运行和安全性。设备巡检是企业生产管理的重要环节,关系到企业的生产效率、质量和成本。 传统的设备巡检方式主要依靠人工进行,存在以下几个问题: 人工巡检效率低,耗时长,容易出错; 人工巡检难以覆盖所有的设备和部位,容易遗漏重要的故障点; 人工巡检难以形成完整的数据记录和分析,难以提供及时有效的决策支持 ; 人工巡检存在虚假巡检,人员直接填写单子,却并没有到现场检查。 易点易动设备巡检系统具有以下几个优点: 通过手机二维码巡检提高了设备巡检效率,节省了人力资源和时间成本; 提高了设备巡检质量,减少了漏检和误报率; 提高了设备运行状态的透明度,增强了数据驱动的决策能力; 系统还可以设置巡检路线,巡检内容等。 增加了设备巡检的扩展性,企业可以根据自己的个性化需求进行配置表单、字段、报表等,满足企业的个性化需求。

    1.2K10编辑于 2023-03-08
领券