首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏云原生应用工坊

    观测平台-4: 告警配置参考

    概述 此解决方案利用开源工具如ClickHouse、Neo4j、VectorDB、PromQL、LogQL、OpenTracing、Prometheus、Grafana、AlertManager和DeepFlow record: node_disk_usage expr: 100 - (avg by (instance) (node_filesystem_avail_bytes{fstype="ext4" } / node_filesystem_size_bytes{fstype="ext4"}) * 100) 配置说明: 此示例定义了一个名为“host-monitoring”的规则组,其中包含四个用于计算主机负载 rules: - alert: HighDiskUsage expr: node_filesystem_avail_bytes{fstype="ext4" grafana/latest/ 2 Prometheus 文档:https://prometheus.io/docs/ 3 deepflow 文档:https://deepflow.io/docs/zh/ 4

    1.8K10编辑于 2023-12-14
  • 来自专栏AIOps

    探秘栈可观测五层架构,嘉为蓝鲸栈智能观测中心助力运维进阶

    嘉为蓝鲸栈智能观测中心·鲸眼(以下简称“栈智能观测中心”)作为腾讯大规模IT生产环境锤炼出的栈智能观测中心,凭借一体化融合设计、开箱即用的信创生态支持、云原生监控能力以及本土化服务优势,正成为企业替代 栈智能观测中心旨在提供一个更现代化、更统一、更能开箱即用的栈可观测平台,在大部分的监控场景中,栈智能观测中心一个产品就能实现Tivoli三个子产品的效用:1)基础架构与组件监控栈智能观测中心提供开箱即用的监控能力 4)应用性能监控Tivoli体系中的ITCAM虽然提供APM能力,但常局限于对特定应用的监控,如SAP和其他企业资源规划(ERP)应用程序。 而栈智能观测中心则采用现代化的探针埋点服务进程的方式,自动探测分布式服务端到端调用链路,自动生成服务调用拓扑,从应用、服务、接口、调用 4个层次层层深入,监控应用的健康状态和调用性能;并支持基础资源监控进行联动和下钻分析 03.栈智能观测中心替换 Tivoli 事件规则实操截至目前,栈智能观测中心团队已经在近十个项目中将 IBM Tivoli 替换为栈智能观测中心产品,一个核心且常见的需求是将Tivoli系统中长期积累的事件规则迁移至栈智能观测中心平台

    82610编辑于 2025-04-14
  • 来自专栏Elastic Stack专栏

    Elastic的CICD观测解决方案

    CI/CD 可观测性架构 使用 APM 服务器,将所有 OpenTelemetry 原生 CI/CD 观测工具直接连接到 Elastic Observability。 [CI/CD可观测性架构] 使用 Elastic 构建 CI/CD 可观测性的架构 更高级的 CI/CD 可观测性架构包括部署在边缘(靠近 CI/CD 工具)的 OpenTelemetry 收集器。 [在这里插入图片描述] Jenkins KPIs in Elastic Observability [4d2540f8c31d277868c1346b5685aa5a.png] Jenkins Provisioning 将日志存储在可观测性后端有几个好处,包括: 将所有的可观测性数据进行统一的存储,更利于我们实现Jenkins实例的观测性、监控、警报和故障排除。 [4e948ca55e2a9dcf017250812de56e23.png] 对 Ansible playbook的可见性 此集成提供开箱即用的服务地图,其中包含连接到 Ansible Playbook

    7.3K361编辑于 2022-04-07
  • 来自专栏运维开发故事

    Kubernetes 可观测性:利用 4 个开源工具

    原文链接:https://www.cncf.io/blog/2022/08/01/kubernetes-monitoring-leveraging-4-open-source-toolsets/

    1.4K30编辑于 2022-09-15
  • 来自专栏大前端修炼手册

    LangSmith链路观测:Agent调试与生产监控

    =kb-agent-prod LANGSMITH_ENDPOINT= https://api.smith.langchain.com 但我们项目里,检索、Rerank、评分这些环节很多是自研的,没有走 自托管 闭源SaaS为主 开源,自托管友好 开源,Arize出品 与LangChain集成 原生,最深 良好,需接入 基于OpenTelemetry Prompt管理 Hub,成熟 有,功能相近 较弱,偏观测 如果你的团队完全没有用LangChain/LangGraph,纯自研Pipeline,Phoenix的OpenTelemetry原生方案反而更轻量,不会有"为了观测反过来被框架绑架"的顾虑。 从这一篇往后,可观测性算是补齐了。 但说实话,我现在越来越觉得,观测和评估这两件事其实应该是整个Agent系统设计阶段就要考虑的一等公民,而不是像我们这样吃了亏之后才补——如果重新设计一次,我会把@traceable写进每个函数的骨架模板里

    42510编辑于 2026-07-20
  • 来自专栏FunTester

    Java应用链路追踪可观测性实践

    追踪和可观测性已成为实现这些目标的关键实践。本文探讨了Java应用程序中的追踪概念,深入研究了代码插桩技术,并展示了它们如何促进栈可观测性。 Java中的插桩技术 插桩是向代码中添加观测能力的过程。在Java中,可以使用几种技术来实现: 手动插桩 开发者明确添加代码来记录追踪数据。 实现栈可观测栈可观测性意味着跨前端、后端、数据库和外部服务的可见性。 集成追踪、日志和指标 结合所有三大支柱以获得全面的洞察。 示例:将追踪与日志关联 import io.opentelemetry.api.trace.Span; import org.slf4j.Logger; import org.slf4j.LoggerFactory ; import org.slf4j.MDC; publicclassInventoryService { privatestaticfinalLoggerlogger= LoggerFactory.getLogger

    43610编辑于 2026-01-05
  • 来自专栏云云众生s

    观测性之旅的4个演进阶段

    已知/未知矩阵对于理解你的可观测性方案的实施情况非常有帮助。 译自 The 4 Evolutions of Your Observability Journey,作者 Hazel Weakly。 在进行可观测性之旅时,每个公司都会经历几个具体的阶段。 简而言之,这三个任务几乎涵盖了我们在平台工程、可观测性、站点可靠性工程 (SRE) 工作、DevOps 等方面所做的一切。 说实话,如果您不能充分阐明为什么可观测性之旅对公司至关重要,那么您将永远无法完成这段旅程。人的理解和共同的动机必须放在首位。 如果说第一阶段是大多数可观测性工具所在的地方,那么这就是服务水平目标 (SLO) 的时代;这也是可观测性开始以“是,而且”的方式表述的阶段。可观测性?

    38810编辑于 2024-10-13
  • 来自专栏瓜农老梁

    FA6# 链路观测平台设计点归纳

    引言 链路观测平台设计离不开基础数据的采集、提炼和呈现。本文就基础数据日志、指标、链路的采集原理进行梳理,如何将其关联最终提供辅助决策价值提点归纳。 指标埋点覆盖度 链路采样策略的多样性 日志清洗与提炼 2.告警质量 告警信息能包含从指标到链路以及日志的清晰关联与日志信息,提高决策能力 3.分析能力 沉淀问题分析的最佳实践库,将其自动化分析提升定位能力 4. 自愈能力 基于分析能力,沉淀自愈策略 自愈策略的灵活配置 5.性能与稳定性 采集延迟、计算能力、查询性能 可视化观测平台自身的稳定性建设 6.可视化能力 可观测一站式 丰富图表与报表 7.预测能力 基于历史数据沉淀算法模型预测未来可能发生的问题

    87231编辑于 2022-01-04
  • 腾讯云可观测平台:栈智能观测驱动运维效率与系统稳定性提升

    提供观测方案 腾讯云推出腾讯云可观测平台(Tencent Cloud Observability Platform, TCOP),集指标、链路、日志于一体,提供一体化智能监控解决方案。 核心模块包括: 一体化观测:整合H5/Web/小程序、微服务、Kubernetes、200+云产品等数据源,通过DSL关联分析、统一存储、实时异常检测实现栈数据打通(数据来源:TCOP全景图)。 选择腾讯云的核心优势 技术领先性: 一体化观测实现链路横向关联与栈资源纵向穿透,支持端到端统一监控(数据来源:“总览全局”章节); Prometheus监控服务解决开源版水平扩展痛点,数据存储无上限 权威认证: 腾讯云可观测平台获评信通院《云计算系统智能化可观测性能力成熟度模型》认证最高级-智能引领级(Lv5)(数据来源:“行业认证”章节); 云压测获信通院首届“云系统稳定安全运行优秀案例” (数据来源:腾讯云可观测平台介绍手册及相关产品章节)

    49910编辑于 2026-04-16
  • 来自专栏云原生应用工坊

    IT咖啡馆|栈可观测数据库设计

    IT咖啡馆|栈可观测数据库设计线 I/O 面交给 OpenObserve(OO),治理/知识面沉到 PostgreSQL 栈(Timescale + AGE + pgvector)。 摘要本文落地一套「栈可观测」数据库设计:明细进 OO,PG 仅存 12 张核心表(维度、定位符、指标 1m、服务调用 5m、日志指纹/计数、拓扑时态、知识库、事件/证据),并用 AGE 维护“当前服务级调用图 4)服务级调用聚合(5 分钟)service_call_5m:A→B 的 rps/err_rate/p50/p95,主键含窗口/租户/边端点。用途:报表/拓扑;刷新 AGE “活跃调用图”。 d.resource_id = t.dst_resource_idWHERE t.tenant_id = $tenant AND t.valid @> $timestamp::timestamptz;与「塞 'metric_1m', INTERVAL '7 days');SELECT add_retention_policy ('metric_1m', INTERVAL '180 days');-- 4)

    46710编辑于 2025-08-29
  • 腾讯蓝鲸 游戏服务链路、真栈无盲点可观测实践

    介绍了腾讯 IEG 蓝鲸观测平台如何运用前沿的 DeepFlow 的 eBPF 技术,结合传统的 APM 体系,实现了对游戏服务链路、真栈,无盲点观测。 插件形式扩展应用层数据解析通过 Prometheus Remote Write 协议将指标数据导出,实现数据集成和告警4、游戏场景观测实践介绍了腾讯游戏的组成,包括自研和发行两大类,以及它们的独特架构和部署模式通过 到这里的话,基本上上面的能力,已经能满足我们想要的观测能力。下面我再以游戏的观测场景,来展示下我们是怎么去实践的。 4、游戏场景观测实践1:传统 APM 方案痛点腾讯游戏组成,一般是由自研和发行两大类。自研类,就是自己研发的游戏,发行类,简单讲就是第三方公司开发的游戏,在公司内托管运营。 4:具体效果展示下面展示下,具体的一些效果。

    1.5K10编辑于 2024-02-06
  • DeepFlow 栈可观测性 护航某银行核心系统生命周期

    DeepFlow栈可观测性实践案例DeepFlow的栈可观测性产品能力主要体现在四个方面:云上云下业务全景图:观测每个服务的性能栈调用链追踪:观测每个调用的性能持续性能剖析:观测每个函数的性能OneAgent 下面以某行客户为例子,分享各个团队使用DeepFlow观测平台的实践案例。 开发测试团队开发测试团队对可观测性能力的依赖主要体现在两个阶段功能测试:追踪、日志、剖析是高效调测分布式应用的必备能力,在开发阶段可通过插桩获取这些能力,观测平台的零侵扰可观测性能让这些能力的获取更为简单 利用DeepFlow持续剖析能力,测试团队快速发现了新上线的服务中由sun/reflect/GeneratedMethodAccessor函数和org/apache/logging/log4j/spi/ 02|Agent的自我持续剖析能力DeepFlow观测平台的业务全景拓扑、栈链路追踪、持续性能剖析对自身也同样适用。

    1.2K10编辑于 2025-11-26
  • 来自专栏Apache Doris

    表扫描? AI Agent 动态 JSON 的观测分析

    像 LangSmith、Langfuse 这样的现代观测平台,已经将 Agent Trace 定义为一棵包含完整上下文的执行树。 这意味着:Agent 观测的核心目标,已经从“记录结果”转变为“还原过程”。 面对这种高度复杂的执行语义,传统只适合聚合统计的扁平日志模型,显然已经无法适用。 表面上这只是一次很常见的观测分析,但由于这些字段都藏在 String 里,查询引擎的优化器对此一无所知。 结果就是:真正符合条件的目标数据可能仅占 0.1%,但系统却迫做了一次表扫描(Full Scan)。 面对 TB 级别的长文本,传统的 LIKE 会导致表扫描。

    30810编辑于 2026-05-13
  • 来自专栏深度学习与python

    作业帮基础观测能力之二链路追踪实践

    此时,传统的追踪系统已无法满足对多服务、跨系统的链路追踪需求,因此需要引入分布式追踪系统。 成本优势:能够以较小的机器预算支撑起公司大规模追踪数据的处理与存储落地,且性能表现良好。 基于服务的追踪(Service-Based Tracing) 以上的两类采集方式专注于对服务边界的观测,  如果服务有对内部的观测需求则通过服务自定义打点的方式上报追踪数据,按需增加追踪深度。 由于 Jaeger 官方目前尚未正式支持 ClickHouse 作为存储后端,我们自研的插件实现了这一功能,通过调用原生 ClickHouse 客户端的方式进行写入,新的写入模块单核可以支持 4W/S ,始终围绕着“降低使用门槛、赋能业务决策”两大核心目标,让每一次请求可观测、可诊断、可优化。

    49720编辑于 2025-06-08
  • 来自专栏云原生应用工坊

    IT咖啡馆|栈可观测数据库 ETL 设计

    kb_chunk(向量) 事件:event_envelope、evidence_link ETL 元数据:etl_job_run、etl_job_circuit AGE:ops 图(Resource、CALLS) 4. T4 — pkg/agg 聚合正确性 描述:实现指标 1m avg/max/p95、调用 5m rps/err/p50/p95、日志指纹 5m 计数;接入 patterns.MineTemplate。 T10 — 观测指标与窗口滞后 描述:导出 Prometheus 指标(自定义 /metrics 或写回 OO);记录窗口滞后。

    43010编辑于 2025-09-02
  • 来自专栏架构驿站

    一文搞懂基于 OpenTelemetry 进行 Kubernetes 链路观测

    ---- Hello folks,我是 Luga,今天我们来聊一下云原生生态核心技术—— 可观测性,即 “基于 OpenTelemetry 进行 Kubernetes 链路观测” 。 4、多样性:Kubernetes 生态系统中存在多种不同的组件和工具,用于不同的观测需求,例如 Prometheus、Grafana、ELK 堆栈等。 4、API Server 指标 此指标包括请求延迟、响应时间和错误率,提供有关 Kubernetes API 服务器功能和可用性的详细信息。 4、Kubernetes 部署 OpenTelemetry 可以部署为 Kubernetes 部署或守护进程集,从而可以轻松在 Kubernetes 环境中扩展和管理 OpenTelemetry 4、将数据发送到首选的后端 最后一步,我们需要配置 OpenTelemetry Collector 将收集到的数据发送到所首选的后端。

    4.9K64编辑于 2023-09-25
  • 来自专栏架构驿站

    分布式应用的 4 个核心可观测性指标

    作者 | Michael Bogan 译者 | Luga Lee 策划 | Luga Lee 基于关键的可观测性指标,我们更能了解我们的应用服务运行状态,以便提升服务运行效能。 设置适当的监控将为我们提供更完整的观测图,但可能很难知道从哪里开始。在这篇文章中,我们将介绍可观测性指标应该关注的那些服务领域,以确保大家不会错过关键信息。 我们的服务器作为 HTTP 响应发出的任何 5xx(甚至 4xx)都应该被标记和计数。即使我们已经考虑到的情况,例如捕获的异常,也应该受到监视,因为它们仍然代表非理想状态。 4、饱和度 除此之外,我们还应该跟踪每个微服务的内存使用情况、CPU 使用情况、磁盘读/写和可用存储。

    1.9K30编辑于 2021-12-10
  • 来自专栏菩提树下的杨过

    langchain4j 学习系列(9)-AIService与可观测

    除了这些,langchain4j还提供了更高抽象级别的AIService,可以极大简化代码。 一、基本用法 1.1 定义业务接口 1 /** 2 * @author junmingyang 3 */ 4 public interface ChineseTeacher { 5 6 onError(sink::tryEmitError) 18 .start(); 19 return sink.asFlux(); 20 } 四、可观测性 文中代码: https://github.com/yjmyzz/langchain4j-study/tree/day09 参考: https://docs.langchain4j.dev/tutorials /observability https://docs.langchain4j.dev/tutorials/ai-services

    66810编辑于 2026-01-12
  • 来自专栏新技术

    ​可观测性之Log4j2优雅日志打印

    相关的依赖包是log4j和适配log4j2的桥接包log4j-1.2-api。 相关的依赖是slf4j-api和适配log4j2的桥接包og4j-slf4j-impl或者log4j-slf4j2-impl。 ,这里就以Log4j2绑定Slf4j的案例来说明,使用Slf4j来作为日志门面,使用Log4j2来实现具体的日志配置与打印。 依赖引入可以先通过如下图来看下Log4j2与Slf4之间的适配需要引入哪些依赖包:图片可以看到如果要使用Slf4j门面的话,需要引入一个Slf4j门面依赖包slf4j-api和一个与log4j2绑定slf4j 在日志打印格式中设置获取链路追踪id的获取方式%X{TraceId} ,然后在Java代码中将链路追踪Id放入日志诊断上下文MDC中即可如代码: MDC.put("TraceId", "123456");总结日志也是我们最常用的观测系统健康状况的方式

    2.6K30编辑于 2023-01-06
  • 企业网络监控的演变与栈可观测性趋势

    六、栈统一监控的实践价值由于多数企业同时运行网络、服务器、应用和安全工具,数据割裂问题突出。 随着企业IT环境持续复杂化,具备栈覆盖能力、开放集成和预测分析能力的监控平台,正成为保障业务连续性的重要工具。运维团队可结合自身现状,逐步引入相应的能力,提升故障预防与处置效率。

    27210编辑于 2026-06-30
领券