首页
学习
活动
专区
圈层
工具
发布
    • 综合排序
    • 最热优先
    • 最新优先
    时间不限
  • 来自专栏Elastic Stack专栏

    Elastic的CICD观测解决方案

    CI/CD 可观测性架构 使用 APM 服务器,将所有 OpenTelemetry 原生 CI/CD 观测工具直接连接到 Elastic Observability。 [CI/CD可观测性架构] 使用 Elastic 构建 CI/CD 可观测性的架构 更高级的 CI/CD 可观测性架构包括部署在边缘(靠近 CI/CD 工具)的 OpenTelemetry 收集器。 [d89d8ead95cbded5f0cec73cc3d45aaa.png] Elastic Observability 中的 Jenkins 管道构建错误 错误概览屏幕提供 捕获的CI 构建异常的高级视图 [7e6e380cd6b3a8fce6c2902d29dd7f90.png] Elastic Observability 中的 Jenkins 作业和管道错误 [e2f9cbd8ce5dfee4713ad2424817460b.png 将日志存储在可观测性后端有几个好处,包括: 将所有的可观测性数据进行统一的存储,更利于我们实现Jenkins实例的观测性、监控、警报和故障排除。

    7.3K361编辑于 2022-04-07
  • 来自专栏运维开发故事

    k8s的可观测

    概念 “可观测性”这个名词其实是最近几年才从控制理论中借用的舶来概念,不过实际上,计算机科学中关于可观测性的研究内容已经有了很多年的实践积累。 通常,人们会把可观测性分解为三个更具体的方向进行研究,分别是:日志收集、链路追踪和聚合度量。 结合k8s可观测性 度量(Metrics) 度量的主要目的是监控(Monitoring)和预警(Alert)。比如说,当某些度量指标达到了风险阈值时就触发事件,以便自动处理或者提醒管理员介入。 因此,分布式系统中的追踪在国内通常被称为“链路追踪”(后面我就直接称“链路追踪”了),许多资料中也把它叫做是“分布式追踪”(Distributed Tracing)。服务调用链跟踪。 三者结合(Request-scoped,aggregatable events)三者结合可以理解为请求级别+聚合级别的事件,由此就形成了一个丰富的、全局的观测体系。

    84730编辑于 2023-05-01
  • 来自专栏AIOps

    探秘栈可观测五层架构,嘉为蓝鲸栈智能观测中心助力运维进阶

    嘉为蓝鲸栈智能观测中心·鲸眼(以下简称“栈智能观测中心”)作为腾讯大规模IT生产环境锤炼出的栈智能观测中心,凭借一体化融合设计、开箱即用的信创生态支持、云原生监控能力以及本土化服务优势,正成为企业替代 3)栈智能观测中心与Tivoli的监控能力替换以下将通过具体场景对比,进一步阐述栈智能观测中心的核心价值与落地实践。 栈智能观测中心旨在提供一个更现代化、更统一、更能开箱即用的栈可观测平台,在大部分的监控场景中,栈智能观测中心一个产品就能实现Tivoli三个子产品的效用:1)基础架构与组件监控栈智能观测中心提供开箱即用的监控能力 03.栈智能观测中心替换 Tivoli 事件规则实操截至目前,栈智能观测中心团队已经在近十个项目中将 IBM Tivoli 替换为栈智能观测中心产品,一个核心且常见的需求是将Tivoli系统中长期积累的事件规则迁移至栈智能观测中心平台 04.更多栈可观测能力栈智能观测中心作为嘉为蓝鲸倾力打造的一款栈可观测产品,经过持续的沉淀和迭代,目前已经实现了业务栈系统资源监控、K8s容器监控、云平台监控、硬件设备监控、网站服务拨测、日志统一管理

    82510编辑于 2025-04-14
  • 来自专栏JiekeXu之路

    MySQL 8 主从延迟监控(复制可观测性)

    大家好,我是 JiekeXu,很高兴又和大家见面了,今天和大家一起来看看 MySQL 8 主从延迟监控(复制可观测性),欢迎点击上方蓝字“JiekeXu DBA之路”关注我的公众号,标星或置顶,更多干货第一时间到达 : 54d83026-40eb-11ee-a5d3-c8cb9e32df8e:105184-105547 *************************** 8. row ************* :1-4,54d83026-40eb-11ee-a5d3-c8cb9e32df8e:1-137384,54d8329c-40eb-11ee-a5d3-c8cb9e32df8e:1-5,7b6bf4f0- :1-4,54d83026-40eb-11ee-a5d3-c8cb9e32df8e:1-138552,54d8329c-40eb-11ee-a5d3-c8cb9e32df8e:1-5" 结论 复制可观测性非常详细,并为 MySQL 8 提供了大量信息。也许现在是更改查看或监视复制方式的好时机。

    1.5K20编辑于 2023-09-26
  • 来自专栏大前端修炼手册

    LangSmith链路观测:Agent调试与生产监控

    =kb-agent-prod LANGSMITH_ENDPOINT= https://api.smith.langchain.com 但我们项目里,检索、Rerank、评分这些环节很多是自研的,没有走 自托管 闭源SaaS为主 开源,自托管友好 开源,Arize出品 与LangChain集成 原生,最深 良好,需接入 基于OpenTelemetry Prompt管理 Hub,成熟 有,功能相近 较弱,偏观测 如果你的团队完全没有用LangChain/LangGraph,纯自研Pipeline,Phoenix的OpenTelemetry原生方案反而更轻量,不会有"为了观测反过来被框架绑架"的顾虑。 从这一篇往后,可观测性算是补齐了。 但说实话,我现在越来越觉得,观测和评估这两件事其实应该是整个Agent系统设计阶段就要考虑的一等公民,而不是像我们这样吃了亏之后才补——如果重新设计一次,我会把@traceable写进每个函数的骨架模板里

    42410编辑于 2026-07-20
  • 来自专栏FunTester

    Java应用链路追踪可观测性实践

    追踪和可观测性已成为实现这些目标的关键实践。本文探讨了Java应用程序中的追踪概念,深入研究了代码插桩技术,并展示了它们如何促进栈可观测性。 理解追踪和可观测性 追踪涉及记录应用程序中请求或事务的流程。它捕获关于操作执行的详细信息,包括时间、持续时间和上下文。在分布式系统中,追踪有助于可视化请求如何在多个服务和组件之间传播。 可观测性是指通过系统的外部输出来推断其内部状态的能力,主要由日志、指标和追踪三大支柱构成:日志用于记录离散事件,指标反映随时间变化的数值数据,追踪则展现请求在系统中的路径。 Java中的插桩技术 插桩是向代码中添加观测能力的过程。在Java中,可以使用几种技术来实现: 手动插桩 开发者明确添加代码来记录追踪数据。 实现栈可观测栈可观测性意味着跨前端、后端、数据库和外部服务的可见性。 集成追踪、日志和指标 结合所有三大支柱以获得全面的洞察。

    43610编辑于 2026-01-05
  • 来自专栏瓜农老梁

    FA6# 链路观测平台设计点归纳

    引言 链路观测平台设计离不开基础数据的采集、提炼和呈现。本文就基础数据日志、指标、链路的采集原理进行梳理,如何将其关联最终提供辅助决策价值提点归纳。 ,提高决策能力 3.分析能力 沉淀问题分析的最佳实践库,将其自动化分析提升定位能力 4.自愈能力 基于分析能力,沉淀自愈策略 自愈策略的灵活配置 5.性能与稳定性 采集延迟、计算能力、查询性能 可视化观测平台自身的稳定性建设 6.可视化能力 可观测一站式 丰富图表与报表 7.预测能力 基于历史数据沉淀算法模型预测未来可能发生的问题

    87231编辑于 2022-01-04
  • 腾讯云可观测平台:栈智能观测驱动运维效率与系统稳定性提升

    提供观测方案 腾讯云推出腾讯云可观测平台(Tencent Cloud Observability Platform, TCOP),集指标、链路、日志于一体,提供一体化智能监控解决方案。 核心模块包括: 一体化观测:整合H5/Web/小程序、微服务、Kubernetes、200+云产品等数据源,通过DSL关联分析、统一存储、实时异常检测实现栈数据打通(数据来源:TCOP全景图)。 选择腾讯云的核心优势 技术领先性: 一体化观测实现链路横向关联与栈资源纵向穿透,支持端到端统一监控(数据来源:“总览全局”章节); Prometheus监控服务解决开源版水平扩展痛点,数据存储无上限 权威认证: 腾讯云可观测平台获评信通院《云计算系统智能化可观测性能力成熟度模型》认证最高级-智能引领级(Lv5)(数据来源:“行业认证”章节); 云压测获信通院首届“云系统稳定安全运行优秀案例” (数据来源:腾讯云可观测平台介绍手册及相关产品章节)

    49810编辑于 2026-04-16
  • 来自专栏云原生应用工坊

    IT咖啡馆|栈可观测数据库设计

    IT咖啡馆|栈可观测数据库设计线 I/O 面交给 OpenObserve(OO),治理/知识面沉到 PostgreSQL 栈(Timescale + AGE + pgvector)。 摘要本文落地一套「栈可观测」数据库设计:明细进 OO,PG 仅存 12 张核心表(维度、定位符、指标 1m、服务调用 5m、日志指纹/计数、拓扑时态、知识库、事件/证据),并用 AGE 维护“当前服务级调用图 dim_resource:统一资源 URN(如 urn:k8s:svc:ns/name),含环境/区域/标签。策略:为 type、labels 建索引(B-Tree + GIN),支撑过滤与聚合。 8)事件与证据链event_envelope:事件封套(时间/资源/严重级/类型/摘要/标签/指纹)。evidence_link:多态引用到 PG 记录或 oo_locator,串起证据链。 d.resource_id = t.dst_resource_idWHERE t.tenant_id = $tenant AND t.valid @> $timestamp::timestamptz;与「

    46710编辑于 2025-08-29
  • 腾讯蓝鲸 游戏服务链路、真栈无盲点可观测实践

    01 序言本文整理自2023年12月16日于北京清华大学举办的 以《网络为中心的零侵扰可观测性》的技术论坛, 来自蓝鲸观测平台团队的 刘文平 做了题为 《腾讯游戏真观测实践》的演讲。 介绍了腾讯 IEG 蓝鲸观测平台如何运用前沿的 DeepFlow 的 eBPF 技术,结合传统的 APM 体系,实现了对游戏服务链路、真栈,无盲点观测。 演讲围绕腾讯游戏的真观测实践,介绍了蓝鲸观测平台的功能、架构、以及与 OTel 和 eBPF 技术的结合使用。 到这里的话,基本上上面的能力,已经能满足我们想要的观测能力。下面我再以游戏的观测场景,来展示下我们是怎么去实践的。 可以看到上面,我们通过以trace为中心的数据关联的形式,对于玩家反馈的问题,让开发者可以在这个视角下做到数据的观测

    1.5K10编辑于 2024-02-06
  • DeepFlow 栈可观测性 护航某银行核心系统生命周期

    DeepFlow栈可观测性实践案例DeepFlow的栈可观测性产品能力主要体现在四个方面:云上云下业务全景图:观测每个服务的性能栈调用链追踪:观测每个调用的性能持续性能剖析:观测每个函数的性能OneAgent 下面以某行客户为例子,分享各个团队使用DeepFlow观测平台的实践案例。 目前,指标数据已经帮助应用监控团队构建了完整的微服务监控告警体系,帮助栈云团队强化K8s监控大盘,帮助新核心团队构建分布式核心系统的Grafana监控大盘。 01|云网性能黑盒:零侵扰追踪KVM网络性能瓶颈分布式核心系统上线栈云之前进行了大量的性能测试,期间发现K8s集群中的微服务访问裸金属服务器上的GoldenDB服务时,客户端侧的时延(3ms)与DBA 02|Agent的自我持续剖析能力DeepFlow观测平台的业务全景拓扑、栈链路追踪、持续性能剖析对自身也同样适用。

    1.2K10编辑于 2025-11-26
  • 来自专栏小工匠聊架构

    Java 8 - Optional

    ---- Optional的介绍以及API的详解 Java 8中引入了一个新的类 java.util.Optional 。这是一个封装 Optional 值的类。

    88722发布于 2021-08-17
  • 来自专栏深度学习与python

    作业帮基础观测能力之二链路追踪实践

    此时,传统的追踪系统已无法满足对多服务、跨系统的链路追踪需求,因此需要引入分布式追踪系统。 成本优势:能够以较小的机器预算支撑起公司大规模追踪数据的处理与存储落地,且性能表现良好。 基于服务的追踪(Service-Based Tracing) 以上的两类采集方式专注于对服务边界的观测,  如果服务有对内部的观测需求则通过服务自定义打点的方式上报追踪数据,按需增加追踪深度。 ,始终围绕着“降低使用门槛、赋能业务决策”两大核心目标,让每一次请求可观测、可诊断、可优化。 然而,在拥有量追踪数据后,我们就可以实时消费这些数据,并对其进行聚合统计,从而支持从服务和链路的视角来分析请求链路的整体状态。

    49720编辑于 2025-06-08
  • 来自专栏云原生应用工坊

    IT咖啡馆|栈可观测数据库 ETL 设计

    资源归一(URN):标准化 urn:k8s:svc:<ns>/<name> / urn:host:<host> / urn:db:postgres:<cluster>/<db>,并缓存 resource_id T8 — pkg/events 事件补数接口 描述:POST /events/enqueue 支持 {job, tenant_id, from, to} 回放窗口;写入 etl_job_run 为 queued T10 — 观测指标与窗口滞后 描述:导出 Prometheus 指标(自定义 /metrics 或写回 OO);记录窗口滞后。

    43010编辑于 2025-09-02
  • 来自专栏架构驿站

    一文搞懂基于 OpenTelemetry 进行 Kubernetes 链路观测

    ---- Hello folks,我是 Luga,今天我们来聊一下云原生生态核心技术—— 可观测性,即 “基于 OpenTelemetry 进行 Kubernetes 链路观测” 。 在这样的动态 Kubernetes 环境中,观测资源对于确保平台上运行的应用程序的健康至关重要。 然而,动态的 Kubernetes 环境给观测带来了很大的复杂性。 面对这些挑战,组织需要采用更先进的观测方法和工具,如 OpenTelemetry,以应对 Kubernetes 环境的复杂性和动态性,提供更全面和准确的观测能力。 因此,使用 OpenTelemetry 可以帮助组织克服传统观测方法的局限性,提供更全面、细粒度的观测能力,从而提高对分布式应用程序的理解和故障诊断能力。 — 03 — 揭秘 OpenTelemetry 在观测 Kubernetes 中的关键作用 尽管有多种方法可以对 Kubernetes 进行观测,但与传统的观测选项相比,使用 OpenTelemetry

    4.9K64编辑于 2023-09-25
  • 来自专栏Apache Doris

    表扫描? AI Agent 动态 JSON 的观测分析

    像 LangSmith、Langfuse 这样的现代观测平台,已经将 Agent Trace 定义为一棵包含完整上下文的执行树。 这意味着:Agent 观测的核心目标,已经从“记录结果”转变为“还原过程”。 面对这种高度复杂的执行语义,传统只适合聚合统计的扁平日志模型,显然已经无法适用。 表面上这只是一次很常见的观测分析,但由于这些字段都藏在 String 里,查询引擎的优化器对此一无所知。 结果就是:真正符合条件的目标数据可能仅占 0.1%,但系统却迫做了一次表扫描(Full Scan)。 面对 TB 级别的长文本,传统的 LIKE 会导致表扫描。

    30810编辑于 2026-05-13
  • 计算机视觉项目课:基于Django和YoloV8的鸟类识别智能平台--智能观测平台流程开发

    一句话:不建智能观测平台,你连低空经济的门票都拿不到。二、流程开发:六大阶段,从0到1构建你的低空视觉监测"大脑" 第一阶段:需求定义与场景建模(第1~2周)这是决定平台生死的起点。 这是平台的"大脑",决定你能"看懂"什么:AI能力技术方案效果目标检测YOLOv8+多机协同感知框架30架无人机成功追踪3台高速机动车辆变化检测双向Adapter多模态追踪框架违建识别响应时间<1小时多光谱分析海河天眼低空视觉基座模型 三、实战案例:三座城市的智能观测平台落地城市平台名称核心能力实战数据长沙星城天眸(1+1+3+N框架)20架无人机+智能机巢,城区10分钟抵达主城区覆盖,多部门数据支撑宁波甬瞰·低空慧眼卫星+无人机+ 地面监控多源融合,即点即测集装箱/卡车违规占用耕地精准定位南京浦口生态环境低空监管平台无人机+AI识别,65个监测节点,全自动无人值守扬尘事件8分钟完成AI识别+取证,效率提升10倍四、技术栈选型:2026 TCOP/Prometheus+Grafana栈智能观测,获Lv5认证数字孪生51LIS/51Earth空域可计算,毫秒级态势感知集群调度K8s+自研调度引擎支持百架级无人机同时运行低空感知VisDrone

    20000编辑于 2026-05-21
  • 来自专栏重归混沌

    谈谈观测

    随着这几年我对 eBPF、Prometheus 等工具的深入了解,我才逐渐意识到“可观测性”这个词背后蕴含的意义。 这也正是“可观测性”弥足珍贵的原因之一:当系统出问题时,我们可以通过系统本身提供的可观测能力,去追踪和理解到底发生了什么。 不得不佩服 Linux 的设计者们,/proc 文件系统的设计在多年以前就已体现出极强的可观测性理念。 我并不想讲怎么样实现可观测性,毕竟我不是专家。 但我想谈谈观测给了我们一个什么样的视角。 也就是说,在调用 foo 前后各执行一次量 GC,程序的内存使用应该没有任何变化。 这就合理了:调用 foo 十次产生约 8MB 的垃圾,加上我虚假分配的 10MB,共计约 108MB,就足够触发 GC 标记完 210MB 的内存。

    13410编辑于 2026-03-25
  • 来自专栏ops技术分享

    Nginx结构原理解析(8

    Nginx中从客户端访问的叫主请求,他被nginx这个程序来逐步处理。还有一种内部的请求,叫子请求。

    27620发布于 2021-05-11
  • 企业网络监控的演变与栈可观测性趋势

    六、栈统一监控的实践价值由于多数企业同时运行网络、服务器、应用和安全工具,数据割裂问题突出。 随着企业IT环境持续复杂化,具备栈覆盖能力、开放集成和预测分析能力的监控平台,正成为保障业务连续性的重要工具。运维团队可结合自身现状,逐步引入相应的能力,提升故障预防与处置效率。

    26910编辑于 2026-06-30
领券