首页
学习
活动
专区
圈层
工具
发布

#gpu

AI Infra 系列 · 第六章 GPU 性能工程(二):B200 算力涨 2.25 倍,运数据的路一寸没宽,你的内核其实在等数据

dongdonglog

2026 年 3 月,Tri Dao 和 Colfax、Meta、NVIDIA 的人一起发了 FlashAttention-4(arXiv:2603.05451...

4021

Ollama 部署大模型教程:云端 GPU 环境搭建与模型调用

克劳德2048

摘要 Ollama 把开源大模型的下载、加载和推理封装成几条命令,是目前上手本地模型最快的方式。本文在一台带 GPU 的云服务器上完成 Ollama 部署,涵盖...

5310

# LLM 量化到底省不省电?我造了一个实测专家替你算

用户9867296

做 LLM 推理部署的人都会默认一件事:模型量化 = 省显存 = 省电。但我在 5 款消费级 GPU 上、从 0.5B 到 14B 的模型里跑了 42 组实测数...

8510

AI Infra 系列 · 第五章 训练与调度(下):一万张 GPU 怎么排班,调度器才是训练场的隐形老板

dongdonglog

如果你管过一个训练集群,下面这个场景一定不陌生:周三下午,三个团队同时提交作业——A 要 512 卡训大模型,B 要 64 卡微调,C 只要 8 卡跑实验。调度...

26232

AI 项目 CI/CD 不用抢 GPU:云端节点按需调度

克劳德2048

摘要: AI 项目把训练、推理验证放进 CI/CD 时,常卡在"没有 GPU 机器可用"这一步。腾讯云云原生构建提供固定 16 核加 48GB 显存的云端 GP...

12910

AI/ML 训练任务怎么调度?GPU 节点跑进 CI/CD 流水线

克劳德2048

摘要: AI/ML 训练任务散落在本地机器上,难以复现和追溯。腾讯云云原生构建用 Pipeline/Stage/Job 三层结构把训练编排进流水线,通过 .cn...

17410

GPU太贵跑不起?这6个优化技巧让LLM推理成本直降

悟空码字

随着深度学习模型(尤其是大语言模型)规模不断增长,推理阶段的计算和存储开销成为实际部署中的主要瓶颈。推理优化的目标是:在尽可能保持模型精度的前提下,降低推理延迟...

17520

GPU高性能编程13: TIRx 与高性能GEMM (下)

fangpin

既然已经有了 TMA 和双缓冲,为什么还说没有真正 overlap?原因是当前代码仍由一个 warpgroup 顺序推进 load、MMA 和 store。它具...

12500

GPU 太贵不敢随便跑?CI/CD 按需调度,用完即释放

克劳德2048

摘要: GPU 单价高,AI 团队常因心疼算力而不敢在 CI/CD 里频繁跑训练和验证。腾讯云云原生构建的云端 GPU 节点按实际运行时间计费、用完即释放,配合...

20210

从“能用”到“好用”:我们在腾讯云TKE上优化AI推理服务的三个实战复盘

科技酱

过去两年,我们团队在腾讯云容器服务(TKE)上陆续上线了四个AI推理业务,涵盖智能客服、代码补全、文档摘要和图像生成。踩过的坑比跑通的demo多得多,很多优化方...

18310

AI Agent高频调用场景下,GPU原生数据库如何消除PCIe搬运瓶颈

数据库小学妹

上个月刷到WAIC 2026的消息,一条很炸眼。星环科技发布了全球首款商业化GPU原生认知数据库。官方口径:TPC-DS基准测试比主流开源数据库快70倍。同场演...

16210

AI Infra 系列 · 第二章(下):推理侧 KV 传输——NIXL 如何搬运 prefill 到 decode

dongdonglog

第一章第五节讲过,2026 年推理系统最明确的一条主线,是分离式 Prefill/Decode——把 prefill 和 decode 拆到不同的 GPU 池,...

19220

AI Infra 系列 · 第二章(上):训练侧通信——NCCL 如何让 GPU 别等数据

dongdonglog

一块 Blackwell 几秒钟能算完的矩阵,如果梯度同步要走一条又慢又绕的路,整张卡就得停下来干等。在我们第一章里 Meta 那份研究说,集群看着 100% ...

41720

TKE GPU 利用率优化:qGPU 共享与智能调度实战

hollyx

摘要: GPU 算力成本高昂但多数企业实际利用率仅在 5% 至 15% 之间。本文介绍基于腾讯云容器服务 TKE 的 qGPU 共享、TACO 推理加速与智能调...

20010

一家SaaS公司花17亿买GPU,这笔账算得过来吗?

爱分析ifenxi1

今年5月20日,迈富时完成了一笔不太起眼的新股认购,募资净额约5亿港元,认购价40.54港元。

9100

qGPU 共享技术详解:让昂贵的 GPU 资源利用率翻倍

hollyx

TKE 开发了 gpu-exporter 组件,用于获取 GPU 相关 Pod/容器维度的监控指标,包括 GPU 卡利用率、Pod/容器 GPU 资源利用率以及...

17210

纯前端 AI 视频编辑器的性能难题:WebGPU、Worker 与多轨时间线实践

用户5557817

传统的视频编辑软件往往依赖桌面客户端和本地原生运行时。随着 WebCodecs、WebGPU、WebAssembly 和 IndexedDB 等浏览器能力逐渐成...

17110
领券