dongdonglog
AI Infra 系列 · 第六章 GPU 性能工程(二):B200 算力涨 2.25 倍,运数据的路一寸没宽,你的内核其实在等数据
原创
关注作者
腾讯云
开发者社区
文档
建议反馈
控制台
登录/注册
首页
学习
活动
专区
圈层
工具
MCP广场
文章/答案/技术大牛
搜索
搜索
关闭
发布
dongdonglog
社区首页
>
专栏
>
AI Infra 系列 · 第六章 GPU 性能工程(二):B200 算力涨 2.25 倍,运数据的路一寸没宽,你的内核其实在等数据
AI Infra 系列 · 第六章 GPU 性能工程(二):B200 算力涨 2.25 倍,运数据的路一寸没宽,你的内核其实在等数据
dongdonglog
关注
发布于 2026-09-10 17:48:45
发布于 2026-09-10 17:48:45
40
1
举报
概述
这篇就讲清楚:怎么用 Roofline 判断你是"算不完"还是"等数据",Blackwell 的内存层次差多少倍,一个 stride 怎么把带宽打到 25%,以及 2026 年这堵墙为什么还在加高。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系
cloudcommunity@tencent.com
删除。
性能优化
性能分析
gpu
ruby on rails
大模型部署
#AI Infra
#GPU 性能工程
#GPU
#GPU 优化
#大模型训练
问题归档
专栏文章
快讯文章归档
关键词归档
开发者手册归档
开发者手册 Section 归档