lyan
CodeFun
  • 首页
  • 归档
  • 关于
  • 链接
EN 中文 日本語
  1. 首页
  2. 归档
  3. 标签:Engine

融合注意力背后的决策引擎:Transformer Engine 如何在 Blackwell 上编排 cuDNN

lyan 2026-06-07

基于源码梳理 Transformer Engine 融合注意力派发、cuDNN Graph API、Blackwell 路径、流水线背景与确定性训练约束。

GPU cuDNN Blackwell Transformer Engine Fused Attention Computing
阅读更多

FMHA 101:从 Transformer 注意力到 CUDA Flash Attention 内核

lyan 2026-05-05

面向初学者的 FMHA 教程:从 Transformer 注意力、手算示例,到在线 Softmax 与 CUDA 分块内核。

GPU programming CUDA FlashAttention Transformers Transformer Engine
阅读更多

Search

置顶文章

  • QEMU定时器系统最新概述
  • 闲聊Framebuffer
  • 忽然看到自己十年前发的关于转计算机专业的帖子,感慨万千
  • Linux 下使用 SDCC 进行 8051 单片机开发实践
  • (转)IOS SDK 兼容性 研究

热门文章

  • 忽然看到自己十年前发的关于转计算机专业的帖子,感慨万千
  • Linux内存管理
  • 深入浅出内存分配
  • uv 的工作机制:Python 环境、依赖解析与缓存
  • 多模态 AI 中的交叉注意力:何时需要让一条信息流读取另一条信息流
  • InfiniBand 中的 LFT 与拓扑导出:在不扩大攻击面的前提下诊断网络
  • 融合注意力背后的决策引擎:Transformer Engine 如何在 Blackwell 上编排 cuDNN
  • Megatron-Bridge 实战:Nemotron、Megatron-Core 与 Transformer Engine 技术栈的生产级 101 指南
  • FMHA 101:从 Transformer 注意力到 CUDA Flash Attention 内核

最新文章

  • uv 的工作机制:Python 环境、依赖解析与缓存
  • 多模态 AI 中的交叉注意力:何时需要让一条信息流读取另一条信息流
  • InfiniBand 中的 LFT 与拓扑导出:在不扩大攻击面的前提下诊断网络
  • 融合注意力背后的决策引擎:Transformer Engine 如何在 Blackwell 上编排 cuDNN
  • Megatron-Bridge 实战:Nemotron、Megatron-Core 与 Transformer Engine 技术栈的生产级 101 指南
  • FMHA 101:从 Transformer 注意力到 CUDA Flash Attention 内核
  • Enroot + Pyxis + SPANK:Slurm 容器的架构、实现与运维实战指南
  • 高性能网络与路由算法:InfiniBand、RoCEv2 与自适应路由深度解析
  • 高性能网络与路由算法从零到一:InfiniBand、RoCEv2、ECMP vs SPF vs 自适应路由

标签云

Linux (61) XEN (29) Life (27) Memory (24) Virtualization (23) Diary (21) C/C++ (19) QEMU (17) test (15) CPU (14) NVIDIA (13) InfiniBand (11) AI (11) Interest (11) Algorithm (11) VisualStudio (11) HPC (10) GPU (10) KVM (10) Transformer (9) eBPF (8) MFC (8) Debian (7) Engine (6) MLOps (6) Security (6) TorchDynamo (6) PyTorch (6) CUDA (6) programming (6) Kernel (6) Network (6)
lyan
CodeFun

©2026 xryan.net.

Code all fun things in the world by Leon.

  • 友情链接
  • 关于我们
  • 意见反馈
QR Code
Scan to follow