lyan
CodeFun
  • 首页
  • 归档
  • 关于
  • 链接
EN 中文 日本語
  1. 首页
  2. 归档
  3. 标签:programming

FMHA 101:从 Transformer 注意力到 CUDA Flash Attention 内核

lyan 2026-05-05

面向初学者的 FMHA 教程:从 Transformer 注意力、手算示例,到在线 Softmax 与 CUDA 分块内核。

GPU programming CUDA FlashAttention Transformers Transformer Engine
阅读更多

eBPF 深度技术指南:从底层原理到生产实践

lyan 2025-12-22

深入剖析 eBPF 虚拟机底层实现、Probe 引擎机制、程序计数器跳转、硬件资源访问等核心技术。涵盖寄存器架构、指令编码、Kprobe/Kretprobe/Uprobe 实现原理、PMU 访问、JIT 编译优化、生产环境最佳实践等内容。适合系统工程师和内核开发者深度学习。

eBPF Linux内核 系统监控 性能优化 programming guide
阅读更多

Search

置顶文章

  • QEMU定时器系统最新概述
  • 闲聊Framebuffer
  • 忽然看到自己十年前发的关于转计算机专业的帖子,感慨万千
  • Linux 下使用 SDCC 进行 8051 单片机开发实践
  • (转)IOS SDK 兼容性 研究

热门文章

  • 忽然看到自己十年前发的关于转计算机专业的帖子,感慨万千
  • Linux内存管理
  • 深入浅出内存分配
  • uv 的工作机制:Python 环境、依赖解析与缓存
  • 多模态 AI 中的交叉注意力:何时需要让一条信息流读取另一条信息流
  • InfiniBand 中的 LFT 与拓扑导出:在不扩大攻击面的前提下诊断网络
  • 融合注意力背后的决策引擎:Transformer Engine 如何在 Blackwell 上编排 cuDNN
  • Megatron-Bridge 实战:Nemotron、Megatron-Core 与 Transformer Engine 技术栈的生产级 101 指南
  • FMHA 101:从 Transformer 注意力到 CUDA Flash Attention 内核

最新文章

  • uv 的工作机制:Python 环境、依赖解析与缓存
  • 多模态 AI 中的交叉注意力:何时需要让一条信息流读取另一条信息流
  • InfiniBand 中的 LFT 与拓扑导出:在不扩大攻击面的前提下诊断网络
  • 融合注意力背后的决策引擎:Transformer Engine 如何在 Blackwell 上编排 cuDNN
  • Megatron-Bridge 实战:Nemotron、Megatron-Core 与 Transformer Engine 技术栈的生产级 101 指南
  • FMHA 101:从 Transformer 注意力到 CUDA Flash Attention 内核
  • Enroot + Pyxis + SPANK:Slurm 容器的架构、实现与运维实战指南
  • 高性能网络与路由算法:InfiniBand、RoCEv2 与自适应路由深度解析
  • 高性能网络与路由算法从零到一:InfiniBand、RoCEv2、ECMP vs SPF vs 自适应路由

标签云

Linux (61) XEN (29) Life (27) Memory (24) Virtualization (23) Diary (21) C/C++ (19) QEMU (17) test (15) CPU (14) NVIDIA (13) InfiniBand (11) AI (11) Interest (11) Algorithm (11) VisualStudio (11) HPC (10) GPU (10) KVM (10) Transformer (9) eBPF (8) MFC (8) Debian (7) Engine (6) MLOps (6) Security (6) TorchDynamo (6) PyTorch (6) CUDA (6) programming (6) Kernel (6) Network (6)
lyan
CodeFun

©2026 xryan.net.

Code all fun things in the world by Leon.

  • 友情链接
  • 关于我们
  • 意见反馈
QR Code
Scan to follow