lyan
CodeFun
  • ホーム
  • アーカイブ
  • 自己紹介
  • リンク
EN 中文 日本語
  1. ホーム
  2. アーカイブ
  3. タグ:GPU Computing

Fused Attention を動かす意思決定エンジン:Transformer Engine が Blackwell 上で cuDNN をどう編成するか

2026-08-26

Transformer Engine の fused attention dispatch、cuDNN Graph API、Blackwell 経路、pipelining の背景、deterministic training 制約をソースに基づいて解説します。

Transformer Engine cuDNN Fused Attention Blackwell GPU Computing
続きを読む

Search

人気記事

  • InfiniBand の LFT とトポロジー出力:攻撃対象領域を広げずにファブリックを診断する
  • Fused Attention を動かす意思決定エンジン:Transformer Engine が Blackwell 上で cuDNN をどう編成するか
  • Megatron-Bridge 実践ガイド:Nemotron、Megatron-Core、Transformer Engine をつなぐプロダクション 101
  • FMHA 101:Transformer の Attention から CUDA Flash Attention カーネルまで
  • Enroot + Pyxis + SPANK:Slurm コンテナのアーキテクチャ、実装、運用ガイド
  • HPC-X、MPI、PMIx、NCCL:GPUクラスタ通信スタックの完全解剖
  • サーバーメモリアーキテクチャの詳細解説:DRAM顆粒からNUMAモードまで
  • 毒をもって毒を制す:スクリプトで構築するWindowsセキュリティ要塞
  • AI相互接続技術の覇権争い:NVLink、InfiniBand、UALink、そしてAIの頂点を目指す戦い

最新記事

  • InfiniBand の LFT とトポロジー出力:攻撃対象領域を広げずにファブリックを診断する
  • Fused Attention を動かす意思決定エンジン:Transformer Engine が Blackwell 上で cuDNN をどう編成するか
  • Megatron-Bridge 実践ガイド:Nemotron、Megatron-Core、Transformer Engine をつなぐプロダクション 101
  • FMHA 101:Transformer の Attention から CUDA Flash Attention カーネルまで
  • Enroot + Pyxis + SPANK:Slurm コンテナのアーキテクチャ、実装、運用ガイド
  • HPC-X、MPI、PMIx、NCCL:GPUクラスタ通信スタックの完全解剖
  • サーバーメモリアーキテクチャの詳細解説:DRAM顆粒からNUMAモードまで
  • 毒をもって毒を制す:スクリプトで構築するWindowsセキュリティ要塞
  • AI相互接続技術の覇権争い:NVLink、InfiniBand、UALink、そしてAIの頂点を目指す戦い

タグクラウド

Linux (61) XEN (29) Life (27) Memory (24) Virtualization (23) Diary (21) C/C++ (19) QEMU (17) test (15) CPU (14) InfiniBand (11) Interest (11) Algorithm (11) VisualStudio (11) HPC (10) NVIDIA (10) KVM (10) eBPF (8) AI (8) MFC (8) Debian (7) MLOps (6) TorchDynamo (6) PyTorch (6) CUDA (6) Kernel (6) OS (6) UALink (5) NVLink (5) RDMA (5) Jetson (5) OpenClaw (4)
lyan
CodeFun

©2026 xryan.net.

Code all fun things in the world by Leon.

  • リンク
  • 私たちについて
  • フィードバック
QR Code
Scan to follow