lyan
CodeFun
  • 首页
  • 归档
  • 关于
  • 链接
EN 中文 日本語
  1. 首页
  2. 归档
  3. 标签:LLM Training

Megatron-Bridge 实战:Nemotron、Megatron-Core 与 Transformer Engine 技术栈的生产级 101 指南

2026-08-26

从 Hugging Face 权重到可扩展 Megatron 训练:深入解释文件结构、系统架构、并行感知转换、Nemotron MoE,以及可复现的 import→fine-tune→export 101 流程。

NVIDIA MLOps Megatron LLM Training Nemotron
阅读更多

Search

置顶文章

  • QEMU定时器系统最新概述
  • 闲聊Framebuffer
  • 忽然看到自己十年前发的关于转计算机专业的帖子,感慨万千
  • Linux 下使用 SDCC 进行 8051 单片机开发实践
  • (转)IOS SDK 兼容性 研究

热门文章

  • 忽然看到自己十年前发的关于转计算机专业的帖子,感慨万千
  • Linux内存管理
  • 深入浅出内存分配
  • InfiniBand 中的 LFT 与拓扑导出:在不扩大攻击面的前提下诊断网络
  • 融合注意力背后的决策引擎:Transformer Engine 如何在 Blackwell 上编排 cuDNN
  • Megatron-Bridge 实战:Nemotron、Megatron-Core 与 Transformer Engine 技术栈的生产级 101 指南
  • FMHA 101:从 Transformer 注意力到 CUDA Flash Attention 内核
  • Enroot + Pyxis + SPANK:Slurm 容器的架构、实现与运维实战指南
  • 高性能网络与路由算法:InfiniBand、RoCEv2 与自适应路由深度解析

最新文章

  • InfiniBand 中的 LFT 与拓扑导出:在不扩大攻击面的前提下诊断网络
  • 融合注意力背后的决策引擎:Transformer Engine 如何在 Blackwell 上编排 cuDNN
  • Megatron-Bridge 实战:Nemotron、Megatron-Core 与 Transformer Engine 技术栈的生产级 101 指南
  • FMHA 101:从 Transformer 注意力到 CUDA Flash Attention 内核
  • Enroot + Pyxis + SPANK:Slurm 容器的架构、实现与运维实战指南
  • 高性能网络与路由算法:InfiniBand、RoCEv2 与自适应路由深度解析
  • 高性能网络与路由算法从零到一:InfiniBand、RoCEv2、ECMP vs SPF vs 自适应路由
  • Graph Algorithms Reference
  • HPC-X、MPI、PMIx 与 NCCL:GPU 集群通信栈全解

标签云

Linux (61) XEN (29) Life (27) Memory (24) Virtualization (23) Diary (21) C/C++ (19) QEMU (17) test (15) CPU (14) InfiniBand (11) Interest (11) Algorithm (11) VisualStudio (11) HPC (10) NVIDIA (10) KVM (10) eBPF (8) AI (8) MFC (8) Debian (7) MLOps (6) TorchDynamo (6) PyTorch (6) CUDA (6) Kernel (6) OS (6) UALink (5) NVLink (5) RDMA (5) Jetson (5) OpenClaw (4)
lyan
CodeFun

©2026 xryan.net.

Code all fun things in the world by Leon.

  • 友情链接
  • 关于我们
  • 意见反馈
QR Code
Scan to follow