高性能网络与路由算法从零到一:InfiniBand、RoCEv2、ECMP vs SPF vs 自适应路由
系统讲解 InfiniBand、RoCEv2 底层架构,深入对比 SPF、ECMP 与自适应路由算法,涵盖 L3 vs L4 路由、RoCEv2 vs InfiniBand 路由机制深度对比,并揭示路由协议设计背后的反应式哲学。
阅读更多Graph Algorithms Reference
| Algorithm | Type | Neg edges | Time | Approach |
|---|---|---|---|---|
| Dijkstra | Single source | No | O((V+E) log V) |
Greedy + heap |
| Bellman-Ford | Single source | Yes | O(VE) |
DP relaxation |
| SPFA | Single source | Yes | O(kE) avg |
BF + queue |
| Floyd-Warshall | All pairs | Yes | O(V³) |
DP |
| Prim | MST | — | O((V+E) log V) |
Greedy + heap |
| Kruskal | MST | — | O(E log E) |
Greedy + Union-Find |
HPC-X、MPI、PMIx 与 NCCL:GPU 集群通信栈全解
在 GPU 分布式训练中,HPC-X、UCX、PMIx、NCCL 各层职责极为清晰。本文从调用链角度深度解析每个组件的边界——HPC-X 在 ncclCommInitRank 完成后就退出关键路径,NCCL 热路径完全由 GPU kernel 驱动,CPU 不参与。
阅读更多深入解析服务器内存架构:从DRAM颗粒到NUMA模式
本文从 DRAM 颗粒的物理结构出发,逐层解析 Channel、Rank、Bank、Burst、Prefetch 等核心概念,并结合 Intel Emerald Rapids (EMR) MCC/XCC 与 Granite Rapids (GNR) XCC 的真实 CPU 架构,深入探讨 UMA、NUMA、SNC2/SNC4、Hemisphere 与 Quadrant 四种内存集群模式的工作原理、性能差异及调优建议。
阅读更多