Miles、Slime 与 Ray:大模型后训练闭环中的编排、训练与权重同步 2026-09-17 从后训练闭环、Reward/Verifier、Ray 控制面到 Weight Sync,梳理 Miles、Slime 与分布式训练基础设施的工程关系。 Megatron LLM Post-Training Reinforcement Learning Ray SGLang 阅读更多