门户首页
Paper Reading · Agentic Infra · arXiv 2601.07526

MegaFlow: 大规模分布式 Agent 训练编排系统

三服务架构(Model / Agent / Environment)+ 阿里云 ECS(Elastic Compute Service,弹性计算服务)编排,32% 成本降低 / 10K 并发 / 2M+ rollout execution,为下游 SWE-Universe(SWE = Software Engineering,软件工程;姊妹篇系统,构建百万级软件工程训练环境)80 万环境构建 + 50 万轨迹生成铺路。

生成时间:2026-09-03 · 版本 v0.2(v0.1 原载 teaching-lecture-notes/html-format-slides,本版迁入主站)· 生成 Agent:MiniMax Code · 载体:agentsoft-research-platform teaching-web-platform
1 2 3 4 5 背景 3 墙 · 15 min 架构 三服务 · 20 min 编排 ECS FIFO · 20 min 数字 32% / 10K · 15 min 落地 本仓同款 · 15 min 学习路径 · 总时长 ~85 min
图 1 · 学习路径(5 步:背景 → 架构 → 编排 → 数字 → 本仓落地对照)
MegaFlow 内部模块结构 · 三服务 × 子模块展开 Model Service 模型服务化 + 权重更新 Inference vLLM · SGLang · Transformers Training VeRL · FSDP · Megatron Scheduler FIFO + 显存池 Agent Service rollout 协调 + 轨迹收集 Rollout OpenHands · SWE-Agent Trajectory 存储 + 格式化 5 Scaffold SWE · Mini · OpenHands Environment Service 弹性容器执行 + 缓存 ECS ecs.re6.52xlarge / c8a ACR Docker 镜像 + layer 缓存 Orchestrator FIFO + dist semaphore 4 设计原则 ① Elastic Resource ② Hybrid Execution ③ Event-Driven ④ Delegation 3 服务解耦 + 独立扩缩容 + 阿里云 ECS 弹性实例 = 32% 成本降低 / 10K 并发 / 2M+ rollout 3 服务独立扩缩容 → 给 agent 训练 + 评测 + 数据构造提供编排底座
图 · MegaFlow 内部模块结构(三服务 × 子模块展开 + 4 设计原则 + 关键数字 32% / 10K / 2M)

概览

3
传统基础设施天花板
3
解耦服务
4
核心设计原则
10K
单集群并发

论文精读

MegaFlow · 论文精读(4 张 card)
回答「为什么 27B 模型 + 50 并发天花板」+「三服务解耦怎么落地」+「Elastic Resource 怎么压成本 32%」
卡片 1 · 背景与动机

3 个天花板:训练 agent 撞到基础设施墙

2026 年 agent 训练需要成千上万的长时 agent-environment 交互并行跑,但传统集中式基础设施撞 3 类天花板。MegaFlow 论文把这 3 类天花板拆开,一一给出解法。

核心知识点
  • Security & Isolation:训练集群安全策略禁止跑任意容器
  • Storage Scalability:仅 SWE-bench + SWE-Gym 就要 25TB Docker 镜像
  • Computational Throughput:单台 208-core 大机器最多 50 并发
  • Megatron-LM / DeepSpeed 等单大机路线撞了这 3 类墙
课堂实训
用 docker stats 观察本地一个 27B 推理容器吃多少 memory + vRAM,对比论文说的「25TB 镜像 + 50 并发」瓶颈量级。
思考与讨论
为什么「单台大机器」路线在 agent 训练场景失效,但传统 LLM pretraining 用得好?两种 workload 的本质差异是什么?
卡片 2 · 三服务架构

Model / Agent / Environment 解耦 + 4 设计原则

把训练基础设施拆成 3 个独立服务,各自弹性扩展;4 个设计原则(弹性 / 混合执行 / 事件驱动 / 委托专业系统)保证解耦有效。

核心知识点
  • Model Service:vLLM / SGLang(inference)+ VeRL / FSDP / Megatron(training)
  • Agent Service:OpenHands / SWE-Agent / mini-SWE-Agent + Qwen Code / Claude Code(rollout 协调)
  • Environment Service:阿里云 ECS(弹性计算实例)+ ACR(阿里云容器镜像仓库)+ Docker layer 缓存(on-demand 镜像)
  • 4 设计原则:Elastic Resource / Hybrid Execution / Event-Driven / Specialized Delegation
课堂实训
对照本仓 experiment_modules/solving/ 看 4 brand agent + 8 runner 如何呼应「Model/Agent/Environment」三层分离。
思考与讨论
如果用「单大机 + 本地 Docker」跑 50 并发就够,为什么要拆 3 个独立服务?规模化的成本拐点在哪里?
卡片 3 · 阿里云 ECS 编排

many-small-instances + FIFO scheduler + 分布式信号量

替代「少大实例」,用阿里云 ECS 弹性小实例 + FIFO(First In First Out,先进先出——先提交的任务先被调度,不插队)调度器 + 分布式信号量,把 50 并发的天花板推到 10K 并发 + 2M+ rollout。

核心知识点
  • Elastic Resource:many-small-instances 替代 few-large-instances(208-core → 52xlarge / 2xlarge 池)
  • Hybrid Execution:ephemeral(隔离)/ persistent(资源效率)双模式
  • Event-Driven Coordination:替代复杂 consensus 协议(FIFO scheduler + 信号量)
  • Specialized Component Delegation:容器编排 / 存储 / 监控委托给 ACR / ECS / 云监控
课堂实训
看本仓 runtime-cache/venvs/<repo>__<commit>/ 目录结构,体会「ephemeral venv 按需建」思想 vs MegaFlow 的 ephemeral 容器是同一思路。
思考与讨论
FIFO 调度器对 agent rollout 是否足够?哪些场景需要更复杂的优先级(interactive agent vs batch rollout)?
卡片 4 · 关键成果

32% 成本 / 10K 并发 / 2M rollout + 对 SWE-Universe 的铺垫

实际部署数据:相对基线 32% 成本降低,10K 并发 agent 任务,2M+ 训练 rollout 跑通。更重要的是为下游 SWE-Universe(80 万 SWE 环境 + 50 万轨迹)提供了编排底座。

核心知识点
  • 成本:相对单大机基线 32% 降低(云资源弹性 + layer 缓存 + 事件驱动)
  • 并发:单集群 10K 并发 agent-environment 任务(vs 单大机 50 并发天花板)
  • 规模:累计 2M+ 训练 rollout execution 完成
  • 下游:SWE-Universe 在 MegaFlow 上构建 807,693 SWE 环境 + 跑 50 万轨迹
课堂实训
对照本仓 experiment_warehouse/ 数据层(gitignore 排除,3.2GB experiments.db + 75MB swe_bench.db),看本仓数据规模与 MegaFlow 上「百万级」差几个量级,理解「数据 vs 基础设施」是不同扩展问题。
思考与讨论
为什么 MegaFlow 选了阿里云 ECS(公有云)而不是 Kubernetes 私有部署?两类基础设施的能力边界和成本结构有何不同?