Skip to content

Benchmark: 固化必选 MBA runtime 的可复核 A/B 基线与性能门槛 #1260

Description

@TATP-233

Parent: #1259

Evidence: #1253, #1255, #1256, #1257

一句话问题

#1253 给出了重要的 MBA/main collector 差值,但原始结果、完整软件环境和重复运行离散度没有保留下来,而且当前 dev 已合入 #1258,尚无可作为后续各优化共同基准的最新 pinned baseline。

为什么现在做

最小交付结果

在同一硬件上固定 main direct 与最新 MBA dev SHA,对 #1253 的 7 个 case 各独立运行至少三次,保存原始 JSON/CSV、完整环境和 median/离散度;由 maintainer 据此确认最终 MBA 性能门槛。direct 只作 benchmark baseline,不是候选 production 模式。

In scope

  • 固定 commit SHA、Hydra owner config、num_envs、warmup/measure steps、replay capacity 和线程设置。
  • 记录 OS/kernel、Python、NumPy、Torch、MuJoCo、mujoco_uni_runtime、Motrix 版本及硬件。
  • 7 个 case 每侧至少三次独立运行,原始文件作为一次性 issue 附件保存。
  • 分开报告 collector、physics、update_state、reset_done,明确 branch-level 与局部归因口径。
  • 给出建议门槛与未达到门槛时的例外清单,由 maintainer 做产品决定。

Non-goals

  • 不修改 benchmark 测量语义,不做任何性能优化。
  • 不新增常规 CI、dashboard、长期 artifact 服务或新的 benchmark framework。
  • 不用 direct fallback、配置切换或改变 MBA 语义换数字。

Owner 与预计改动

Acceptance criteria

Stop conditions

  • 复现需要修改 collector/runner/backend/manager 或 benchmark 测量语义。
  • 两分支有效 task/config 已无法对齐,或同机重复波动大到无法判断优化收益。
  • 需要新增长期 evidence/CI infrastructure 才能完成。

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions