You signed in with another tab or window. Reload to refresh your session.You signed out in another tab or window. Reload to refresh your session.You switched accounts on another tab or window. Reload to refresh your session.Dismiss alert
reacted with thumbs up emoji reacted with thumbs down emoji reacted with laugh emoji reacted with hooray emoji reacted with confused emoji reacted with heart emoji reacted with rocket emoji reacted with eyes emoji
Uh oh!
There was an error while loading. Please reload this page.
EPYC 96 核机器上 g1-wbt-dance 48→96 核扩展效率的瓶颈定位:SMU 负载相关降频(附等时钟判决实验方法)
现象
在单路 EPYC 96 物理核(192 逻辑核、单 NUMA 节点)机器上,按正式协议测量
g1-wbt-dance的完整env.step()吞吐:排查过程(要点)
/proc/<pid>/task/*/schedstat(ns 级精确 CPU 时间)实测,48 核与 96 核配置在计时区内所有核均 ~99% 满载。判决实验:强制同频
用 root 将全局
cpufreq/boost置 0,把 48 核与 96 核都钉死在 2.4GHz 标称频率(绕过 boost 自治区),交错两轮测量 physics 吞吐:等时钟下扩展效率 ≈ 0.99:内存争用、IPC、调度等软件侧因素合计 <1%。
结论
96 核 ~15% 的每核速率损失全部来自 AMD SMU 的负载相关全核降频:该 physics 负载下 48 核约获 3.18GHz、96 核约 2.86GHz(频率比 ≈ 0.90,与实测效率吻合)。注意两个易踩的坑:
scaling_cur_freqsysfs 快照会显示 3.7GHz,不代表有效执行频率(请求频率≠交付频率);perfcycles/task-clock对多线程进程附着测量也有伪影,本调查早期曾因此两次得出错误结论,最终全部改用 wall-time 与 schedstat 交叉验证。对使用者的建议
bench/bench_physics.py与完整 WBT driver 的测量框架即可搭建,欢迎交流。All reactions