问题/痛点描述
【需求背景】
投机推理已成为大模型推理加速的重要手段,通过draft/proposer提前生成候选token,再由target model验证采信,从而减少逐token解码开销。但仅依赖TTFT、TPOT、吞吐、QPS等结果指标,难以解释开启投机推理后的加速收益、收益不明显或性能退化原因。
【需求上下文】
AISBench当前已支持服务化性能评测,可输出TTFT、TPOT、吞吐、QPS等性能指标。为增强对推理优化效果的解释能力,需要在现有性能评测流程中补充投机推理过程指标采集与展示能力,当前优先面向vLLM等可通过/metrics暴露speculative decoding指标的推理服务。
【需求描述】
AISBench需要支持投机推理测评及采信率显示能力,通过采集推理服务侧draft token数、accepted token数、draft轮数、分位置accepted token数等指标,计算并展示总体采信率、平均采信长度、分位置采信率等结果,并与现有性能指标共同输出,帮助用户判断投机推理是否生效、配置是否合理以及性能收益是否可解释。
建议方案
参考vllm benchmark实现
备选方案
No response
预期价值
补充竞争力
参与意向
问题/痛点描述
【需求背景】
投机推理已成为大模型推理加速的重要手段,通过draft/proposer提前生成候选token,再由target model验证采信,从而减少逐token解码开销。但仅依赖TTFT、TPOT、吞吐、QPS等结果指标,难以解释开启投机推理后的加速收益、收益不明显或性能退化原因。
【需求上下文】
AISBench当前已支持服务化性能评测,可输出TTFT、TPOT、吞吐、QPS等性能指标。为增强对推理优化效果的解释能力,需要在现有性能评测流程中补充投机推理过程指标采集与展示能力,当前优先面向vLLM等可通过/metrics暴露speculative decoding指标的推理服务。
【需求描述】
AISBench需要支持投机推理测评及采信率显示能力,通过采集推理服务侧draft token数、accepted token数、draft轮数、分位置accepted token数等指标,计算并展示总体采信率、平均采信长度、分位置采信率等结果,并与现有性能指标共同输出,帮助用户判断投机推理是否生效、配置是否合理以及性能收益是否可解释。
建议方案
参考vllm benchmark实现
备选方案
No response
预期价值
补充竞争力
参与意向