Replies: 1 comment
|
我会把“可复现”和“测试题永远保密”分开设计。服务端评测能隐藏评分逻辑、标准答案和一部分环境状态,但只要 Agent 必须看到题面,题面就可能进入提交者或模型服务商的日志;托管本身不能保证不污染。 针对物理建模,我倾向于三层:
物理问题还适合加入自动验证:量纲一致性、守恒量、边界条件、极限情形,以及未暴露给 Agent 的参数点上的仿真误差。只匹配最终表达式字符串会漏掉数学等价解,也容易变成答案记忆。 服务端另外限制提交次数和反馈粒度,避免反复查询逐步拟合隐藏集;记录工具/模型版本和预算,避免把额外算力误当能力提升。动态更新的路线可以参考 LiveBench,但“定期更新”也只是降低污染风险,不是永不泄漏的证明。 这里最值得先决定的是:你要测的是“已知物理体系里的参数求解”,还是“从描述中建立新的模型”?这会直接决定留出集应该如何划分。 |
0 replies
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
由 @wangzizhe 最初在 Issue #1077 中提出,为方便讨论迁移到 Discussions。
All reactions