[experiments] Daily Experiment Report — 2026-09-26 #63590
Closed
Replies: 1 comment
|
This discussion has been marked as outdated by daily-experiment-report. A newer discussion is available at Discussion #63805. |
0 replies
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
🧪 Daily Experiment Report — 2026-09-26
51 experiments analysed across 48 workflows. 26 are READY for analysis (sample thresholds met), 25 are still COLLECTING samples. No experiment currently has a deterministic PROMOTE or REJECT decision — all decisions are EXTEND (metric-observation gaps) or INCONCLUSIVE (multi-variant, unsupported by pairwise core analysis).
⚡ Quick Stats
📋 Reason Code Breakdown (why nothing is READY_FOR_ANALYSIS with a promote/reject)
insufficient_observationsunsupported_multi_variantinsufficient_samplesmin_samplesyetguardrail_unsupportedprompt_style·ci-coachH0: no change in PR merge rate or proposal quality. H1: concise prompt reduces token usage ≥25% without degrading proposal quality
📈 View Detailed Statistics
Sample Sizes & Progress
concisedetailedCore decision: EXTEND (
guardrail_unsupported) — mandatory guardrail "run_success_rate" is not backed by a supported metric observationtool_verbosity·gpcleanH0: no change in token consumption. H1: minimal toolset reduces tokens by 10-15% while maintaining issue quality (detection accuracy + alternative research depth)
📈 View Detailed Statistics
Sample Sizes & Progress
full_bashminimal_toolsetCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparison📊 Summary
View Full Experiments Table (all 51 experiments across 48 workflows)
prompt_compressioncaveman,verboseinsufficient_observationssub_agent_strategybatch,per_scenarioinsufficient_observationssub_agent_strategysingle_agent,sub_agentsinsufficient_samplesaudit_decompositionphased_sub_agents,single_agentinsufficient_samplestone_variantassertive,clinical,narrativeunsupported_multi_variantprompt_styleconcise,detailedinsufficient_samplestone_variantneutral,urgentinsufficient_observationsprompt_styleconcise,detailedguardrail_unsupportedoutput_formatprose,ste,structuredunsupported_multi_variantsub_agent_strategysingle_agent,sub_agentsinsufficient_observationsdetail_levelbrief,comprehensiveinsufficient_samplesprompt_styleconcise,detailedinsufficient_observationsmodel_sizegpt-5.3-codex,gpt-5.3-codex-sparkinsufficient_samplesmodel_sizeagent,claude-haiku-4.5,claude-sonnet-4.6,claude-sonnet-5,small-agentunsupported_multi_variantoutput_formatexecutive_summary,full_detail,steunsupported_multi_variantprompt_styleconcise,verboseinsufficient_observationsoutput_formatconcise,detailed,steunsupported_multi_variantmodel_sizeagent,claude-haiku-4.5,claude-sonnet-4.6,claude-sonnet-5,small-agentunsupported_multi_variantmodel_sizeagent,claude-haiku-4.5,claude-sonnet-4.6,claude-sonnet-5,small-agentunsupported_multi_variantreasoning_depthmulti_candidate,single_passguardrail_unsupportedmodel_sizeinsufficient_observationsoutput_formatcollapsible,inline,steunsupported_multi_variantprompt_styleconcise,detailedinsufficient_observationsremove_redundant_context_v1insufficient_observationslog_fetch_strategyinsufficient_observationsreasoning_depthiterative,single_passguardrail_unsupportedsemgrep_output_formatbullet_list,prose,structured_sectionsunsupported_multi_varianttimeout_settingdefault,relaxed,tightunsupported_multi_variantcaveman_modeno,yesinsufficient_samplesoutput_formatannotated_brief,executive_brief,full_briefing,steunsupported_multi_variantsummary_detailbrief,detailedinsufficient_samplesprompt_styleconcise,detailed,step_by_stepunsupported_multi_varianttool_verbosityfull_bash,minimal_toolsetinsufficient_observationsprompt_styleconcise,detailedinsufficient_observationsreasoning_depthbaseline,deep,shallowunsupported_multi_variantremove_redundant_context_v1insufficient_observationssub_agent_strategysingle_agent,sub_agentsinsufficient_observationscavemanno,yesinsufficient_observationssubagent_modellarge,smallinsufficient_observationscavemanno,yesinsufficient_observationssubagent_modellarge,smallinsufficient_observationscavemanno,yesinsufficient_observationssubagent_modellarge,smallinsufficient_observationssub_agent_strategydelegated_sequential,inline_strict,single_agent_controlunsupported_multi_variantsub_agent_strategysingle_agent,sub_agentsinsufficient_observationssub_agent_decompositionparallel_sub_agents,single_agentinsufficient_observationsprompt_style_testinsufficient_observationssub_agent_strategyinsufficient_observationsmodel_sizeclaude-haiku-4.5,claude-sonnet-5insufficient_observationstone_styleconversational,formalinsufficient_observationsprefetch_strategyeager,lazyinsufficient_samples🔀 Multi-Experiment Interaction Diagnostics
Three smoke-test workflows run two simultaneous experiments each (
caveman×subagent_model):smokecopilot,smokecopilotaoaiapikey,smokecopilotaoaientra. Interaction cell counts are highly sparse (1–4 runs per 2×2 cell across all three), well belowmin_samples(20).interaction_risk_status = SPARSE_CELL_RISKfor all three. No PROMOTE decision exists in this report, so the interaction safety hold does not currently override any core decision — this is recorded for forward readiness once sample sizes grow.🎯 Recommendations
insufficient_observationsorguardrail_unsupportedeven though sample thresholds are met (READY).awfailureinvestigator,dailyissuesreport,deepreport, and others) use 3+ variants and will never resolve to PROMOTE/REJECT until the core engine supports multi-variant comparisons (or they are reduced to pairwise designs).🔧 Self-Tuning Continuation Plan
View continuation plan
Top 3 experiment actions
guardrail_unsupported(3 experiments —cicoach,dailyfact,dailysecurityredteam): wire the declared guardrail metrics (run_success_rate, native evals) into the grader/observation pipeline sodecision_guardrails.passedcan be computed instead of defaulting to unsupported.insufficient_observations(26 experiments, the largest bucket): auditmetric:fields (aic,token_count,ai_credits_total, etc.) against what the analyze pipeline can currently ingest from run artifacts vs. eval results, and prioritize native support for the most common ones (aicappears 6+ times).unsupported_multi_variant(14 experiments incl.deepreport,awfailureinvestigator,dailyissuesreport): either extend the core decision engine to support K≥3 variant comparisons with Bonferroni correction (already computed asbonferroni_alphabut unused for a decision), or split these into sequential pairwise experiments.Top 3 eval actions
eval:prefixed secondary metrics (e.g.copilot-pr-nlp-analysis→eval:insights_report_produced,deep-report→eval:output_format_goal_met). Confirm these graders are actually running and populating results so they can back the primarymetric:once promoted from secondary.pr-sous-chefanddaily-rendering-scripts-verifierusegrader:execution-durationas the primary metric — verify this custom grader source is registered and producing per-run observations distinct fromrun_duration_ms.guardrail_unsupported(daily-fact,daily-security-red-team) so guardrail pass/fail can be derived from an eval-backed proxy while native support is built.Decision-pipeline gaps for next PR
insufficient_observations/guardrail_unsupported.chi_square/bonferroni_alphaare already computed but not consumed by the decision layer.smokecopilot*workflows) should become a normalized core analysis signal rather than a report-only computation, soSPARSE_CELL_RISKcan gate PROMOTE decisions automatically instead of via prose.All reactions