[experiments] Daily Experiment Report — 2026-09-19 #61982
Closed
Replies: 1 comment
|
This discussion has been marked as outdated by daily-experiment-report. A newer discussion is available at Discussion #62154. |
0 replies
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
🧪 Daily Experiment Report — 2026-09-19
51 experiments analysed across 42 workflows with active A/B tests. 24 have reached the core analysis layer's READY sample threshold, but every experiment's core decision is still EXTEND or INCONCLUSIVE — no PROMOTE/REJECT verdicts today because primary-metric observations aren't yet wired into most experiments, and several 3+-variant tests hit
unsupported_multi_variant. 3 tracking issues (breaking-change-checker,daily-safe-output-optimizer,weekly-blog-post-writer) were missingexperiment:active; labels have been applied.breaking-change-checker'stone_variantnewly reached READY today.⚡ Quick Stats
tone_variant·aw-failure-investigatorCore decision: INCONCLUSIVE (
unsupported_multi_variant) — automatic decisions currently require exactly two variantsreasoning_depth·daily-security-red-teamCore decision: EXTEND (
guardrail_unsupported) — mandatory guardrail "run_success_rate" is not backed by a supported metric observationprompt_compression·agent-performance-analyzerCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonprompt_style·daily-newsCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonprompt_style·ci-coachCore decision: EXTEND (
guardrail_unsupported) — mandatory guardrail "run_success_rate" is not backed by a supported metric observation📊 Summary — All Experiments
View Full Experiments Table (51 experiments)
tone_variantunsupported_multi_variant#36105reasoning_depthguardrail_unsupported#31673prompt_compressioninsufficient_observations#33280prompt_styleinsufficient_observations#31190prompt_styleguardrail_unsupported#32335cavemaninsufficient_observationssubagent_modelinsufficient_observationssub_agent_strategyinsufficient_observationssub_agent_strategyinsufficient_observationsoutput_formatunsupported_multi_variantcavemaninsufficient_observationssubagent_modelinsufficient_observationscavemaninsufficient_observationssubagent_modelinsufficient_observationsprompt_styleinsufficient_observationsprompt_styleinsufficient_observationsoutput_formatunsupported_multi_variant#30573output_formatunsupported_multi_variant#32390output_formatunsupported_multi_variant#1sub_agent_strategyinsufficient_observationstool_verbosityinsufficient_observationsmodel_sizeunsupported_multi_variantmodel_sizeunsupported_multi_variantmodel_sizeunsupported_multi_variantreasoning_depthguardrail_unsupported#31324tone_styleinsufficient_observations#34032output_formatunsupported_multi_variantsub_agent_strategyinsufficient_observationssemgrep_output_formatunsupported_multi_variant#32795prompt_styleinsufficient_observations#30015sub_agent_decompositioninsufficient_observationsaudit_decompositioninsufficient_samples#43177prompt_styleunsupported_multi_varianttone_variantinsufficient_observations#42467sub_agent_strategyunsupported_multi_variant#47551sub_agent_strategyinsufficient_samplesdetail_levelinsufficient_samples#31926caveman_modeinsufficient_samples#37102prefetch_strategyinsufficient_samples#38590model_sizeinsufficient_samplessummary_detailinsufficient_samplesprompt_styleinsufficient_samplesreasoning_depthunsupported_multi_variant#42941model_sizeinsufficient_observations#43530timeout_settingunsupported_multi_variantmodel_sizeinsufficient_observationsremove_redundant_context_v1insufficient_observationslog_fetch_strategyinsufficient_observations#38094remove_redundant_context_v1insufficient_observationsprompt_style_testinsufficient_observationssub_agent_strategyinsufficient_observationsView 2×2 interaction cells for `caveman` × `subagent_model`
Three workflows (
smoke-copilot,smoke-copilot-aoai-apikey,smoke-copilot-aoai-entra) run two concurrent experiments (caveman×subagent_model) on shared runs. Interaction cells computed fromrecent_runsassignments correlated with run outcomes:interaction_risk_status: SPARSE_CELL_RISK in all three (every cell has n < min_samples=20). No PROMOTE core decisions exist in these experiments, so this is informational only — the safety hold rule (downgrade PROMOTE→EXTEND on sparse cells) does not need to trigger today.🔧 Self-Tuning Continuation Plan
Top 3 experiment actions
awfailureinvestigator/tone_variantand 13 other multi-variant (3+) experiments are stuck onunsupported_multi_variant— extend the core analysis engine to support pairwise or ANOVA-style comparisons for K≥3 variants sodeep-report,daily-code-metrics,daily-issues-report,daily-semgrep-scan,plan,dependabot-go-checker,copilot-agent-analysis,daily-compiler-quality,daily-caveman-optimizer,daily-doc-healer,daily-doc-updater,smoke-copilot-sub-agents, anddependabot-go-checkercan graduate past EXTEND.cicoach,daily-fact,daily-security-red-team, plus others) are blocked onguardrail_unsupported— wire nativerun_success_rate/empty_output_ratemetric emission into grader output so guardrails can evaluate pass/fail instead of blocking every decision.breaking-change-checker'stone_variantreached the analysis-layer READY threshold (20/variant) today but its own frontmattermin_samples: 194is far higher — reconcile the two thresholds so tracking-issue "ready" labels reflect the experiment's declared power requirement, not just the engine default.Top 3 eval actions
metric(e.g.issue_engagement_rate,token_count_per_run,aic) as structured run outputs — currentlyinsufficient_observationsdominates (37/51 EXTEND decisions) because no per-run metric value is being captured for statistical comparison.output_format/STE experiments (deep-report,daily-code-metrics,daily-issues-report,daily-compiler-quality,daily-semgrep-scan), tighten eval questions to explicitly scoresecondary_metricslikeoutput_char_lengthanddiscussion_reactionsso verbosity/readability tradeoffs become measurable.cicoach,daily-fact,daily-security-red-team), add an eval question mapped directly torun_success_rate/empty_output_ratesoguardrail_unsupportedconverts to PASS/FAIL guardrail evaluation.Decision-pipeline gaps for next PR
insufficient_observations(23 experiments) andguardrail_unsupported(3 experiments) are the two largest unresolved gaps — no experiment can reach PROMOTE/REJECT until primary-metric and guardrail-metric observation pipelines exist.unsupported_multi_variant(14 experiments) blocks all K≥3 variant experiments from any decision; this should become a normalized core analysis capability (e.g., omnibus test + pairwise post-hoc) rather than a permanent INCONCLUSIVE state.report_actiondowngrades happen automatically without manual review.All reactions