[experiments] Daily Experiment Report — 2026-09-10 #59921
Closed
Replies: 1 comment
|
This discussion has been marked as outdated by daily-experiment-report. A newer discussion is available at Discussion #60223. |
0 replies
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
🧪 Daily Experiment Report — 2026-09-10
51 experiments analysed across 48 workflows. 22 are 🟢 READY (all variants past
min_samples), but none has a deterministic PROMOTE or REJECT decision today — every experiment is blocked on a decision-pipeline gap (unsupported native metrics for guardrails/multi-variant tests, or outcome data not yet ingested). No interaction safety holds apply since no experiment reachedPROMOTE.⚡ Quick Stats
🟢 Ready for Analysis (2-variant experiments with tracking issues)
prompt_compression·agentperformanceanalyzer(not specified)
📈 View Detailed Statistics
Sample Sizes & Progress
cavemanverboseCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisontone_variant·awfailureinvestigator(not specified)
📈 View Detailed Statistics
Sample Sizes & Progress
assertiveclinicalnarrativeCore decision: INCONCLUSIVE (
unsupported_multi_variant) — automatic decisions currently require exactly two variantsprompt_style·cicoachH0: no change in PR merge rate or proposal quality. H1: concise prompt reduces token usage ≥25% without degrading proposal quality
📈 View Detailed Statistics
Sample Sizes & Progress
concisedetailedCore decision: EXTEND (
guardrail_unsupported) — mandatory guardrail "run_success_rate" is not backed by a supported metric observationreasoning_depth·dailyfactH0: no change in discussion engagement rate. H1: multi_candidate produces more novel verses with higher reaction counts (expected +20% reactions).
📈 View Detailed Statistics
Sample Sizes & Progress
multi_candidatesingle_passCore decision: EXTEND (
guardrail_unsupported) — mandatory guardrail "empty_output_rate" is not backed by a supported metric observationprompt_style·dailynews(not specified)
📈 View Detailed Statistics
Sample Sizes & Progress
concisedetailedCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonreasoning_depth·dailysecurityredteamH0: no change in finding quality. H1: iterative reduces false-positive rate by ≥20% at ≤30% token overhead
📈 View Detailed Statistics
Sample Sizes & Progress
iterativesingle_passCore decision: EXTEND (
guardrail_unsupported) — mandatory guardrail "run_success_rate" is not backed by a supported metric observationprompt_style·issuearborist(not specified)
📈 View Detailed Statistics
Sample Sizes & Progress
concisedetailedCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisontone_style·typist(not specified)
📈 View Detailed Statistics
Sample Sizes & Progress
conversationalformalCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparison📊 Summary — All 51 Experiments
View Full Experiments Table
tone_variantunsupported_multi_variantcavemaninsufficient_observationssubagent_modelinsufficient_observationssub_agent_strategyinsufficient_observationssub_agent_strategyinsufficient_observationscavemaninsufficient_observationssubagent_modelinsufficient_observationscavemaninsufficient_observationssubagent_modelinsufficient_observationsprompt_styleinsufficient_observationsprompt_styleinsufficient_observationsreasoning_depthguardrail_unsupportedprompt_compressioninsufficient_observationssub_agent_strategyinsufficient_observationstool_verbosityinsufficient_observationsprompt_styleinsufficient_observationsreasoning_depthguardrail_unsupportedprompt_styleguardrail_unsupportedtone_styleinsufficient_observationssub_agent_decompositioninsufficient_observationssub_agent_strategyinsufficient_observationsprompt_styleinsufficient_observationsoutput_formatunsupported_multi_variantoutput_formatunsupported_multi_variantoutput_formatunsupported_multi_variantoutput_formatunsupported_multi_variantmodel_sizeunsupported_multi_variantmodel_sizeunsupported_multi_variantmodel_sizeunsupported_multi_variantoutput_formatunsupported_multi_variantsemgrep_output_formatunsupported_multi_variantaudit_decompositioninsufficient_samplesprompt_styleunsupported_multi_variantsub_agent_strategyunsupported_multi_varianttone_variantinsufficient_samplessub_agent_strategyinsufficient_samplesdetail_levelinsufficient_samplescaveman_modeinsufficient_samplesprefetch_strategyinsufficient_samplessummary_detailinsufficient_samplesprompt_styleinsufficient_samplesreasoning_depthunsupported_multi_variantmodel_sizeinsufficient_samplestimeout_settingunsupported_multi_variantmodel_sizeinsufficient_observationsremove_redundant_context_v1insufficient_observationslog_fetch_strategyinsufficient_observationsremove_redundant_context_v1insufficient_observationsprompt_style_testinsufficient_observationssub_agent_strategyinsufficient_observationsmodel_sizeinsufficient_observations🔧 Self-Tuning Continuation Plan
Top 3 experiment actions
guardrail_unsupported(cicoach, dailyfact, dailysecurityredteam) — wirerun_success_rateandempty_output_rateguardrail metrics to a supported native observation source (e.g. workflow run conclusion + safe-output emptiness check) so these 3 READY 2-variant experiments can produce a real PROMOTE/REJECT decision instead of stalling indefinitely.unsupported_multi_variantsupport (14 experiments, e.g. awfailureinvestigator, dailycodemetrics, output_format family) — these are among the highest-run-count experiments (awfailureinvestigator has 402 runs) but the analysis layer only supports 2-variant comparisons; add a Kruskal-Wallis or omnibus + pairwise post-hoc path so 3+ variant experiments aren't permanentlyINCONCLUSIVE.insufficient_observations(25 experiments, largest bucket) — many READY experiments (smokecopilot family, dailyastrostylelitemarkdownspellcheck, gpclean, issuearborist, typist) have ample samples but the decision layer lacks per-run outcome-metric correlation; prioritize wiringtoken_count_per_run/duration observations for the highest-n workflows first (smokecopilot: 354 runs, smokegemini: 262 runs).Top 3 eval actions
cicoach,dailyfact,dailysecurityredteamprompts sorun_success_rate/empty_output_rateguardrails become graded rather than unsupported.output_formatfamily experiments (deepreport, dailycodemetrics, dailycompilerquality, dailyissuesreport, copilotagentanalysis) — tighten eval rubrics to scorestevariant outputs specifically, sincesteconsistently lags other variants in sample accumulation (e.g. copilotagentanalysisste=3/30, dailysemgrepscanstructured_sections=22/30), suggesting either lower assignment weight or higher failure/skip rate worth investigating via evals.sub_agent_strategy/sub_agent_decompositionexperiments (dailyagentrxtraceoptimizer, agentpersonaexplorer, smokepi, smokeantigravity, smokegemini) comparing sub-agent vs single-agent output quality directly, to give theinsufficient_observationsreason code a path to real evidence.Decision-pipeline gaps for next PR
guardrail_unsupported(3 experiments) andinsufficient_observations(25 experiments) together account for 28/51 (55%) of blocked decisions — both point to the same root gap: native per-run outcome-metric observation isn't yet wired into the decision core for most workflows.unsupported_multi_variant(14 experiments) is a normalized-analysis gap: the core decision layer needs a K≥3 variant comparison path (e.g. Kruskal-Wallis + Bonferroni-corrected pairwise) before these experiments (many with 80-400+ runs) can ever resolve.PROMOTE; once the guardrail/observation gaps above are closed, factorial interaction cells (e.g.smokecopilotrunning bothcavemanandsubagent_modelsimultaneously) should become a normalized core analysis signal rather than a reporting-layer safety hold.All reactions