[experiments] Daily Experiment Report — 2026-09-30 #64442
Closed
Replies: 1 comment
|
This discussion has been marked as outdated by daily-experiment-report. A newer discussion is available at Discussion #64725. |
0 replies
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
🧪 Daily Experiment Report — 2026-09-30
52 experiments analysed across 49 workflows. 26 are 🟢 READY on sample counts, but none has a
PROMOTEorREJECTdecision: outcome observations, guardrail metrics, or multi-variant support are still missing.⚡ Quick Stats
smokecopilot,smokecopilotaoaiapikey,smokecopilotaoaientra)Reason-code breakdown
insufficient_observations: 26unsupported_multi_variant: 14insufficient_samples: 9guardrail_unsupported: 3📊 All experiments (core decisions, verbatim from `gh aw experiments analyze`)
prompt_compressionagentperformanceanalyzercaveman:72,verbose:59 (min 20)insufficient_observationssub_agent_strategyagentpersonaexplorerbatch:68,per_scenario:63 (min 20)insufficient_observationssub_agent_strategyarchitectureguardiansingle_agent:17,sub_agents:21 (min 20)insufficient_samplesaudit_decompositionauditworkflowsphased_sub_agents:48,single_agent:38 (min 264)insufficient_samplestone_variantawfailureinvestigatorassertive:165,clinical:161,narrative:164 (min 20)unsupported_multi_variantprompt_styleblogauditorconcise:4,detailed:7 (min 20)insufficient_samplestone_variantbreakingchangecheckerneutral:28,urgent:25 (min 20)insufficient_observationsprompt_stylecicoachconcise:39,detailed:59 (min 20)guardrail_unsupportedoutput_formatcopilotagentanalysisprose:34,ste:3,structured:43 (min 30)unsupported_multi_variantnlp_prompt_stylecopilotprnlpanalysisconcise:0,structured:0 (min 30)insufficient_samplessub_agent_strategydailyagentrxtraceoptimizersingle_agent:44,sub_agents:43 (min 20)insufficient_observationsdetail_leveldailyarchitecturediagrambrief:12,comprehensive:7 (min 20)insufficient_samplesprompt_styledailyastrostylelitemarkdownspellcheckconcise:77,detailed:72 (min 20)insufficient_observationsmodel_sizedailycachestrategyanalyzergpt-5.3-codex:13,gpt-5.3-codex-spark:11 (min 20)insufficient_samplesmodel_sizedailycavemanoptimizeragent:1,claude-haiku-4.5:72,claude-sonnet-4.6:34,claude-sonnet-5:9,small-agent:2 (min 20)unsupported_multi_variantoutput_formatdailycodemetricsexecutive_summary:54,full_detail:58,ste:16 (min 20)unsupported_multi_variantprompt_styledailycommunityattributionconcise:70,verbose:70 (min 20)insufficient_observationsoutput_formatdailycompilerqualityconcise:55,detailed:64,ste:17 (min 20)unsupported_multi_variantmodel_sizedailydochealeragent:2,claude-haiku-4.5:61,claude-sonnet-4.6:43,claude-sonnet-5:11,small-agent:1 (min 20)unsupported_multi_variantmodel_sizedailydocupdateragent:1,claude-haiku-4.5:49,claude-sonnet-4.6:47,claude-sonnet-5:14,small-agent:2 (min 20)unsupported_multi_variantreasoning_depthdailyfactmulti_candidate:41,single_pass:57 (min 30)guardrail_unsupportedmodel_sizedailyfunctionnamerinsufficient_observationsoutput_formatdailyissuesreportcollapsible:61,inline:63,ste:22 (min 20)unsupported_multi_variantprompt_styledailynewsconcise:63,detailed:51 (min 20)insufficient_observationsremove_redundant_context_v1dailyrenderingscriptsverifierinsufficient_observationslog_fetch_strategydailysafeoutputoptimizerinsufficient_observationsreasoning_depthdailysecurityredteamiterative:81,single_pass:59 (min 30)guardrail_unsupportedsemgrep_output_formatdailysemgrepscanbullet_list:28,prose:27,structured_sections:22 (min 30)unsupported_multi_varianttimeout_settingdailysubagentoptimizerdefault:2,relaxed:1,tight:1 (min 20)unsupported_multi_variantcaveman_modedataflowprdiscussiondatasetno:6,yes:10 (min 20)insufficient_samplesoutput_formatdeepreportannotated_brief:64,executive_brief:84,full_briefing:59,ste:42 (min 20)unsupported_multi_variantsummary_detaildependabotcampaignbrief:6,detailed:6 (min 20)insufficient_samplesprompt_styledependabotgocheckerconcise:19,detailed:18,step_by_step:16 (min 20)unsupported_multi_varianttool_verbositygpcleanfull_bash:60,minimal_toolset:68 (min 20)insufficient_observationsprompt_styleissuearboristconcise:48,detailed:39 (min 20)insufficient_observationsreasoning_depthplanbaseline:4,deep:2,shallow:1 (min 20)unsupported_multi_variantremove_redundant_context_v1prsouschefinsufficient_observationssub_agent_strategysmokeantigravitysingle_agent:99,sub_agents:109 (min 20)insufficient_observationscavemansmokecopilotno:186,yes:186 (min 20)insufficient_observationssubagent_modelsmokecopilotlarge:176,small:176 (min 20)insufficient_observationscavemansmokecopilotaoaiapikeyno:95,yes:95 (min 20)insufficient_observationssubagent_modelsmokecopilotaoaiapikeylarge:95,small:95 (min 20)insufficient_observationscavemansmokecopilotaoaientrano:81,yes:82 (min 20)insufficient_observationssubagent_modelsmokecopilotaoaientralarge:82,small:81 (min 20)insufficient_observationssub_agent_strategysmokecopilotsubagentsdelegated_sequential:17,inline_strict:14,single_agent_control:19 (min 30)unsupported_multi_variantsub_agent_strategysmokegeminisingle_agent:129,sub_agents:144 (min 20)insufficient_observationssub_agent_decompositionsmokepiparallel_sub_agents:42,single_agent:34 (min 20)insufficient_observationsprompt_style_testsmokeprojectinsufficient_observationssub_agent_strategysmoketemporaryidinsufficient_observationsmodel_sizetestqualitysentinelclaude-haiku-4.5:52,claude-sonnet-5:53 (min 20)insufficient_observationstone_styletypistconversational:49,formal:42 (min 20)insufficient_observationsprefetch_strategyweeklyblogpostwritereager:6,lazy:10 (min 20)insufficient_samplesNotes on scope
analyzereturned no per-variant outcome observations (observationsempty), so descriptive stats would not be meaningful.issue:field, so no issue comments or labels were emitted.🔁 Self-Tuning Continuation Plan
Top experiment actions
insufficient_observationsexperiments (e.g.smokecopilot,smokegemini,gpclean,typist) so READY ones can reach PROMOTE/REJECT.run_success_rate/empty_output_rateguardrails with supported metrics (cicoach,dailyfact,dailysecurityredteam) to clearguardrail_unsupported.awfailureinvestigator,deepreport,dailyissuesreport,model_sizefamily) to pairwise contrasts or add core multi-variant support;stearms are under-sampled (3–42 runs).Top eval actions
output_length_chars/output_token_countforoutput_formatexperiments (deepreport,dailyissuesreport,dailycodemetrics,dailycompilerquality).prompt_styleworkflows (dailynews,issuearborist,dailyastrostylelitemarkdownspellcheck).dailysecurityredteamprompts.Decision-pipeline gaps
run_success_rate,empty_output_rate,token_count_per_run,run_duration_ms(dailysafeoutputoptimizerhas no variant data).experiments listneeds theexperiments/*branches fetched locally;--repoonanalyzedid not work from the sandbox.caveman×subagent_model) into core analysis.dailyfunctionnamer,dailyrenderingscriptsverifier,prsouschef,smokeproject,smoketemporaryid,dailysafeoutputoptimizer.All reactions