[experiments] Daily Experiment Report — 2026-09-29 #64219
Closed
Replies: 1 comment
|
This discussion has been marked as outdated by daily-experiment-report. A newer discussion is available at Discussion #64442. |
0 replies
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
🧪 Daily Experiment Report — 2026-09-29
48 workflows with 51 experiments were analysed. No experiment has a PROMOTE or REJECT decision. 31 are
EXTENDand 14 areINCONCLUSIVE. MostREADYexperiments are blocked by missing outcome observations, not by sample size.⚡ Quick Stats
READY)Reason codes:
insufficient_observationsguardrail_unsupportedunsupported_multi_variantinsufficient_samplesinsufficient_observationsunsupported_multi_variant📊 All experiments (core decisions)
prompt_compressioncaveman=71,verbose=59insufficient_observationssub_agent_strategybatch=67,per_scenario=63insufficient_observationssub_agent_strategysingle_agent=17,sub_agents=21insufficient_samplesaudit_decompositionphased_sub_agents=47,single_agent=38insufficient_samplestone_variantassertive=163,clinical=156,narrative=159unsupported_multi_variantprompt_styleconcise=4,detailed=7insufficient_samplestone_variantneutral=27,urgent=25insufficient_observationsprompt_styleconcise=39,detailed=58guardrail_unsupportedoutput_formatprose=34,ste=3,structured=43unsupported_multi_variantsub_agent_strategysingle_agent=43,sub_agents=43insufficient_observationsdetail_levelbrief=12,comprehensive=7insufficient_samplesprompt_styleconcise=76,detailed=72insufficient_observationsmodel_sizegpt-5.3-codex=12,gpt-5.3-codex-spark=11insufficient_samplesmodel_sizeagent=1,claude-haiku-4.5=71,claude-sonnet-4.6=34,claude-sonnet-5=9,small-agent=2unsupported_multi_variantoutput_formatexecutive_summary=54,full_detail=58,ste=16unsupported_multi_variantprompt_styleconcise=70,verbose=70insufficient_observationsoutput_formatconcise=55,detailed=63,ste=17unsupported_multi_variantmodel_sizeagent=2,claude-haiku-4.5=60,claude-sonnet-4.6=43,claude-sonnet-5=11,small-agent=1unsupported_multi_variantmodel_sizeagent=1,claude-haiku-4.5=49,claude-sonnet-4.6=47,claude-sonnet-5=13,small-agent=2unsupported_multi_variantreasoning_depthmulti_candidate=41,single_pass=56guardrail_unsupportedmodel_sizeinsufficient_observationsoutput_formatcollapsible=60,inline=63,ste=22unsupported_multi_variantprompt_styleconcise=62,detailed=51insufficient_observationsremove_redundant_context_v1insufficient_observationslog_fetch_strategyinsufficient_observationsreasoning_depthiterative=81,single_pass=58guardrail_unsupportedsemgrep_output_formatbullet_list=28,prose=27,structured_sections=22unsupported_multi_varianttimeout_settingdefault=2,relaxed=1,tight=1unsupported_multi_variantcaveman_modeno=6,yes=10insufficient_samplesoutput_formatannotated_brief=62,executive_brief=84,full_briefing=58,ste=41unsupported_multi_variantsummary_detailbrief=6,detailed=6insufficient_samplesprompt_styleconcise=19,detailed=18,step_by_step=16unsupported_multi_varianttool_verbosityfull_bash=60,minimal_toolset=67insufficient_observationsprompt_styleconcise=47,detailed=39insufficient_observationsreasoning_depthbaseline=4,deep=2,shallow=1unsupported_multi_variantremove_redundant_context_v1insufficient_observationssub_agent_strategysingle_agent=99,sub_agents=109insufficient_observationscavemanno=186,yes=186insufficient_observationssubagent_modellarge=176,small=176insufficient_observationscavemanno=95,yes=95insufficient_observationssubagent_modellarge=95,small=95insufficient_observationscavemanno=81,yes=82insufficient_observationssubagent_modellarge=82,small=81insufficient_observationssub_agent_strategydelegated_sequential=17,inline_strict=14,single_agent_control=19unsupported_multi_variantsub_agent_strategysingle_agent=129,sub_agents=144insufficient_observationssub_agent_decompositionparallel_sub_agents=42,single_agent=34insufficient_observationsprompt_style_testinsufficient_observationssub_agent_strategyinsufficient_observationsmodel_sizeclaude-haiku-4.5=47,claude-sonnet-5=44insufficient_observationstone_styleconversational=48,formal=42insufficient_observationsprefetch_strategyeager=6,lazy=10insufficient_samples🔀 Interaction diagnostics (workflows with two experiments)
caveman×subagent_modelcells (n each). All cells have n ≥ 20, so there is noSPARSE_CELL_RISK.smokecopilotaoaiapikeyshows a non-independent assignment pattern. This is a possible allocation or assignment-correlation bug and should be checked.🔁 Self-Tuning Continuation Plan
Top 3 experiment actions
token_count_per_run, run success, and the workflow metrics) into the state branch. This clears 26insufficient_observationsdecisions; the 20 that areREADYon that reason are the first ones to unblock.unsupported_multi_variantresults, includingdeepreport,awfailureinvestigatorand theoutput_format/steexperiments.cicoach,dailyfactanddailysecurityredteama supported source forrun_success_rateandempty_output_rate(guardrail_unsupported).Top 3 eval actions
output_formatworkflows (deepreport,dailyissuesreport,dailycodemetrics) to get readability observations.sub_agent_strategyworkflows (smokegemini,smokeantigravity,dailyagentrxtraceoptimizer), which have the highest sample counts.prompt_styleworkflows (issuearborist,dailynews,dailycommunityattribution).Decision-pipeline gaps for the next PR
smokecopilotaoaiapikeyp=0.0065 is not currently surfaced by core.experiments list --repoflag is unsupported, and the CLI needed experiment branches fetched locally.prsouschef,dailyrenderingscriptsverifier,dailysafeoutputoptimizer,smokeproject,smoketemporaryid) anddailyfunctionnamerhas none recorded. Check thatpush_experiments_stateruns.All reactions