[experiments] Daily Experiment Report — 2026-10-02 #64967
Closed
Replies: 1 comment
|
This discussion has been marked as outdated by daily-experiment-report. A newer discussion is available at Discussion #65286. |
0 replies
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
🧪 Daily Experiment Report — 2026-10-02
52 experiments analysed across 49 workflows. No PROMOTE or REJECT decisions; 38 are EXTEND and 14 INCONCLUSIVE. No interaction safety holds (no workflow runs multiple experiments with a PROMOTE decision).
⚡ Quick Stats
insufficient_observations: 26,unsupported_multi_variant: 14,insufficient_samples: 9,guardrail_unsupported: 3gh aw experiments analyze.📊 All experiments
prompt_compressioncaveman=73,verbose=60insufficient_observationssub_agent_strategybatch=69,per_scenario=64insufficient_observationssub_agent_strategysingle_agent=17,sub_agents=21insufficient_samplesaudit_decompositionphased_sub_agents=49,single_agent=38insufficient_samplestone_variantassertive=171,clinical=166,narrative=166unsupported_multi_variantprompt_styleconcise=4,detailed=8insufficient_samplestone_variantneutral=30,urgent=25insufficient_observationsprompt_styleconcise=41,detailed=59guardrail_unsupportedoutput_formatprose=34,ste=3,structured=43unsupported_multi_variantnlp_prompt_styleconcise=0,structured=0insufficient_samplessub_agent_strategysingle_agent=44,sub_agents=45insufficient_observationsdetail_levelbrief=12,comprehensive=7insufficient_samplesprompt_styleconcise=79,detailed=72insufficient_observationsmodel_sizegpt-5.3-codex=15,gpt-5.3-codex-spark=11insufficient_samplesmodel_sizeagent=1,claude-haiku-4.5=73,claude-sonnet-4.6=34,claude-sonnet-5=9,small-agent=2unsupported_multi_variantoutput_formatexecutive_summary=54,full_detail=58,ste=16unsupported_multi_variantprompt_styleconcise=70,verbose=70insufficient_observationsoutput_formatconcise=55,detailed=65,ste=18unsupported_multi_variantmodel_sizeagent=2,claude-haiku-4.5=63,claude-sonnet-4.6=43,claude-sonnet-5=11,small-agent=1unsupported_multi_variantmodel_sizeagent=1,claude-haiku-4.5=50,claude-sonnet-4.6=47,claude-sonnet-5=14,small-agent=2unsupported_multi_variantreasoning_depthmulti_candidate=42,single_pass=58guardrail_unsupportedmodel_sizeinsufficient_observationsoutput_formatcollapsible=63,inline=63,ste=22unsupported_multi_variantprompt_styleconcise=63,detailed=53insufficient_observationsremove_redundant_context_v1insufficient_observationslog_fetch_strategyinsufficient_observationsreasoning_depthiterative=82,single_pass=60guardrail_unsupportedsemgrep_output_formatbullet_list=28,prose=27,structured_sections=22unsupported_multi_varianttimeout_settingdefault=2,relaxed=1,tight=1unsupported_multi_variantcaveman_modeno=6,yes=11insufficient_samplesoutput_formatannotated_brief=66,executive_brief=85,full_briefing=61,ste=45unsupported_multi_variantsummary_detailbrief=6,detailed=6insufficient_samplesprompt_styleconcise=20,detailed=18,step_by_step=16unsupported_multi_varianttool_verbosityfull_bash=62,minimal_toolset=68insufficient_observationsprompt_styleconcise=49,detailed=40insufficient_observationsreasoning_depthbaseline=4,deep=2,shallow=1unsupported_multi_variantremove_redundant_context_v1insufficient_observationssub_agent_strategysingle_agent=99,sub_agents=109insufficient_observationscavemanno=189,yes=189insufficient_observationssubagent_modellarge=179,small=179insufficient_observationscavemanno=97,yes=97insufficient_observationssubagent_modellarge=97,small=97insufficient_observationscavemanno=83,yes=84insufficient_observationssubagent_modellarge=84,small=83insufficient_observationssub_agent_strategydelegated_sequential=17,inline_strict=15,single_agent_control=19unsupported_multi_variantsub_agent_strategysingle_agent=132,sub_agents=145insufficient_observationssub_agent_decompositionparallel_sub_agents=42,single_agent=34insufficient_observationsprompt_style_testinsufficient_observationssub_agent_strategyinsufficient_observationsmodel_sizeclaude-haiku-4.5=58,claude-sonnet-5=77insufficient_observationstone_styleconversational=51,formal=42insufficient_observationsprefetch_strategyeager=6,lazy=10insufficient_samples🔁 Self-Tuning Continuation Plan
Experiment actions
steoutput_format arms) are INCONCLUSIVE: add pairwise/multi-arm decision support or reduce to control vs. one candidate.guardrail_unsupported(cicoach, dailyfact, dailysecurityredteam): provide native guardrail metric observations.Eval actions: tighten low-scoring eval questions for the workflows with
insufficient_observationsfirst (smoke*, typist, issuearborist, gpclean).Decision-pipeline gaps: the local
experiments list/analyzerequires experiment branches to be fetched first;--repois not accepted by the CLI; interaction diagnostics should become normalized core signals.All reactions