Repository navigation
[experiments] Daily Experiment Report — 2026-10-07 #66501
Closed
Replies: 1 comment
|
This discussion has been marked as outdated by daily-experiment-report. A newer discussion is available at Discussion #66834. |
0 replies
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
🧪 Daily Experiment Report — 2026-10-07
52 experiments analysed across 49 workflows. No experiment has decision-quality evidence: 38 are
EXTENDand 14 areINCONCLUSIVE. NoPROMOTEorREJECTdecisions.⚡ Quick Stats
Reason codes:
insufficient_observations: 26,unsupported_multi_variant: 14,insufficient_samples: 9,guardrail_unsupported: 3📊 Full Experiments Table
prompt_compressionagentperformanceanalyzercaveman→verbosecaveman█████ 75/20;verbose█████ 63/20insufficient_observationssub_agent_strategyagentpersonaexplorerbatch→per_scenariobatch█████ 73/20;per_scenario█████ 65/20insufficient_observationssub_agent_strategyarchitectureguardiansingle_agent→sub_agentssingle_agent████░ 17/20;sub_agents█████ 21/20insufficient_samplesaudit_decompositionauditworkflowssingle_agent→phased_sub_agentsphased_sub_agents█░░░░ 53/264;single_agent█░░░░ 39/264insufficient_samplesprompt_styleblogauditorconcise→detailedconcise█░░░░ 4/20;detailed██░░░ 8/20insufficient_samplestone_variantbreakingchangecheckerneutral→urgentneutral█████ 31/20;urgent█████ 27/20insufficient_observationsprompt_stylecicoachdetailed→conciseconcise█████ 42/20;detailed█████ 61/20guardrail_unsupportednlp_prompt_stylecopilotprnlpanalysisconcise→structuredconcise░░░░░ 0/30;structured░░░░░ 0/30insufficient_samplessub_agent_strategydailyagentrxtraceoptimizersingle_agent→sub_agentssingle_agent█████ 46/20;sub_agents█████ 46/20insufficient_observationsdetail_leveldailyarchitecturediagrambrief→comprehensivebrief███░░ 12/20;comprehensive██░░░ 8/20insufficient_samplesprompt_styledailyastrostylelitemarkdownspellcheckconcise→detailedconcise█████ 82/20;detailed█████ 74/20insufficient_observationsmodel_sizedailycachestrategyanalyzergpt-5.3-codex→gpt-5.3-codex-sparkgpt-5.3-codex█████ 19/20;gpt-5.3-codex-spark███░░ 12/20insufficient_samplesprompt_styledailycommunityattributionconcise→verboseconcise█████ 71/20;verbose█████ 71/20insufficient_observationsreasoning_depthdailyfactsingle_pass→multi_candidatemulti_candidate█████ 43/30;single_pass█████ 60/30guardrail_unsupportedmodel_sizedailyfunctionnamerinsufficient_observationsprompt_styledailynewsconcise→detailedconcise█████ 64/20;detailed█████ 55/20insufficient_observationsremove_redundant_context_v1dailyrenderingscriptsverifierinsufficient_observationslog_fetch_strategydailysafeoutputoptimizereager→lazyinsufficient_observationsreasoning_depthdailysecurityredteamsingle_pass→iterativeiterative█████ 85/30;single_pass█████ 62/30guardrail_unsupportedcaveman_modedataflowprdiscussiondatasetno→yesno██░░░ 6/20;yes███░░ 11/20insufficient_samplessummary_detaildependabotcampaignbrief→detailedbrief██░░░ 6/20;detailed██░░░ 6/20insufficient_samplestool_verbositygpcleanfull_bash→minimal_toolsetfull_bash█████ 64/20;minimal_toolset█████ 71/20insufficient_observationsprompt_styleissuearboristconcise→detailedconcise█████ 51/20;detailed█████ 43/20insufficient_observationsremove_redundant_context_v1prsouschefinsufficient_observationssub_agent_strategysmokeantigravitysingle_agent→sub_agentssingle_agent█████ 99/20;sub_agents█████ 109/20insufficient_observationscavemansmokecopilotno→yesno█████ 192/20;yes█████ 192/20insufficient_observationssubagent_modelsmokecopilotlarge→smalllarge█████ 182/20;small█████ 182/20insufficient_observationscavemansmokecopilotaoaiapikeyno→yesno█████ 99/20;yes█████ 99/20insufficient_observationssubagent_modelsmokecopilotaoaiapikeylarge→smalllarge█████ 99/20;small█████ 99/20insufficient_observationscavemansmokecopilotaoaientrano→yesno█████ 85/20;yes█████ 86/20insufficient_observationssubagent_modelsmokecopilotaoaientralarge→smalllarge█████ 85/20;small█████ 86/20insufficient_observationssub_agent_strategysmokegeminisingle_agent→sub_agentssingle_agent█████ 134/20;sub_agents█████ 147/20insufficient_observationssub_agent_decompositionsmokepiparallel_sub_agents→single_agentparallel_sub_agents█████ 42/20;single_agent█████ 34/20insufficient_observationsprompt_style_testsmokeprojectinsufficient_observationssub_agent_strategysmoketemporaryidsingle_agent→sub_agentsinsufficient_observationsmodel_sizetestqualitysentinelclaude-haiku-4.5→claude-sonnet-5claude-haiku-4.5█████ 130/20;claude-sonnet-5█████ 125/20insufficient_observationstone_styletypistconversational→formalconversational█████ 53/20;formal█████ 43/20insufficient_observationsprefetch_strategyweeklyblogpostwritereager→lazyeager██░░░ 7/20;lazy██░░░ 10/20insufficient_samplestone_variantawfailureinvestigatorassertive█████ 198/20;clinical█████ 188/20;narrative█████ 183/20unsupported_multi_variantoutput_formatcopilotagentanalysisprose█████ 35/30;ste░░░░░ 3/30;structured█████ 43/30unsupported_multi_variantmodel_sizedailycavemanoptimizeragent░░░░░ 1/20;claude-haiku-4.5█████ 75/20;claude-sonnet-4.6█████ 34/20;claude-sonnet-5███░░ 11/20;small-agent░░░░░ 2/20unsupported_multi_variantoutput_formatdailycodemetricsexecutive_summary█████ 54/20;full_detail█████ 58/20;ste████░ 16/20unsupported_multi_variantoutput_formatdailycompilerqualityconcise█████ 56/20;detailed█████ 66/20;ste█████ 21/20unsupported_multi_variantmodel_sizedailydochealeragent░░░░░ 2/20;claude-haiku-4.5█████ 66/20;claude-sonnet-4.6█████ 43/20;claude-sonnet-5███░░ 13/20;small-agent░░░░░ 1/20unsupported_multi_variantmodel_sizedailydocupdateragent░░░░░ 1/20;claude-haiku-4.5█████ 51/20;claude-sonnet-4.6█████ 47/20;claude-sonnet-5████░ 16/20;small-agent░░░░░ 2/20unsupported_multi_variantoutput_formatdailyissuesreportcollapsible█████ 67/20;inline█████ 63/20;ste█████ 23/20unsupported_multi_variantsemgrep_output_formatdailysemgrepscanbullet_list█████ 28/30;prose████░ 27/30;structured_sections████░ 22/30unsupported_multi_varianttimeout_settingdailysubagentoptimizerdefault░░░░░ 2/20;relaxed░░░░░ 1/20;tight░░░░░ 1/20unsupported_multi_variantoutput_formatdeepreportannotated_brief█████ 69/20;executive_brief█████ 90/20;full_briefing█████ 65/20;ste█████ 52/20unsupported_multi_variantprompt_styledependabotgocheckerconcise█████ 20/20;detailed████░ 18/20;step_by_step████░ 18/20unsupported_multi_variantreasoning_depthplanbaseline█░░░░ 4/20;deep░░░░░ 2/20;shallow░░░░░ 1/20unsupported_multi_variantsub_agent_strategysmokecopilotsubagentsdelegated_sequential███░░ 17/30;inline_strict███░░ 17/30;single_agent_control███░░ 20/30unsupported_multi_variant🔁 Self-Tuning Continuation Plan
Top experiment actions
insufficient_observationsdespite many READY ones (e.g.smokecopilotcaveman/subagent_model, 192 samples each): wire each declaredmetric:to a native observation so decisions can resolve.unsupported_multi_variant(e.g.deepreport,awfailureinvestigatortone_variant,dailycompilerquality/dailyissuesreportoutput_format): collapse to a control-vs-candidate pair or add core multi-arm support.output_formatexperiments (stearm under-assigned: 21–52 vs 56–90) andmodel_sizeexperiments with stray variants (agent,small-agent) indailydochealer/dailycavemanoptimizer/dailydocupdater: fix assignment/variant-name hygiene.Top eval actions
copilotprnlpanalysismetriceval:insights_report_producedhas 0 samples for both variants: check the eval is emitted and mapped to thenlp_prompt_styleprompt.ci-coachrun_success_rate/empty_output_rateguardrails are unsupported: add graders feeding those observations.smoketemporaryidmetricaicanddailysafeoutputoptimizerrun_duration_mshave no observations: add collection in the respective workflows.Decision-pipeline gaps
guardrail_unsupported(3 experiments, e.g.ci-coach) andinsufficient_observations(26) need native metric backing.smokecopilot,smokecopilotaoaiapikey,smokecopilotaoaientra) are affected, allEXTEND.All reactions