[experiments] Daily Experiment Report — 2026-10-01 #64725
Closed
Replies: 1 comment
|
This discussion has been marked as outdated by daily-experiment-report. A newer discussion is available at Discussion #64967. |
0 replies
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
🧪 Daily Experiment Report — 2026-10-01
52 experiments analysed across 43 workflows. No experiment has a
PROMOTEorREJECTdecision. Core decisions are 38EXTENDand 14INCONCLUSIVE. Outcome-metric observations are mostly not yet wired into the decision layer.⚡ Quick Stats
PROMOTEdecisions to hold)Reason codes: 26
insufficient_observations, 3guardrail_unsupported, 9insufficient_samples, 14unsupported_multi_variant.📊 Full Experiments Table
caveman=73,verbose=59insufficient_observationsbatch=69,per_scenario=63insufficient_observationssingle_agent=17,sub_agents=21insufficient_samplesphased_sub_agents=48,single_agent=38insufficient_samplesassertive=168,clinical=165,narrative=165unsupported_multi_variantconcise=4,detailed=8insufficient_samplesneutral=29,urgent=25insufficient_observationsconcise=40,detailed=59guardrail_unsupportedprose=34,ste=3,structured=43unsupported_multi_variantconcise=0,structured=1insufficient_samplessingle_agent=44,sub_agents=44insufficient_observationsbrief=12,comprehensive=7insufficient_samplesconcise=78,detailed=72insufficient_observationsgpt-5.3-codex=14,gpt-5.3-codex-spark=11insufficient_samplesagent=1,claude-haiku-4.5=72,claude-sonnet-4.6=34,claude-sonnet-5=9,small-agent=2unsupported_multi_variantexecutive_summary=54,full_detail=58,ste=16unsupported_multi_variantconcise=70,verbose=70insufficient_observationsconcise=55,detailed=65,ste=17unsupported_multi_variantagent=2,claude-haiku-4.5=62,claude-sonnet-4.6=43,claude-sonnet-5=11,small-agent=1unsupported_multi_variantagent=1,claude-haiku-4.5=49,claude-sonnet-4.6=47,claude-sonnet-5=14,small-agent=2unsupported_multi_variantmulti_candidate=42,single_pass=57guardrail_unsupportedinsufficient_observationscollapsible=62,inline=63,ste=22unsupported_multi_variantconcise=63,detailed=52insufficient_observationsinsufficient_observationsinsufficient_observationsiterative=82,single_pass=59guardrail_unsupportedbullet_list=28,prose=27,structured_sections=22unsupported_multi_variantdefault=2,relaxed=1,tight=1unsupported_multi_variantno=6,yes=10insufficient_samplesannotated_brief=65,executive_brief=85,full_briefing=60,ste=43unsupported_multi_variantbrief=6,detailed=6insufficient_samplesconcise=20,detailed=18,step_by_step=16unsupported_multi_variantfull_bash=61,minimal_toolset=68insufficient_observationsconcise=49,detailed=39insufficient_observationsbaseline=4,deep=2,shallow=1unsupported_multi_variantinsufficient_observationssingle_agent=99,sub_agents=109insufficient_observationsno=188,yes=188insufficient_observationslarge=178,small=178insufficient_observationsno=97,yes=97insufficient_observationslarge=97,small=97insufficient_observationsno=83,yes=84insufficient_observationslarge=84,small=83insufficient_observationsdelegated_sequential=17,inline_strict=15,single_agent_control=19unsupported_multi_variantsingle_agent=132,sub_agents=145insufficient_observationsparallel_sub_agents=42,single_agent=34insufficient_observationsinsufficient_observationsinsufficient_observationsclaude-haiku-4.5=54,claude-sonnet-5=58insufficient_observationsconversational=50,formal=42insufficient_observationseager=6,lazy=10insufficient_samples🔎 Highlights
cicoach/prompt_style(concise=40 vsdetailed=59, metrictoken_count_per_run): READY butEXTEND(guardrail_unsupported).run_success_rateandempty_output_ratehave no supported metric observation.dailyfactanddailysecurityredteam: sameguardrail_unsupportedgap.awfailureinvestigator/tone_variant(3 variants, ~165 runs each):INCONCLUSIVE(unsupported_multi_variant).steoutput_format variants,model_size) show assignment imbalance (chi-square p ≪ 0.05). They areINCONCLUSIVEbecause core analysis does not support K≥3 comparisons.🛠️ Self-Tuning Continuation Plan
Top experiment actions
insufficient_observations: declare a nativemetric:or an eval-backed metric.run_success_rateandempty_output_ratesocicoach,dailyfactanddailysecurityredteamcan clearguardrail_unsupported.ste/model_sizeexperiments (dailycodemetrics,dailycompilerquality,deepreport,dailydochealer,dailydocupdater,dailycavemanoptimizer).Top eval actions
smoke*anddaily*prompt_style workflows).eval:insights_report_producedforcopilotprnlpanalysis: it has 1 observation, so the eval yields no usable samples.output_formatexperiments so verbosity/readability variants (ste) can be compared beyond length.Decision-pipeline gaps for the next PR
run_success_rate,empty_output_rate) causeguardrail_unsupported; missing observations causeinsufficient_observations.unsupported_multi_variant.smokecopilot*(caveman×subagent_model) should become a normalized core signal.All reactions