[experiments] Daily Experiment Report — 2026-09-09 #59668
Closed
Replies: 1 comment
|
This discussion has been marked as outdated by daily-experiment-report. A newer discussion is available at Discussion #59921. |
0 replies
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
🧪 Daily Experiment Report — 2026-09-09
51 experiments analysed across 48 workflows — 22 have reached
min_samplesand are ready-for-analysis; all currently resolve to EXTEND or INCONCLUSIVE because outcome-metric observations (token_count_per_run,run_success_rate, etc.) are not yet wired into the decision pipeline. NoPROMOTE/REJECTdecisions today.⚡ Quick Stats
prompt_compression·agent-performance-analyzer.mdH0: no change in effective_tokens. H1: caveman reduces tokens by ≥20% while maintaining quality ≥90%
📈 View Detailed Statistics
Sample Sizes & Progress
cavemanverboseCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonsub_agent_strategy·agent-persona-explorer.mdH0: no change in effective_tokens or duration. H1: batch reduces tokens by ≥20% and duration by ≥15% without quality loss
📈 View Detailed Statistics
Sample Sizes & Progress
batchper_scenarioCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisontone_variant·aw-failure-investigator.mdH0: no change in output_length_chars across tone variants. H1: assertive tone produces shorter, more actionable outputs than clinical or narrative, with equivalent or better sub-issue quality.
📈 View Detailed Statistics
Sample Sizes & Progress
assertiveclinicalnarrativeCore decision: INCONCLUSIVE (
unsupported_multi_variant) — automatic decisions currently require exactly two variantsprompt_style·ci-coach.mdH0: no change in PR merge rate or proposal quality. H1: concise prompt reduces token usage ≥25% without degrading proposal quality
📈 View Detailed Statistics
Sample Sizes & Progress
concisedetailedCore decision: EXTEND (
guardrail_unsupported) — mandatory guardrail "run_success_rate" is not backed by a supported metric observationsub_agent_strategy·daily-agentrx-trace-optimizer.mdH0: no change in issue quality or run success rate. H1: sub_agents variant yields higher evidence completeness score with equal or lower token cost
📈 View Detailed Statistics
Sample Sizes & Progress
single_agentsub_agentsCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonprompt_style·daily-astrostylelite-markdown-spellcheck.mdConcise prompt reduces token consumption ≥20% without degrading fix precision. H0: no difference in fix rate.
📈 View Detailed Statistics
Sample Sizes & Progress
concisedetailedCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonprompt_style·daily-community-attribution.md📈 View Detailed Statistics
Sample Sizes & Progress
conciseverboseCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonreasoning_depth·daily-fact.mdH0: no change in discussion engagement rate. H1: multi_candidate produces more novel verses with higher reaction counts (expected +20% reactions).
📈 View Detailed Statistics
Sample Sizes & Progress
multi_candidatesingle_passCore decision: EXTEND (
guardrail_unsupported) — mandatory guardrail "empty_output_rate" is not backed by a supported metric observationprompt_style·daily-news.mdH0: no change in output quality. H1: concise prompt reduces token usage by ≥20% with no significant drop in output completeness score
📈 View Detailed Statistics
Sample Sizes & Progress
concisedetailedCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonreasoning_depth·daily-security-red-team.mdH0: no change in finding quality. H1: iterative reduces false-positive rate by >=20% at <=30% token overhead
📈 View Detailed Statistics
Sample Sizes & Progress
iterativesingle_passCore decision: EXTEND (
guardrail_unsupported) — mandatory guardrail "run_success_rate" is not backed by a supported metric observationtool_verbosity·gpclean.mdH0: no change in token consumption. H1: minimal toolset reduces tokens by 10-15% while maintaining issue quality (detection accuracy + alternative research depth)
📈 View Detailed Statistics
Sample Sizes & Progress
full_bashminimal_toolsetCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonprompt_style·issue-arborist.mdH0: no change in links_created. H1: detailed instructions produce ≥15% more correct links per run
📈 View Detailed Statistics
Sample Sizes & Progress
concisedetailedCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonsub_agent_strategy·smoke-antigravity.md📈 View Detailed Statistics
Sample Sizes & Progress
single_agentsub_agentsCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisoncaveman·smoke-copilot.md📈 View Detailed Statistics
Sample Sizes & Progress
noyesCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonsubagent_model·smoke-copilot.md📈 View Detailed Statistics
Sample Sizes & Progress
largesmallCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisoncaveman·smoke-copilot-aoai-apikey.md📈 View Detailed Statistics
Sample Sizes & Progress
noyesCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonsubagent_model·smoke-copilot-aoai-apikey.md📈 View Detailed Statistics
Sample Sizes & Progress
largesmallCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisoncaveman·smoke-copilot-aoai-entra.md📈 View Detailed Statistics
Sample Sizes & Progress
noyesCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonsubagent_model·smoke-copilot-aoai-entra.md📈 View Detailed Statistics
Sample Sizes & Progress
largesmallCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonsub_agent_strategy·smoke-gemini.mdH0: no change in effective_tokens. H1: sub_agents reduces tokens by >=20%
📈 View Detailed Statistics
Sample Sizes & Progress
single_agentsub_agentsCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonsub_agent_decomposition·smoke-pi.md📈 View Detailed Statistics
Sample Sizes & Progress
parallel_sub_agentssingle_agentCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisontone_style·typist.mdH0: no change in engagement. H1: conversational tone increases discussion views+reactions+comments by 20%+ while maintaining analysis quality
📈 View Detailed Statistics
Sample Sizes & Progress
conversationalformalCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonInteraction diagnostics:
caveman×subagent_model(smoke-copilot family)Two experiments run concurrently in
smoke-copilot,smoke-copilot-aoai-apikey, andsmoke-copilot-aoai-entra. Per-run assignment cells over the last 10 tracked runs:smoke-copilot.md— cells: (no,large)=n3, (no,small)=n2, (yes,large)=n2, (yes,small)=n3 · sparsest cell n=2 (min_samples per variant experiment = 20) → SPARSE_CELL_RISKsmoke-copilot-aoai-apikey.md— cells: (no,large)=n1, (no,small)=n4, (yes,large)=n4, (yes,small)=n1 · sparsest cell n=1 (min_samples per variant experiment = 20) → SPARSE_CELL_RISKsmoke-copilot-aoai-entra.md— cells: (no,large)=n2, (no,small)=n3, (yes,large)=n3, (yes,small)=n2 · sparsest cell n=2 (min_samples per variant experiment = 20) → SPARSE_CELL_RISKAll three workflows are still
EXTENDat the core-decision level (insufficient observations), so no promotion is at risk of an interaction-blind decision today. Once outcome-metric wiring lands, apply theinteraction_underpoweredsafety hold before anyPROMOTEon these workflows given the sparse 2×2 cells above.📊 Summary
View Full Experiments Table
prompt_compressioncavemanverbosesub_agent_strategybatchper_scenariosub_agent_strategysingle_agentsub_agentsaudit_decompositionsingle_agentphased_sub_agentstone_variantassertiveclinicalprompt_styleconcisedetailedtone_variantneutralurgentprompt_styledetailedconciseoutput_formatprosestesub_agent_strategysingle_agentsub_agentsdetail_levelbriefcomprehensiveprompt_styleconcisedetailedmodel_sizegpt-5.3-codexgpt-5.3-codex-sparkmodel_sizeagentclaude-haiku-4.5output_formatexecutive_summaryfull_detailprompt_styleconciseverboseoutput_formatconcisedetailedmodel_sizeagentclaude-haiku-4.5model_sizeagentclaude-haiku-4.5reasoning_depthsingle_passmulti_candidatemodel_size?(n/a)output_formatcollapsibleinlineprompt_styleconcisedetailedremove_redundant_context_v1?(n/a)log_fetch_strategyeagerlazyreasoning_depthsingle_passiterativesemgrep_output_formatbullet_listprosetimeout_settingdefaultrelaxedcaveman_modenoyesoutput_formatannotated_briefexecutive_briefsummary_detailbriefdetailedprompt_styleconcisedetailedtool_verbosityfull_bashminimal_toolsetprompt_styleconcisedetailedreasoning_depthbaselinedeepremove_redundant_context_v1?(n/a)sub_agent_strategysingle_agentsub_agentscavemannoyessubagent_modellargesmallcavemannoyessubagent_modellargesmallcavemannoyessubagent_modellargesmallsub_agent_strategydelegated_sequentialinline_strictsub_agent_strategysingle_agentsub_agentssub_agent_decompositionparallel_sub_agentssingle_agentprompt_style_test?(n/a)sub_agent_strategysingle_agentsub_agentsmodel_size?(n/a)tone_styleconversationalformalprefetch_strategyeagerlazy🔧 Self-Tuning Continuation Plan
Top 3 experiment actions
token_count_per_run,run_success_rate,effective_token_count, etc.) into the analyze pipeline — everyREADYexperiment today resolves toEXTEND/INCONCLUSIVEsolely becauseinsufficient_observationsorguardrail_unsupportedblocks the decision layer, not because evidence is weak.aw-failure-investigator'stone_variantexperiment support beyond 2-variant comparisons, or split it into pairwise A/B tests —unsupported_multi_variantis the only blocker there with 397 total runs banked.smoke-copilot*family's dualcaveman×subagent_modelfactorial design — current per-cell sample sizes (as low as n=1) createSPARSE_CELL_RISK; either increasemin_samplesawareness for factorial designs or run sequentially.Top 3 eval actions
eval:output_format_adherencegraders forcopilot-agent-analysis,daily-code-metrics,daily-semgrep-scan,daily-issues-report, anddeep-report— these all declareeval:secondary metrics but no observation pipeline surfaced them in this run.run_success_rate/empty_output_rategrader wired to native Actions run conclusions forci-coach,daily-fact, anddaily-security-red-team— their guardrail metrics are declared but markedunsupported.pr-sous-chefanddaily-rendering-scripts-verifier, whose primary metric is agrader:execution-durationreference with no corresponding recorded observations yet.Decision-pipeline gaps for next PR
insufficient_observations(18 experiments) andguardrail_unsupported(3 experiments) account for allEXTENDdecisions among READY experiments — the single highest-leverage fix is landing a generic per-run metric-observation writer that theexperiments analyzedecision layer can consume.unsupported_multi_variant(1 experiment,aw-failure-investigator) — the core decision engine only supports exactly 2 variants; either extend it or require workflows to declare pairwise variants.SPARSE_CELL_RISK) are computed ad hoc in this report; they should become a normalizedanalyses[].interactionfield ingh aw experiments analyzeoutput so decisions can consume it directly instead of relying on reporting-layer recomputation.All reactions