You signed in with another tab or window. Reload to refresh your session.You signed out in another tab or window. Reload to refresh your session.You switched accounts on another tab or window. Reload to refresh your session.Dismiss alert
48 experiments analysed across 48 workflows in github/gh-aw. 22 have reached minimum sample size (22 🟢 READY, 29 🟡 COLLECTING). No decision reached PROMOTE or REJECT today — all analyses returned EXTEND or INCONCLUSIVE, because per-run outcome/grader metrics are not yet flowing into the core analyzer, or the experiment currently has 3+ variants (unsupported for pairwise decisioning). No interaction safety holds applied (no workflow currently runs 2+ concurrent experiments).
prompt_compression · agent-performance-analyzer 🟢 — caveman(58) vs verbose(50) · metric:effective_tokens · min_samples=20 · p=0.448
→ 🟡 EXTEND (insufficient_observations): primary metric observations are not available for statistical comparison
sub_agent_strategy · agent-persona-explorer 🟢 — batch(57) vs per_scenario(51) · metric:effective_tokens · min_samples=20 · p=0.571
→ 🟡 EXTEND (insufficient_observations): primary metric observations are not available for statistical comparison
sub_agent_strategy · architectureguardian 🟡 — single_agent(17) vs sub_agents(21) · min_samples=20 · p=0.524
→ 🟡 EXTEND (insufficient_samples): one or more variants have fewer usable observations than min_samples
audit_decomposition · audit-workflows 🟡 — phased_sub_agents(37) vs single_agent(26) · metric:run_success_rate · min_samples=264 · p=0.162
→ 🟡 EXTEND (insufficient_samples): one or more variants have fewer usable observations than min_samples
tone_variant · aw-failure-investigator 🟢 — assertive(131) vs clinical(132) vs narrative(123) · metric:output_length_chars · min_samples=20 · p=0.828
→ ⚪ INCONCLUSIVE (unsupported_multi_variant): automatic decisions currently require exactly two variants
prompt_style · blog-auditor 🟡 — concise(3) vs detailed(5) · metric:effective_token_count · min_samples=20 · p=0.487
→ 🟡 EXTEND (insufficient_samples): one or more variants have fewer usable observations than min_samples
tone_variant · breaking-change-checker 🟡 — neutral(21) vs urgent(15) · metric:issue_engagement_rate · min_samples=20 · p=0.319
→ 🟡 EXTEND (insufficient_samples): one or more variants have fewer usable observations than min_samples
prompt_style · ci-coach 🟢 — concise(36) vs detailed(45) · metric:token_count_per_run · min_samples=20 · p=0.000
→ 🟡 EXTEND (guardrail_unsupported): mandatory guardrail "run_success_rate" is not backed by a supported metric observation
output_format · copilot-agent-analysis 🟡 — prose(34) vs ste(3) vs structured(43) · metric:ai_credits_used · min_samples=30 · p=0.000
→ ⚪ INCONCLUSIVE (unsupported_multi_variant): automatic decisions currently require exactly two variants
sub_agent_strategy · daily-agentrx-trace-optimizer 🟢 — single_agent(35) vs sub_agents(34) · metric:issue_evidence_completeness · min_samples=20 · p=0.871
→ 🟡 EXTEND (insufficient_observations): primary metric observations are not available for statistical comparison
detail_level · daily-architecture-diagram 🟡 — brief(9) vs comprehensive(6) · metric:run_duration_ms · min_samples=20 · p=0.445
→ 🟡 EXTEND (insufficient_samples): one or more variants have fewer usable observations than min_samples
prompt_style · daily-astrostylelite-markdown-spellcheck 🟢 — concise(65) vs detailed(61) · metric:effective_tokens · min_samples=20 · p=0.720
→ 🟡 EXTEND (insufficient_observations): primary metric observations are not available for statistical comparison
model_size · daily-cache-strategy-analyzer 🟡 — n/a · metric:ai_credits_total · min_samples=20 · p=0.000
→ 🟡 EXTEND (insufficient_observations): at least two variants are required for a decision
model_size · daily-caveman-optimizer 🟡 — agent(1) vs claude-haiku-4.5(55) vs claude-sonnet-4.6(34) vs claude-sonnet-5(2) vs small-agent(2) · metric:ai_credits_total · min_samples=20 · p=0.000
→ ⚪ INCONCLUSIVE (unsupported_multi_variant): automatic decisions currently require exactly two variants
output_format · daily-code-metrics 🟡 — executive_summary(49) vs full_detail(53) vs ste(10) · metric:discussion_engagement_score · min_samples=20 · p=0.000
→ ⚪ INCONCLUSIVE (unsupported_multi_variant): automatic decisions currently require exactly two variants
prompt_style · daily-community-attribution 🟢 — concise(62) vs verbose(62) · min_samples=20 · p=1.000
→ 🟡 EXTEND (insufficient_observations): primary metric observations are not available for statistical comparison
output_format · daily-compiler-quality 🟡 — concise(48) vs detailed(54) vs ste(11) · metric:discussion_engagement_score · min_samples=20 · p=0.000
→ ⚪ INCONCLUSIVE (unsupported_multi_variant): automatic decisions currently require exactly two variants
model_size · daily-doc-healer 🟡 — agent(2) vs claude-haiku-4.5(47) vs claude-sonnet-4.6(43) vs claude-sonnet-5(1) vs small-agent(1) · metric:ai_credits_total · min_samples=20 · p=0.000
→ ⚪ INCONCLUSIVE (unsupported_multi_variant): automatic decisions currently require exactly two variants
model_size · daily-doc-updater 🟡 — agent(1) vs claude-haiku-4.5(42) vs claude-sonnet-4.6(47) vs claude-sonnet-5(2) vs small-agent(2) · metric:ai_credits_total · min_samples=20 · p=0.000
→ ⚪ INCONCLUSIVE (unsupported_multi_variant): automatic decisions currently require exactly two variants
reasoning_depth · daily-fact 🟢 — multi_candidate(32) vs single_pass(50) · metric:discussion_reaction_count · min_samples=30 · p=0.044
→ 🟡 EXTEND (guardrail_unsupported): mandatory guardrail "empty_output_rate" is not backed by a supported metric observation
model_size · dailyfunctionnamer 🟡 — n/a · min_samples=20 · p=0.000
→ 🟡 EXTEND (insufficient_observations): at least two variants are required for a decision
output_format · daily-issues-report 🟡 — collapsible(53) vs inline(57) vs ste(14) · metric:discussion_engagement_score · min_samples=20 · p=0.000
→ ⚪ INCONCLUSIVE (unsupported_multi_variant): automatic decisions currently require exactly two variants
prompt_style · daily-news 🟢 — concise(52) vs detailed(45) · metric:effective_token_count · min_samples=20 · p=0.484
→ 🟡 EXTEND (insufficient_observations): primary metric observations are not available for statistical comparison
remove_redundant_context_v1 · daily-rendering-scripts-verifier 🟡 — n/a · metric:"grader:execution-duration" · min_samples=20 · p=0.000
→ 🟡 EXTEND (insufficient_observations): at least two variants are required for a decision
log_fetch_strategy · daily-safe-output-optimizer 🟡 — n/a · metric:run_duration_ms · min_samples=20 · p=0.000
→ 🟡 EXTEND (insufficient_observations): at least two variants are required for a decision
reasoning_depth · daily-security-red-team 🟢 — iterative(70) vs single_pass(47) · metric:false_positive_rate · min_samples=30 · p=0.032
→ 🟡 EXTEND (guardrail_unsupported): mandatory guardrail "run_success_rate" is not backed by a supported metric observation
semgrep_output_format · daily-semgrep-scan 🟡 — bullet_list(28) vs prose(27) vs structured_sections(22) · metric:alert_creation_rate · min_samples=30 · p=0.023
→ ⚪ INCONCLUSIVE (unsupported_multi_variant): automatic decisions currently require exactly two variants
timeout_setting · dailysubagentoptimizer 🟡 — default(2) vs relaxed(1) vs tight(1) · min_samples=20 · p=0.781
→ ⚪ INCONCLUSIVE (unsupported_multi_variant): automatic decisions currently require exactly two variants
caveman_mode · dataflow-pr-discussion-dataset 🟡 — no(5) vs yes(8) · metric:input_token_count · min_samples=20 · p=0.410
→ 🟡 EXTEND (insufficient_samples): one or more variants have fewer usable observations than min_samples
output_format · deep-report 🟡 — annotated_brief(38) vs executive_brief(58) vs full_briefing(46) vs ste(15) · metric:token_count · min_samples=20 · p=0.000
→ ⚪ INCONCLUSIVE (unsupported_multi_variant): automatic decisions currently require exactly two variants
summary_detail · dependabotcampaign 🟡 — brief(6) vs detailed(6) · min_samples=20 · p=1.000
→ 🟡 EXTEND (insufficient_samples): one or more variants have fewer usable observations than min_samples
prompt_style · dependabot-go-checker 🟡 — concise(15) vs detailed(15) vs step_by_step(13) · metric:issue_categorization_accuracy · min_samples=20 · p=0.904
→ ⚪ INCONCLUSIVE (unsupported_multi_variant): automatic decisions currently require exactly two variants
tool_verbosity · gpclean 🟢 — full_bash(49) vs minimal_toolset(56) · metric:effective_token_count · min_samples=20 · p=0.502
→ 🟡 EXTEND (insufficient_observations): primary metric observations are not available for statistical comparison
prompt_style · issue-arborist 🟢 — concise(37) vs detailed(27) · metric:links_created · min_samples=20 · p=0.208
→ 🟡 EXTEND (insufficient_observations): primary metric observations are not available for statistical comparison
reasoning_depth · plan 🟡 — baseline(4) vs deep(2) vs shallow(1) · metric:plan_quality_score · min_samples=20 · p=0.369
→ ⚪ INCONCLUSIVE (unsupported_multi_variant): automatic decisions currently require exactly two variants
remove_redundant_context_v1 · pr-sous-chef 🟡 — n/a · metric:"grader:execution-duration" · min_samples=20 · p=0.000
→ 🟡 EXTEND (insufficient_observations): at least two variants are required for a decision
sub_agent_strategy · smokeantigravity 🟢 — single_agent(99) vs sub_agents(109) · min_samples=20 · p=0.495
→ 🟡 EXTEND (insufficient_observations): primary metric observations are not available for statistical comparison
caveman · smoke-copilot 🟢 — no(176) vs yes(176) · min_samples=20 · p=1.000
→ 🟡 EXTEND (insufficient_observations): primary metric observations are not available for statistical comparison
subagent_model · smoke-copilot 🟢 — large(166) vs small(166) · min_samples=20 · p=1.000
→ 🟡 EXTEND (insufficient_observations): primary metric observations are not available for statistical comparison
caveman · smoke-copilot-aoai-apikey 🟢 — no(88) vs yes(89) · min_samples=20 · p=0.898
→ 🟡 EXTEND (insufficient_observations): primary metric observations are not available for statistical comparison
subagent_model · smoke-copilot-aoai-apikey 🟢 — large(89) vs small(88) · min_samples=20 · p=0.898
→ 🟡 EXTEND (insufficient_observations): primary metric observations are not available for statistical comparison
caveman · smoke-copilot-aoai-entra 🟢 — no(75) vs yes(75) · min_samples=20 · p=1.000
→ 🟡 EXTEND (insufficient_observations): primary metric observations are not available for statistical comparison
subagent_model · smoke-copilot-aoai-entra 🟢 — large(75) vs small(75) · min_samples=20 · p=1.000
→ 🟡 EXTEND (insufficient_observations): primary metric observations are not available for statistical comparison
sub_agent_strategy · smoke-copilot-sub-agents 🟡 — delegated_sequential(14) vs inline_strict(9) vs single_agent_control(15) · metric:pass_rate · min_samples=30 · p=0.400
→ ⚪ INCONCLUSIVE (unsupported_multi_variant): automatic decisions currently require exactly two variants
sub_agent_strategy · smoke-gemini 🟢 — single_agent(121) vs sub_agents(139) · metric:effective_tokens · min_samples=20 · p=0.263
→ 🟡 EXTEND (insufficient_observations): primary metric observations are not available for statistical comparison
sub_agent_decomposition · smokepi 🟢 — parallel_sub_agents(42) vs single_agent(34) · min_samples=20 · p=0.362
→ 🟡 EXTEND (insufficient_observations): primary metric observations are not available for statistical comparison
prompt_style_test · smoke-project 🟡 — n/a · metric:run_success_rate · min_samples=20 · p=0.000
→ 🟡 EXTEND (insufficient_observations): at least two variants are required for a decision
sub_agent_strategy · smoke-temporary-id 🟡 — n/a · metric:effective_token_count · min_samples=20 · p=0.000
→ 🟡 EXTEND (insufficient_observations): at least two variants are required for a decision
model_size · test-quality-sentinel 🟡 — n/a · metric:review_usefulness_acceptance_rate · min_samples=20 · p=0.000
→ 🟡 EXTEND (insufficient_observations): at least two variants are required for a decision
tone_style · typist 🟢 — conversational(40) vs formal(34) · metric:discussion_engagement_score · min_samples=20 · p=0.493
→ 🟡 EXTEND (insufficient_observations): primary metric observations are not available for statistical comparison
prefetch_strategy · weekly-blog-post-writer 🟡 — eager(5) vs lazy(7) · metric:agent_turn_count · min_samples=20 · p=0.571
→ 🟡 EXTEND (insufficient_samples): one or more variants have fewer usable observations than min_samples
unsupported_multi_variant blocks 14 experiments (awfailureinvestigator, copilotagentanalysis, dailycavemanoptimizer, dailycodemetrics, dailycompilerquality, dailydochealer, dailydocupdater, dailyissuesreport, dailysemgrepscan, dailysubagentoptimizer, dependabotgochecker, deepreport, plan, smokecopilotsubagents) — reduce to 2-variant A/B or extend the core analyzer to support >2-variant decisioning.
The 8 READY experiments (agentperformanceanalyzer, awfailureinvestigator, cicoach, dailyfact, dailynews, dailysecurityredteam, issuearborist, typist) have sufficient samples but decisions are blocked on insufficient_observations/guardrail_unsupported — wire up native metric/grader observation ingestion for their primary metrics so the next run can reach PROMOTE/REJECT.
Remaining COLLECTING + insufficient_samples experiments (architectureguardian, auditworkflows, blogauditor, breakingchangechecker, dailyarchitecturediagram, dataflowprdiscussiondataset, dependabotcampaign, weeklyblogpostwriter) need no action — continue running until min_samples reached.
Top 3 eval actions
Add grader/eval coverage to populate primary metrics for the 8 READY workflows (esp. cicoach's token_count_per_run and dailysecurityredteam's false_positive_rate) — closest to an actionable decision.
Add eval coverage for output-quality metrics used by multi-variant output_format experiments (dailycodemetrics, dailycompilerquality, dailyissuesreport, deepreport) ahead of multi-variant core-analysis support.
Verify discussion_engagement_score graders (dailycodemetrics, dailycompilerquality, dailyissuesreport, typist) are actually emitting per-run values — several show guardrail_unsupported/insufficient_observations despite READY sample sizes.
Decision-pipeline gaps for next PR
insufficient_observations (26) + guardrail_unsupported (3) experiments show the core analyzer isn't receiving per-run primary-metric observations for most workflows — largest blocker to PROMOTE/REJECT.
unsupported_multi_variant (14) shows the core analyzer only supports 2-variant pairwise decisions; multi-variant (ANOVA/chi-square) support is needed as a normalized core signal.
No interaction diagnostics were computed this run — no workflow currently declares 2+ concurrent experiments; exercise the factorial-interaction helper once one exists.
Descriptive window: cumulative branch state per workflow (git-based state) · Decision thresholds: from decision_policy in gh aw experiments analyze
Run: 34020232283
reacted with thumbs up emoji reacted with thumbs down emoji reacted with laugh emoji reacted with hooray emoji reacted with confused emoji reacted with heart emoji reacted with rocket emoji reacted with eyes emoji
Uh oh!
There was an error while loading. Please reload this page.
🧪 Daily Experiment Report — 2026-09-06
48 experiments analysed across 48 workflows in
github/gh-aw. 22 have reached minimum sample size (22 🟢 READY, 29 🟡 COLLECTING). No decision reachedPROMOTEorREJECTtoday — all analyses returnedEXTENDorINCONCLUSIVE, because per-run outcome/grader metrics are not yet flowing into the core analyzer, or the experiment currently has 3+ variants (unsupported for pairwise decisioning). No interaction safety holds applied (no workflow currently runs 2+ concurrent experiments).⚡ Quick Stats
📋 Per-Experiment Detail (all 51 experiment analyses)
prompt_compression·agent-performance-analyzer🟢 —caveman(58) vsverbose(50) · metric:effective_tokens· min_samples=20 · p=0.448→ 🟡 EXTEND (
insufficient_observations): primary metric observations are not available for statistical comparisonsub_agent_strategy·agent-persona-explorer🟢 —batch(57) vsper_scenario(51) · metric:effective_tokens· min_samples=20 · p=0.571→ 🟡 EXTEND (
insufficient_observations): primary metric observations are not available for statistical comparisonsub_agent_strategy·architectureguardian🟡 —single_agent(17) vssub_agents(21) · min_samples=20 · p=0.524→ 🟡 EXTEND (
insufficient_samples): one or more variants have fewer usable observations than min_samplesaudit_decomposition·audit-workflows🟡 —phased_sub_agents(37) vssingle_agent(26) · metric:run_success_rate· min_samples=264 · p=0.162→ 🟡 EXTEND (
insufficient_samples): one or more variants have fewer usable observations than min_samplestone_variant·aw-failure-investigator🟢 —assertive(131) vsclinical(132) vsnarrative(123) · metric:output_length_chars· min_samples=20 · p=0.828→ ⚪ INCONCLUSIVE (
unsupported_multi_variant): automatic decisions currently require exactly two variantsprompt_style·blog-auditor🟡 —concise(3) vsdetailed(5) · metric:effective_token_count· min_samples=20 · p=0.487→ 🟡 EXTEND (
insufficient_samples): one or more variants have fewer usable observations than min_samplestone_variant·breaking-change-checker🟡 —neutral(21) vsurgent(15) · metric:issue_engagement_rate· min_samples=20 · p=0.319→ 🟡 EXTEND (
insufficient_samples): one or more variants have fewer usable observations than min_samplesprompt_style·ci-coach🟢 —concise(36) vsdetailed(45) · metric:token_count_per_run· min_samples=20 · p=0.000→ 🟡 EXTEND (
guardrail_unsupported): mandatory guardrail "run_success_rate" is not backed by a supported metric observationoutput_format·copilot-agent-analysis🟡 —prose(34) vsste(3) vsstructured(43) · metric:ai_credits_used· min_samples=30 · p=0.000→ ⚪ INCONCLUSIVE (
unsupported_multi_variant): automatic decisions currently require exactly two variantssub_agent_strategy·daily-agentrx-trace-optimizer🟢 —single_agent(35) vssub_agents(34) · metric:issue_evidence_completeness· min_samples=20 · p=0.871→ 🟡 EXTEND (
insufficient_observations): primary metric observations are not available for statistical comparisondetail_level·daily-architecture-diagram🟡 —brief(9) vscomprehensive(6) · metric:run_duration_ms· min_samples=20 · p=0.445→ 🟡 EXTEND (
insufficient_samples): one or more variants have fewer usable observations than min_samplesprompt_style·daily-astrostylelite-markdown-spellcheck🟢 —concise(65) vsdetailed(61) · metric:effective_tokens· min_samples=20 · p=0.720→ 🟡 EXTEND (
insufficient_observations): primary metric observations are not available for statistical comparisonmodel_size·daily-cache-strategy-analyzer🟡 — n/a · metric:ai_credits_total· min_samples=20 · p=0.000→ 🟡 EXTEND (
insufficient_observations): at least two variants are required for a decisionmodel_size·daily-caveman-optimizer🟡 —agent(1) vsclaude-haiku-4.5(55) vsclaude-sonnet-4.6(34) vsclaude-sonnet-5(2) vssmall-agent(2) · metric:ai_credits_total· min_samples=20 · p=0.000→ ⚪ INCONCLUSIVE (
unsupported_multi_variant): automatic decisions currently require exactly two variantsoutput_format·daily-code-metrics🟡 —executive_summary(49) vsfull_detail(53) vsste(10) · metric:discussion_engagement_score· min_samples=20 · p=0.000→ ⚪ INCONCLUSIVE (
unsupported_multi_variant): automatic decisions currently require exactly two variantsprompt_style·daily-community-attribution🟢 —concise(62) vsverbose(62) · min_samples=20 · p=1.000→ 🟡 EXTEND (
insufficient_observations): primary metric observations are not available for statistical comparisonoutput_format·daily-compiler-quality🟡 —concise(48) vsdetailed(54) vsste(11) · metric:discussion_engagement_score· min_samples=20 · p=0.000→ ⚪ INCONCLUSIVE (
unsupported_multi_variant): automatic decisions currently require exactly two variantsmodel_size·daily-doc-healer🟡 —agent(2) vsclaude-haiku-4.5(47) vsclaude-sonnet-4.6(43) vsclaude-sonnet-5(1) vssmall-agent(1) · metric:ai_credits_total· min_samples=20 · p=0.000→ ⚪ INCONCLUSIVE (
unsupported_multi_variant): automatic decisions currently require exactly two variantsmodel_size·daily-doc-updater🟡 —agent(1) vsclaude-haiku-4.5(42) vsclaude-sonnet-4.6(47) vsclaude-sonnet-5(2) vssmall-agent(2) · metric:ai_credits_total· min_samples=20 · p=0.000→ ⚪ INCONCLUSIVE (
unsupported_multi_variant): automatic decisions currently require exactly two variantsreasoning_depth·daily-fact🟢 —multi_candidate(32) vssingle_pass(50) · metric:discussion_reaction_count· min_samples=30 · p=0.044→ 🟡 EXTEND (
guardrail_unsupported): mandatory guardrail "empty_output_rate" is not backed by a supported metric observationmodel_size·dailyfunctionnamer🟡 — n/a · min_samples=20 · p=0.000→ 🟡 EXTEND (
insufficient_observations): at least two variants are required for a decisionoutput_format·daily-issues-report🟡 —collapsible(53) vsinline(57) vsste(14) · metric:discussion_engagement_score· min_samples=20 · p=0.000→ ⚪ INCONCLUSIVE (
unsupported_multi_variant): automatic decisions currently require exactly two variantsprompt_style·daily-news🟢 —concise(52) vsdetailed(45) · metric:effective_token_count· min_samples=20 · p=0.484→ 🟡 EXTEND (
insufficient_observations): primary metric observations are not available for statistical comparisonremove_redundant_context_v1·daily-rendering-scripts-verifier🟡 — n/a · metric:"grader:execution-duration"· min_samples=20 · p=0.000→ 🟡 EXTEND (
insufficient_observations): at least two variants are required for a decisionlog_fetch_strategy·daily-safe-output-optimizer🟡 — n/a · metric:run_duration_ms· min_samples=20 · p=0.000→ 🟡 EXTEND (
insufficient_observations): at least two variants are required for a decisionreasoning_depth·daily-security-red-team🟢 —iterative(70) vssingle_pass(47) · metric:false_positive_rate· min_samples=30 · p=0.032→ 🟡 EXTEND (
guardrail_unsupported): mandatory guardrail "run_success_rate" is not backed by a supported metric observationsemgrep_output_format·daily-semgrep-scan🟡 —bullet_list(28) vsprose(27) vsstructured_sections(22) · metric:alert_creation_rate· min_samples=30 · p=0.023→ ⚪ INCONCLUSIVE (
unsupported_multi_variant): automatic decisions currently require exactly two variantstimeout_setting·dailysubagentoptimizer🟡 —default(2) vsrelaxed(1) vstight(1) · min_samples=20 · p=0.781→ ⚪ INCONCLUSIVE (
unsupported_multi_variant): automatic decisions currently require exactly two variantscaveman_mode·dataflow-pr-discussion-dataset🟡 —no(5) vsyes(8) · metric:input_token_count· min_samples=20 · p=0.410→ 🟡 EXTEND (
insufficient_samples): one or more variants have fewer usable observations than min_samplesoutput_format·deep-report🟡 —annotated_brief(38) vsexecutive_brief(58) vsfull_briefing(46) vsste(15) · metric:token_count· min_samples=20 · p=0.000→ ⚪ INCONCLUSIVE (
unsupported_multi_variant): automatic decisions currently require exactly two variantssummary_detail·dependabotcampaign🟡 —brief(6) vsdetailed(6) · min_samples=20 · p=1.000→ 🟡 EXTEND (
insufficient_samples): one or more variants have fewer usable observations than min_samplesprompt_style·dependabot-go-checker🟡 —concise(15) vsdetailed(15) vsstep_by_step(13) · metric:issue_categorization_accuracy· min_samples=20 · p=0.904→ ⚪ INCONCLUSIVE (
unsupported_multi_variant): automatic decisions currently require exactly two variantstool_verbosity·gpclean🟢 —full_bash(49) vsminimal_toolset(56) · metric:effective_token_count· min_samples=20 · p=0.502→ 🟡 EXTEND (
insufficient_observations): primary metric observations are not available for statistical comparisonprompt_style·issue-arborist🟢 —concise(37) vsdetailed(27) · metric:links_created· min_samples=20 · p=0.208→ 🟡 EXTEND (
insufficient_observations): primary metric observations are not available for statistical comparisonreasoning_depth·plan🟡 —baseline(4) vsdeep(2) vsshallow(1) · metric:plan_quality_score· min_samples=20 · p=0.369→ ⚪ INCONCLUSIVE (
unsupported_multi_variant): automatic decisions currently require exactly two variantsremove_redundant_context_v1·pr-sous-chef🟡 — n/a · metric:"grader:execution-duration"· min_samples=20 · p=0.000→ 🟡 EXTEND (
insufficient_observations): at least two variants are required for a decisionsub_agent_strategy·smokeantigravity🟢 —single_agent(99) vssub_agents(109) · min_samples=20 · p=0.495→ 🟡 EXTEND (
insufficient_observations): primary metric observations are not available for statistical comparisoncaveman·smoke-copilot🟢 —no(176) vsyes(176) · min_samples=20 · p=1.000→ 🟡 EXTEND (
insufficient_observations): primary metric observations are not available for statistical comparisonsubagent_model·smoke-copilot🟢 —large(166) vssmall(166) · min_samples=20 · p=1.000→ 🟡 EXTEND (
insufficient_observations): primary metric observations are not available for statistical comparisoncaveman·smoke-copilot-aoai-apikey🟢 —no(88) vsyes(89) · min_samples=20 · p=0.898→ 🟡 EXTEND (
insufficient_observations): primary metric observations are not available for statistical comparisonsubagent_model·smoke-copilot-aoai-apikey🟢 —large(89) vssmall(88) · min_samples=20 · p=0.898→ 🟡 EXTEND (
insufficient_observations): primary metric observations are not available for statistical comparisoncaveman·smoke-copilot-aoai-entra🟢 —no(75) vsyes(75) · min_samples=20 · p=1.000→ 🟡 EXTEND (
insufficient_observations): primary metric observations are not available for statistical comparisonsubagent_model·smoke-copilot-aoai-entra🟢 —large(75) vssmall(75) · min_samples=20 · p=1.000→ 🟡 EXTEND (
insufficient_observations): primary metric observations are not available for statistical comparisonsub_agent_strategy·smoke-copilot-sub-agents🟡 —delegated_sequential(14) vsinline_strict(9) vssingle_agent_control(15) · metric:pass_rate· min_samples=30 · p=0.400→ ⚪ INCONCLUSIVE (
unsupported_multi_variant): automatic decisions currently require exactly two variantssub_agent_strategy·smoke-gemini🟢 —single_agent(121) vssub_agents(139) · metric:effective_tokens· min_samples=20 · p=0.263→ 🟡 EXTEND (
insufficient_observations): primary metric observations are not available for statistical comparisonsub_agent_decomposition·smokepi🟢 —parallel_sub_agents(42) vssingle_agent(34) · min_samples=20 · p=0.362→ 🟡 EXTEND (
insufficient_observations): primary metric observations are not available for statistical comparisonprompt_style_test·smoke-project🟡 — n/a · metric:run_success_rate· min_samples=20 · p=0.000→ 🟡 EXTEND (
insufficient_observations): at least two variants are required for a decisionsub_agent_strategy·smoke-temporary-id🟡 — n/a · metric:effective_token_count· min_samples=20 · p=0.000→ 🟡 EXTEND (
insufficient_observations): at least two variants are required for a decisionmodel_size·test-quality-sentinel🟡 — n/a · metric:review_usefulness_acceptance_rate· min_samples=20 · p=0.000→ 🟡 EXTEND (
insufficient_observations): at least two variants are required for a decisiontone_style·typist🟢 —conversational(40) vsformal(34) · metric:discussion_engagement_score· min_samples=20 · p=0.493→ 🟡 EXTEND (
insufficient_observations): primary metric observations are not available for statistical comparisonprefetch_strategy·weekly-blog-post-writer🟡 —eager(5) vslazy(7) · metric:agent_turn_count· min_samples=20 · p=0.571→ 🟡 EXTEND (
insufficient_samples): one or more variants have fewer usable observations than min_samples📊 Summary
View Full Experiments Table
prompt_compressionagent-performance-analyzercaveman,verbosesub_agent_strategyagent-persona-explorerbatch,per_scenariosub_agent_strategyarchitectureguardiansingle_agent,sub_agentsaudit_decompositionaudit-workflowsphased_sub_agents,single_agenttone_variantaw-failure-investigatorassertive,clinical,narrativeprompt_styleblog-auditorconcise,detailedtone_variantbreaking-change-checkerneutral,urgentprompt_styleci-coachconcise,detailedoutput_formatcopilot-agent-analysisprose,ste,structuredsub_agent_strategydaily-agentrx-trace-optimizersingle_agent,sub_agentsdetail_leveldaily-architecture-diagrambrief,comprehensiveprompt_styledaily-astrostylelite-markdown-spellcheckconcise,detailedmodel_sizedaily-cache-strategy-analyzermodel_sizedaily-caveman-optimizeragent,claude-haiku-4.5,claude-sonnet-4.6,claude-sonnet-5,small-agentoutput_formatdaily-code-metricsexecutive_summary,full_detail,steprompt_styledaily-community-attributionconcise,verboseoutput_formatdaily-compiler-qualityconcise,detailed,stemodel_sizedaily-doc-healeragent,claude-haiku-4.5,claude-sonnet-4.6,claude-sonnet-5,small-agentmodel_sizedaily-doc-updateragent,claude-haiku-4.5,claude-sonnet-4.6,claude-sonnet-5,small-agentreasoning_depthdaily-factmulti_candidate,single_passmodel_sizedailyfunctionnameroutput_formatdaily-issues-reportcollapsible,inline,steprompt_styledaily-newsconcise,detailedremove_redundant_context_v1daily-rendering-scripts-verifierlog_fetch_strategydaily-safe-output-optimizerreasoning_depthdaily-security-red-teamiterative,single_passsemgrep_output_formatdaily-semgrep-scanbullet_list,prose,structured_sectionstimeout_settingdailysubagentoptimizerdefault,relaxed,tightcaveman_modedataflow-pr-discussion-datasetno,yesoutput_formatdeep-reportannotated_brief,executive_brief,full_briefing,stesummary_detaildependabotcampaignbrief,detailedprompt_styledependabot-go-checkerconcise,detailed,step_by_steptool_verbositygpcleanfull_bash,minimal_toolsetprompt_styleissue-arboristconcise,detailedreasoning_depthplanbaseline,deep,shallowremove_redundant_context_v1pr-sous-chefsub_agent_strategysmokeantigravitysingle_agent,sub_agentscavemansmoke-copilotno,yessubagent_modelsmoke-copilotlarge,smallcavemansmoke-copilot-aoai-apikeyno,yessubagent_modelsmoke-copilot-aoai-apikeylarge,smallcavemansmoke-copilot-aoai-entrano,yessubagent_modelsmoke-copilot-aoai-entralarge,smallsub_agent_strategysmoke-copilot-sub-agentsdelegated_sequential,inline_strict,single_agent_controlsub_agent_strategysmoke-geminisingle_agent,sub_agentssub_agent_decompositionsmokepiparallel_sub_agents,single_agentprompt_style_testsmoke-projectsub_agent_strategysmoke-temporary-idmodel_sizetest-quality-sentineltone_styletypistconversational,formalprefetch_strategyweekly-blog-post-writereager,lazy🔧 Self-Tuning Continuation Plan
Top 3 experiment actions
unsupported_multi_variantblocks 14 experiments (awfailureinvestigator,copilotagentanalysis,dailycavemanoptimizer,dailycodemetrics,dailycompilerquality,dailydochealer,dailydocupdater,dailyissuesreport,dailysemgrepscan,dailysubagentoptimizer,dependabotgochecker,deepreport,plan,smokecopilotsubagents) — reduce to 2-variant A/B or extend the core analyzer to support >2-variant decisioning.READYexperiments (agentperformanceanalyzer,awfailureinvestigator,cicoach,dailyfact,dailynews,dailysecurityredteam,issuearborist,typist) have sufficient samples but decisions are blocked oninsufficient_observations/guardrail_unsupported— wire up native metric/grader observation ingestion for their primary metrics so the next run can reach PROMOTE/REJECT.COLLECTING+insufficient_samplesexperiments (architectureguardian,auditworkflows,blogauditor,breakingchangechecker,dailyarchitecturediagram,dataflowprdiscussiondataset,dependabotcampaign,weeklyblogpostwriter) need no action — continue running untilmin_samplesreached.Top 3 eval actions
cicoach'stoken_count_per_runanddailysecurityredteam'sfalse_positive_rate) — closest to an actionable decision.output_formatexperiments (dailycodemetrics,dailycompilerquality,dailyissuesreport,deepreport) ahead of multi-variant core-analysis support.discussion_engagement_scoregraders (dailycodemetrics,dailycompilerquality,dailyissuesreport,typist) are actually emitting per-run values — several showguardrail_unsupported/insufficient_observationsdespite READY sample sizes.Decision-pipeline gaps for next PR
insufficient_observations(26) +guardrail_unsupported(3) experiments show the core analyzer isn't receiving per-run primary-metric observations for most workflows — largest blocker to PROMOTE/REJECT.unsupported_multi_variant(14) shows the core analyzer only supports 2-variant pairwise decisions; multi-variant (ANOVA/chi-square) support is needed as a normalized core signal.All reactions