[experiments] Daily Experiment Report — 2026-09-23 #62905
Closed
Replies: 1 comment
|
This discussion has been marked as outdated by daily-experiment-report. A newer discussion is available at Discussion #63130. |
0 replies
Sign up for free
to join this conversation on GitHub.
Already have an account?
Sign in to comment
Uh oh!
There was an error while loading. Please reload this page.
🧪 Daily Experiment Report — 2026-09-23
51 named A/B experiments across 48 workflows were analysed: 24 are 🟢 READY (all variants ≥ min_samples) and 27 are 🟡 COLLECTING. Every core decision came back EXTEND (37) or INCONCLUSIVE (14) — no
PROMOTE/REJECTyet, because outcome metric wiring (nativerun_success_rate/empty_output_rateguardrails and multi-variant (>2) decisions) is not fully supported by the core analysis layer yet.⚡ Quick Stats
prompt_compression·agent-performance-analyzer.md📈 View Detailed Statistics
Sample Sizes & Progress
cavemanverboseCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonsub_agent_strategy·agent-persona-explorer.md📈 View Detailed Statistics
Sample Sizes & Progress
batchper_scenarioCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisontone_variant·aw-failure-investigator.md📈 View Detailed Statistics
Sample Sizes & Progress
assertiveclinicalnarrativeCore decision: INCONCLUSIVE (
unsupported_multi_variant) — automatic decisions currently require exactly two variantstone_variant·breaking-change-checker.md📈 View Detailed Statistics
Sample Sizes & Progress
neutralurgentCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonprompt_style·ci-coach.mdH0: no change in PR merge rate or proposal quality. H1: concise prompt reduces token usage ≥25% without degrading proposal quality
📈 View Detailed Statistics
Sample Sizes & Progress
concisedetailedCore decision: EXTEND (
guardrail_unsupported) — mandatory guardrail "run_success_rate" is not backed by a supported metric observationsub_agent_strategy·daily-agentrx-trace-optimizer.md📈 View Detailed Statistics
Sample Sizes & Progress
single_agentsub_agentsCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonprompt_style·daily-astrostylelite-markdown-spellcheck.md📈 View Detailed Statistics
Sample Sizes & Progress
concisedetailedCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonprompt_style·daily-community-attribution.md📈 View Detailed Statistics
Sample Sizes & Progress
conciseverboseCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonreasoning_depth·daily-fact.mdH0: no change in discussion engagement rate. H1: multi_candidate produces more novel verses with higher reaction counts (expected +20% reactions).
📈 View Detailed Statistics
Sample Sizes & Progress
multi_candidatesingle_passCore decision: EXTEND (
guardrail_unsupported) — mandatory guardrail "empty_output_rate" is not backed by a supported metric observationprompt_style·daily-news.md📈 View Detailed Statistics
Sample Sizes & Progress
concisedetailedCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonreasoning_depth·daily-security-red-team.mdH0: no change in finding quality. H1: iterative reduces false-positive rate by >=20% at <=30% token overhead
📈 View Detailed Statistics
Sample Sizes & Progress
iterativesingle_passCore decision: EXTEND (
guardrail_unsupported) — mandatory guardrail "run_success_rate" is not backed by a supported metric observationoutput_format·deep-report.md📈 View Detailed Statistics
Sample Sizes & Progress
annotated_briefexecutive_brieffull_briefingsteCore decision: INCONCLUSIVE (
unsupported_multi_variant) — automatic decisions currently require exactly two variantstool_verbosity·gpclean.md📈 View Detailed Statistics
Sample Sizes & Progress
full_bashminimal_toolsetCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonprompt_style·issue-arborist.md📈 View Detailed Statistics
Sample Sizes & Progress
concisedetailedCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonsub_agent_strategy·smokeantigravity📈 View Detailed Statistics
Sample Sizes & Progress
single_agentsub_agentsCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisoncaveman·smoke-copilot.md📈 View Detailed Statistics
Sample Sizes & Progress
noyesCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonReport action: EXTEND (
interaction_underpowered) — a second concurrent experiment (subagent_model) is running on the same workflow; the caveman×subagent_model factorial cells are sparse (all 4 cells n=2-3, below min_samples=20), so a reporting safety hold is applied instead of trusting the marginal decision alone. See the interaction table below.subagent_model·smoke-copilot.md📈 View Detailed Statistics
Sample Sizes & Progress
largesmallCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisoncaveman·smoke-copilot-aoai-apikey.md📈 View Detailed Statistics
Sample Sizes & Progress
noyesCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonsubagent_model·smoke-copilot-aoai-apikey.md📈 View Detailed Statistics
Sample Sizes & Progress
largesmallCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisoncaveman·smoke-copilot-aoai-entra.md📈 View Detailed Statistics
Sample Sizes & Progress
noyesCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonsubagent_model·smoke-copilot-aoai-entra.md📈 View Detailed Statistics
Sample Sizes & Progress
largesmallCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonsub_agent_strategy·smoke-gemini.md📈 View Detailed Statistics
Sample Sizes & Progress
single_agentsub_agentsCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisonsub_agent_decomposition·smoke-pi.md📈 View Detailed Statistics
Sample Sizes & Progress
parallel_sub_agentssingle_agentCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparisontone_style·typist.md📈 View Detailed Statistics
Sample Sizes & Progress
conversationalformalCore decision: EXTEND (
insufficient_observations) — primary metric observations are not available for statistical comparison🔀 Factorial Interaction Check ·
smoke-copilot.md(caveman×subagent_model)🔬 View Interaction Cells
interaction_p_value(2×2 chi-square on assignment): 1.0 (no evidence of dependence, but all cells are sparse)interaction_risk_status: SPARSE_CELL_RISK — every cell has n < min_samples (20)Both
cavemanandsubagent_modelcore decisions areEXTEND, so no promotion is being held back by this interaction check today — but the same pattern (n=1 for each ofsmokecopilotaoaiapikeyandsmokecopilotaoaientra) recurs across thesmoke-copilot*family and should be watched once any of those experiments reachesPROMOTE.🟡 Collecting — 27 experiments not yet at min_samples or blocked on multi-variant support
📋 View All Collecting Experiments
sub_agent_strategyarchitecture-guardian.mdinsufficient_samplesaudit_decompositionaudit-workflows.mdinsufficient_samplesprompt_styleblog-auditor.mdinsufficient_samplesoutput_formatcopilot-agent-analysis.mdunsupported_multi_variantdetail_leveldaily-architecture-diagram.mdinsufficient_samplesmodel_sizedaily-cache-strategy-analyzer.mdinsufficient_samplesmodel_sizedaily-caveman-optimizer.mdunsupported_multi_variantoutput_formatdaily-code-metrics.mdunsupported_multi_variantoutput_formatdaily-compiler-quality.mdunsupported_multi_variantmodel_sizedaily-doc-healer.mdunsupported_multi_variantmodel_sizedaily-doc-updater.mdunsupported_multi_variantmodel_sizedaily-function-namer.mdinsufficient_observationsoutput_formatdaily-issues-report.mdunsupported_multi_variantremove_redundant_context_v1daily-rendering-scripts-verifier.mdinsufficient_observationslog_fetch_strategydaily-safe-output-optimizer.mdinsufficient_observationssemgrep_output_formatdaily-semgrep-scan.mdunsupported_multi_varianttimeout_settingdailysubagentoptimizerunsupported_multi_variantcaveman_modedataflow-pr-discussion-dataset.mdinsufficient_samplessummary_detaildependabotcampaigninsufficient_samplesprompt_styledependabot-go-checker.mdunsupported_multi_variantreasoning_depthplan.mdunsupported_multi_variantremove_redundant_context_v1pr-sous-chef.mdinsufficient_observationssub_agent_strategysmoke-copilot-sub-agents.mdunsupported_multi_variantprompt_style_testsmoke-project.mdinsufficient_observationssub_agent_strategysmoke-temporary-id.mdinsufficient_observationsmodel_sizetest-quality-sentinel.mdinsufficient_samplesprefetch_strategyweekly-blog-post-writer.mdinsufficient_samples📊 Summary
View Full Experiments Table
prompt_compressionagent-performance-analyzer.mdcavemanverbosesub_agent_strategyagent-persona-explorer.mdbatchper_scenariosub_agent_strategyarchitecture-guardian.mdsingle_agentsub_agentsaudit_decompositionaudit-workflows.mdsingle_agentphased_sub_agentstone_variantaw-failure-investigator.md??prompt_styleblog-auditor.mdconcisedetailedtone_variantbreaking-change-checker.mdneutralurgentprompt_styleci-coach.mddetailedconciseoutput_formatcopilot-agent-analysis.md??sub_agent_strategydaily-agentrx-trace-optimizer.mdsingle_agentsub_agentsdetail_leveldaily-architecture-diagram.mdbriefcomprehensiveprompt_styledaily-astrostylelite-markdown-spellcheck.mdconcisedetailedmodel_sizedaily-cache-strategy-analyzer.mdgpt-5.3-codexgpt-5.3-codex-sparkmodel_sizedaily-caveman-optimizer.md??output_formatdaily-code-metrics.md??prompt_styledaily-community-attribution.mdconciseverboseoutput_formatdaily-compiler-quality.md??model_sizedaily-doc-healer.md??model_sizedaily-doc-updater.md??reasoning_depthdaily-fact.mdsingle_passmulti_candidatemodel_sizedaily-function-namer.md??output_formatdaily-issues-report.md??prompt_styledaily-news.mdconcisedetailedremove_redundant_context_v1daily-rendering-scripts-verifier.md??log_fetch_strategydaily-safe-output-optimizer.mdeagerlazyreasoning_depthdaily-security-red-team.mdsingle_passiterativesemgrep_output_formatdaily-semgrep-scan.md??timeout_settingdailysubagentoptimizer??caveman_modedataflow-pr-discussion-dataset.mdnoyesoutput_formatdeep-report.md??summary_detaildependabotcampaignbriefdetailedprompt_styledependabot-go-checker.md??tool_verbositygpclean.mdfull_bashminimal_toolsetprompt_styleissue-arborist.mdconcisedetailedreasoning_depthplan.md??remove_redundant_context_v1pr-sous-chef.md??sub_agent_strategysmokeantigravitysingle_agentsub_agentscavemansmoke-copilot.mdnoyessubagent_modelsmoke-copilot.mdlargesmallcavemansmoke-copilot-aoai-apikey.mdnoyessubagent_modelsmoke-copilot-aoai-apikey.mdlargesmallcavemansmoke-copilot-aoai-entra.mdnoyessubagent_modelsmoke-copilot-aoai-entra.mdlargesmallsub_agent_strategysmoke-copilot-sub-agents.md??sub_agent_strategysmoke-gemini.mdsingle_agentsub_agentssub_agent_decompositionsmoke-pi.mdparallel_sub_agentssingle_agentprompt_style_testsmoke-project.md??sub_agent_strategysmoke-temporary-id.mdsingle_agentsub_agentsmodel_sizetest-quality-sentinel.mdclaude-haiku-4.5claude-sonnet-5tone_styletypist.mdconversationalformalprefetch_strategyweekly-blog-post-writer.mdeagerlazy🔧 Self-Tuning Continuation Plan
🛠️ View Continuation Plan
Top 3 experiment actions
run_success_rateandempty_output_rateguardrail observations into the core analysis layer — 3 READY experiments (cicoach.prompt_style,dailyfact.reasoning_depth,dailysecurityredteam.reasoning_depth) are stuck onguardrail_unsupporteddespite having sufficient samples.deepreport.output_format,dailycodemetrics.output_format,dailyissuesreport.output_format,dailysemgrepscan.semgrep_output_format,plan.reasoning_depth, and 9 more) are permanentlyINCONCLUSIVEunderunsupported_multi_variantregardless of sample size.aic,token_count_per_run,discussion_engagement_score) to run IDs soinsufficient_observations(19 of 24 READY experiments) can resolve into realPROMOTE/REJECT/INCONCLUSIVEdecisions instead of perpetualEXTEND.Top 3 eval actions
cicoach(ci-coach.md): tighten eval questions scoring PR merge rate / proposal quality soprompt_style(concise vs detailed) has a graded outcome instead of relying on an unsupported native guardrail.dailyfact/dailysecurityredteam(daily-fact.md,daily-security-red-team.md): add an explicitempty_output_rate/run_success_rategrader soreasoning_depthguardrails stop reportingguardrail_unsupported.deepreport(deep-report.md): add a grader foroutput_formatvariants (executive_brief,full_briefing,ste,annotated_brief) scoring readability/verbosity trade-offs, since this is a 4-variant experiment currently unresolvable by core analysis.Decision-pipeline gaps for the next PR
guardrail_unsupported(3 experiments): nativerun_success_rate/empty_output_rateguardrails declared in frontmatter have no backing metric observation pipeline yet.unsupported_multi_variant(14 experiments): core analysis only supports exactly 2 variants; K-variant (K≥3) experiments need a normalized comparison method (e.g. omnibus test + pairwise follow-up).insufficient_observations(19 experiments): primary metric fields exist in frontmatter but are not resolvable to per-run values, so decisions default toEXTENDeven at full sample size.SPARSE_CELL_RISKonsmokecopilotand its aoai variants) are currently computed only in this report; they should become a normalized core analysis signal that can forcereport_actionoverrides consistently rather than via ad hoc reporting logic.Warning
Firewall blocked 5 domains
The following domains were blocked by the firewall during workflow execution:
github.como205451.ingest.us.sentry.ioproxy.golang.orgstorage.googleapis.comsum.golang.orgTo allow these domains, add them to the
network.allowedlist in your workflow frontmatter:See Network Configuration for more information.
All reactions