Skip to content

History / Cross LLM Comparison

Revisions

  • Complete 4-model ClimbMix comparison — Opus finishes 3rd, Haiku wins Final ranking: Haiku (1.2953) > S4.6 (1.3093) > Opus (1.3569) > S4.0 (1.3588) Architecture discovery correlates perfectly with results, not model cost. Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>

    Dave Graham committed Mar 27, 2026
  • Update Opus 4.6 analysis to 70/100 exp — highest keep rate, still architecturally blind Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>

    Dave Graham committed Mar 27, 2026
  • Add Opus 4.6 early analysis (23/100 exp) — 26% crash rate, "bigger is better" bias Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>

    Dave Graham committed Mar 27, 2026
  • Add S4.0 + S4.6 stock ClimbMix analysis — complete 3-model comparison (Haiku wins) Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>

    Dave Graham committed Mar 26, 2026
  • Sonnet 4.0 stock baseline ClimbMix: 1.3588 — architecture blindness vs Haiku's 1.2953 S4.0 never changed AR/depth/window in 100 experiments. Haiku's architecture discoveries (AR=32, depth reduction, LLLL) tripled throughput and won decisively. Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>

    Dave Graham committed Mar 26, 2026
  • Final Haiku 4.5 ClimbMix results: Haiku wins (1.2953) — beats both Sonnets from stock defaults Late comeback via β1+MATRIX_LR synergy at exp90-91. 10 keeps, 3 crashes, 8.04% improvement from stock AR=64 baseline. Full 100-experiment analysis. Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>

    Dave Graham committed Mar 26, 2026
  • Add Haiku 4.5 ClimbMix analysis (67/100 exp) — decision-making comparison across 3 models Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>

    Dave Graham committed Mar 25, 2026
  • Retract tainted Haiku results, add stock baseline methodology for fair cross-model comparison Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>

    Dave Graham committed Mar 25, 2026
  • Add Haiku 4.5 early results — ClimbMix 22/101 experiments, new absolute best 1.2924 Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>

    Dave Graham committed Mar 25, 2026
  • Complete cross-LLM comparison: Sonnet 4.6 wins 3-2 across all 5 datasets Final two datasets complete: - SlimPajama: S4.0 wins (1.5259 vs 1.5267), both models find it near-impervious - FineWeb-Edu-High: S4.6 wins (1.3345 vs 1.3463), spectacular beta2 walk (5 consecutive keeps: 0.98->0.975->0.970->0.968->0.966->0.964) Overall: S4.6 crashes 2.1x less, explores 60% more parameters, discovered AR=21 architecture. S4.0 wins where it had pre-optimized baseline advantage. New: SlimPajama + FineWeb-Edu-High Sonnet 4.6 run pages Updated: Cross-LLM-Comparison (complete 5-dataset analysis), Cross-Dataset-Comparison, Home.md, chart (5 datasets) Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>

    Dave Graham committed Mar 25, 2026
  • Add Sonnet 4.6 SlimPajama results — S4.0 wins, score now 2-1-1 SlimPajama completed: 101 experiments, 2 keeps, best 1.5267 (vs S4.0's 1.5259). First dataset where Sonnet 4.0 clearly wins — flat optimization landscape where both models barely improve from baseline. Sonnet 4.6 struggled with reproducibility (exp36-49 couldn't replicate baseline). Series score: Sonnet 4.6 leads 2-1-1 with FineWeb-Edu-High remaining as the tiebreaker. New: Sonnet-4.6-SlimPajama-Agent-Run-Mar-24-2026.md Updated: Cross-LLM-Comparison.md (4 datasets), Cross-Dataset-Comparison.md, Home.md, cross-llm-comparison.png chart (4 datasets) Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>

    Dave Graham committed Mar 24, 2026
  • Add Sonnet 4.6 Cosmopedia-v2 results — AR=21 breaks AR=32 consensus Sonnet 4.6 completed 101 experiments on Cosmopedia-v2: 16 keeps (16.0%), 0 crashes, best val_bpb 0.9549 (vs Sonnet 4.0's 0.9606). The key discovery is ASPECT_RATIO=21, breaking the universal AR=32 finding from all five Sonnet 4.0 datasets. Every parameter differs between the two models' best configurations. New: Sonnet-4.6-Cosmopedia-v2-Agent-Run-Mar-24-2026.md Updated: Cross-LLM-Comparison.md (3 datasets), Cross-Dataset-Comparison.md, Home.md, cross-llm-comparison.png chart (3 datasets) Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>

    Dave Graham committed Mar 24, 2026
  • Add Sonnet 4.6 FineWeb-Edu results and update cross-LLM comparison New: Sonnet 4.6 FineWeb-Edu run page (100 experiments, 18 keeps, best 1.3416) Key finding: Both models converge to nearly identical val_bpb (1.3416 vs 1.3424) via completely different configurations — proving multiple near-equivalent optima exist in FineWeb-Edu's optimization landscape. Updated: Cross-LLM Comparison with full FineWeb-Edu analysis Updated: Cross-Dataset Comparison with Sonnet 4.6 FineWeb-Edu reference Updated: Home page with new run entry New: Cross-LLM comparison chart Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>

    Dave Graham committed Mar 23, 2026
  • Add Sonnet 4.6 ClimbMix run, Cross-LLM Comparison page New pages: - Sonnet 4.6 ClimbMix Agent Run (119 experiments, 8 keeps, 1.63% improvement) - Cross-LLM Comparison (Sonnet 4.0 vs 4.6 analysis framework) Updated: - Home: new Cross-LLM section, Sonnet 4.6 run table, LLM column - Cross-Dataset Comparison: link to Cross-LLM page Key finding: Sonnet 4.6 demonstrates compositional multi-parameter optimization (3 synergistic HPs) vs Sonnet 4.0's single-param tweaks. Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>

    Dave Graham committed Mar 22, 2026