Skip to content

History / Cross Dataset Comparison

Revisions

  • Complete cross-LLM comparison: Sonnet 4.6 wins 3-2 across all 5 datasets Final two datasets complete: - SlimPajama: S4.0 wins (1.5259 vs 1.5267), both models find it near-impervious - FineWeb-Edu-High: S4.6 wins (1.3345 vs 1.3463), spectacular beta2 walk (5 consecutive keeps: 0.98->0.975->0.970->0.968->0.966->0.964) Overall: S4.6 crashes 2.1x less, explores 60% more parameters, discovered AR=21 architecture. S4.0 wins where it had pre-optimized baseline advantage. New: SlimPajama + FineWeb-Edu-High Sonnet 4.6 run pages Updated: Cross-LLM-Comparison (complete 5-dataset analysis), Cross-Dataset-Comparison, Home.md, chart (5 datasets) Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>

    Dave Graham committed Mar 25, 2026
  • Add Sonnet 4.6 SlimPajama results — S4.0 wins, score now 2-1-1 SlimPajama completed: 101 experiments, 2 keeps, best 1.5267 (vs S4.0's 1.5259). First dataset where Sonnet 4.0 clearly wins — flat optimization landscape where both models barely improve from baseline. Sonnet 4.6 struggled with reproducibility (exp36-49 couldn't replicate baseline). Series score: Sonnet 4.6 leads 2-1-1 with FineWeb-Edu-High remaining as the tiebreaker. New: Sonnet-4.6-SlimPajama-Agent-Run-Mar-24-2026.md Updated: Cross-LLM-Comparison.md (4 datasets), Cross-Dataset-Comparison.md, Home.md, cross-llm-comparison.png chart (4 datasets) Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>

    Dave Graham committed Mar 24, 2026
  • Add Sonnet 4.6 Cosmopedia-v2 results — AR=21 breaks AR=32 consensus Sonnet 4.6 completed 101 experiments on Cosmopedia-v2: 16 keeps (16.0%), 0 crashes, best val_bpb 0.9549 (vs Sonnet 4.0's 0.9606). The key discovery is ASPECT_RATIO=21, breaking the universal AR=32 finding from all five Sonnet 4.0 datasets. Every parameter differs between the two models' best configurations. New: Sonnet-4.6-Cosmopedia-v2-Agent-Run-Mar-24-2026.md Updated: Cross-LLM-Comparison.md (3 datasets), Cross-Dataset-Comparison.md, Home.md, cross-llm-comparison.png chart (3 datasets) Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>

    Dave Graham committed Mar 24, 2026
  • Add Sonnet 4.6 FineWeb-Edu results and update cross-LLM comparison New: Sonnet 4.6 FineWeb-Edu run page (100 experiments, 18 keeps, best 1.3416) Key finding: Both models converge to nearly identical val_bpb (1.3416 vs 1.3424) via completely different configurations — proving multiple near-equivalent optima exist in FineWeb-Edu's optimization landscape. Updated: Cross-LLM Comparison with full FineWeb-Edu analysis Updated: Cross-Dataset Comparison with Sonnet 4.6 FineWeb-Edu reference Updated: Home page with new run entry New: Cross-LLM comparison chart Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>

    Dave Graham committed Mar 23, 2026
  • Add Sonnet 4.6 ClimbMix run, Cross-LLM Comparison page New pages: - Sonnet 4.6 ClimbMix Agent Run (119 experiments, 8 keeps, 1.63% improvement) - Cross-LLM Comparison (Sonnet 4.0 vs 4.6 analysis framework) Updated: - Home: new Cross-LLM section, Sonnet 4.6 run table, LLM column - Cross-Dataset Comparison: link to Cross-LLM page Key finding: Sonnet 4.6 demonstrates compositional multi-parameter optimization (3 synergistic HPs) vs Sonnet 4.0's single-param tweaks. Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>

    Dave Graham committed Mar 22, 2026
  • Add FineWeb-Edu-High run (Mar 21), update cross-dataset comparison to 5 datasets

    Dave Graham committed Mar 21, 2026
  • Make comparison chart clickable to view full-size image

    Dave Graham committed Mar 21, 2026
  • Add SlimPajama run, update cross-dataset comparison to 4 datasets Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>

    Dave Graham committed Mar 20, 2026
  • Add Cosmopedia-v2 run results, update cross-dataset comparison to 3 datasets New page: Cosmopedia-v2-Agent-Run-Mar-20-2026 (103 experiments, 4 keeps, best val_bpb 0.9606). Updated cross-dataset comparison with architecture convergence finding (all 3 datasets → AR=32) and climbmix/cosmopedia config similarity. Updated Home.md with new run row. Co-Authored-By: Claude Opus 4.6 (1M context) <noreply@anthropic.com>

    Dave Graham committed Mar 20, 2026
  • Update cross-dataset comparison with Mar 19 climbmix results Major revision: both datasets converge to AR=32 (architecture convergence, not divergence). Updated hyperparameter tables with accurate climbmix config (EMBEDDING_LR=0.4, SCALAR_LR=0.4). Added near-optimal plateau analysis and crash rate correlation. Co-Authored-By: Claude Opus 4.6 (1M context) <noreply@anthropic.com>

    Dave Graham committed Mar 20, 2026
  • Move cross-dataset detail to dedicated wiki page Keep graphic and lead-in on Home page with link to full analysis. New Cross-Dataset-Comparison page has architecture divergence, hyperparameter divergence, improvement dynamics, best configs side-by-side, and implications. Co-Authored-By: Claude Opus 4.6 <noreply@anthropic.com>

    Dave Graham committed Mar 17, 2026