A verifiable benchmark + RL environment for agents that design neural-network architectures. Models emit graph edits; a deterministic verifier grades the result. No GPU, no human judge.
benchmark reinforcement-learning deep-learning grok rl-environment neural-architecture evals llm-agents grpo verifiable-reward
-
Updated
Jul 26, 2026 - JavaScript