{
  "design": {
    "matched_optimizer_steps": 561,
    "effective_batch_size": 16,
    "max_length": 1024,
    "learning_rate": 2e-5,
    "seed": 42,
    "objective": "response_only_full_sft",
    "gpu": "NVIDIA RTX 6000 Ada Generation"
  },
  "lowest_validation_loss_arm": "arm-a-full",
  "arms": [
    {
      "name": "arm-a-full",
      "description": "All task_solution, error_repair, and trajectory rows (~75/15/10).",
      "rows": 8970,
      "kind_counts": {
        "task_solution": 6770,
        "error_repair": 1308,
        "trajectory": 892
      },
      "eval_loss": 0.7179822325706482,
      "train_loss": 0.7652306379268938,
      "imitation_n": 1030,
      "exact": 0.18058252427184465,
      "tf_loss": 0.6618314936946758
    },
    {
      "name": "arm-b-no-trajectories",
      "description": "Task solutions and error repairs; trajectories removed.",
      "rows": 8078,
      "eval_loss": 0.7786956429481506,
      "train_loss": 0.7262140446593205,
      "imitation_n": 1030,
      "exact": 0.1786407766990291,
      "tf_loss": 0.7136392770270089
    },
    {
      "name": "arm-c-task-only",
      "description": "Task solutions only.",
      "rows": 6770,
      "eval_loss": 0.875102698802948,
      "train_loss": 0.7432863387194547,
      "imitation_n": 1030,
      "exact": 0.09514563106796116,
      "tf_loss": 0.86379755875468
    },
    {
      "name": "arm-d-concrete-checks",
      "description": "Rows whose checks exclude the generic task_complete note.",
      "rows": 5237,
      "eval_loss": 0.7908467650413513,
      "train_loss": 0.7110636833517309,
      "imitation_n": 1030,
      "exact": 0.10194174757281553,
      "tf_loss": 0.7339007938748765
    }
  ],
  "selection_warning": "Lowest validation loss is diagnostic imitation, not GFR locked execution."
}
