# ============================================================ # PatchHawk Training & Pipeline Configuration # All tunable hyperparameters live here # ============================================================ data_generation: num_samples: 10 output_format: "json" benign_dir: "patchhawk/data/benign/" scenarios_output: "patchhawk/data/scenarios.json" sdk_config: "patchhawk/data/sdk_config.yaml" training: learning_rate: 0.000001 # 1e-6 group_size: 4 # GRPO group size max_seq_len: 1024 max_steps: 100 gradient_accumulation_steps: 4 ppo_clip_eps: 0.2 lora_r: 16 lora_alpha: 16 lora_dropout: 0 output_dir: "grpo_lora" environment: max_steps: 5 use_docker: false sandbox_timeout_sec: 5 docker: image: "patchhawk-sandbox:latest" network: "none" memory: "256m" cpus: "0.5" a2a: host: "0.0.0.0" port: 8000 huggingface: repo: "ramprasathk07/patchhawk" push_after_training: true