Reinforcement Learning
PEFT
Safetensors
grpo
trl
RL Environment
openenv
p5js
generative-art
lora
watercolour-grpo-hps-only / training_args.bin

Commit History

Add the HPS-only GRPO adapter for Qwen3.5-35B-A3B
f2e23e6
verified

sergiopaniego HF Staff commited on