grug-27b-nvfp4

grug brain in NVIDIA four-bit float rock. Blackwell GPU eat this format raw = big speed, small memory, quality mostly keep.

  • source: grug-27b (v2.1)
  • scheme: NVFP4 (W4A4) via llm-compressor one-shot
  • calibration: 512 samples of grug's own training distribution (agent sessions + grug reasoning) so scales match real usage
  • kept high precision: lm_head, vision tower, router gates

how run

vllm serve ProCreations/grug-27b-nvfp4 --max-model-len 32768 \
  --reasoning-parser deepseek_r1

best on Blackwell (native FP4). works on Hopper too (weight-only benefit). grug think dense inside <think> (arrives in message.reasoning), answer normal english. sampling temp 0.6-1.0, top_p 0.95, top_k 20.

family: grug-27b | grug-27b-mtp | gguf | qat-q4

grug made by ProCreations.

Downloads last month
648
Safetensors
Model size
17B params
Tensor type
F32
BF16
F8_E4M3
U8
Inference Providers NEW
This model isn't deployed by any Inference Provider. 馃檵 Ask for provider support

Model tree for ProCreations/grug-27b-nvfp4

Base model

Qwen/Qwen3.6-27B
Quantized
(8)
this model