nvfp4

또한, NVFP4 양자화 포맷은 NVIDIA의 최신 Blackwell(양산형 서버 아키텍처 등) 아키텍처에 내장된 FP4 Tensor Core 사양에 최적화되어 있습니다. 일반적인 에이다 러브레이스(RTX 40 시리즈) 아키텍처에서는 하드웨어 단에서 FP4 네이티브 연산을 지원하지 않으므로 에뮬레이션 모드로 작동되어 속도가 매우 느리거나 구동이 까다로울 수 있습니다. 하지만 gemma-4-E2B는 유효 파라미터가 2B(약 20억 개) 수준으로 매우 작아 VRAM 용량(주로 8GB) 내에는 충분히 들어갑니다.

vllm

결론부터 말씀드리면, vLLM은 기본적으로 GPU 오프로딩 모델이 아니므로 llama.cpp처럼 –gpu-layers 같은 옵션이 존재하지 않으며, 전량을 GPU VRAM에 올려서 실행(Full Offloading)해야 합니다.

MTP

1
vllm serve QuantTrio/Qwen3.6-27B-AWQ -tp 2 --max-model-len 65536 --max-num-seqs 4 --speculative-config '{"method":"dflash","model":"<dflash draft>","num_speculative_tokens":15,"attention_backend":"FLASH_ATTN"}'

vllm 0.23, works the same on 0.25 but there u have to strip layer_types from the draft config first or it wont load

unsloth/gemma-4-nvfp4

https://unsloth.ai/docs/basics/nvfp4

Author

Gangtai Goh

Posted on

2026-07-23

Updated on

2026-07-15

Licensed under