Local LLM 시리즈
(Local LLM) Ollama 시작하기
Codex 와 Local LLM 연결하기
llama-server 에서 router mode 사용하기
model unload
curl -s -X POST http://localhost:8080/models/unload -H “Content-Type: application/json” -d ‘{“model”: “your-model-name”}’
Qwen3.6-27B
Qwen 3.6 27B는 로컬 개발의 최적 지점
unsloth/Qwen 3.6 27B gguf
실행 (3080ti) Qwen3.6-27B-UD-Q3_K_XL 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 [*] models-max = 1 no-models-autoload = 1 [qwen36coding] model = /home/qkboo/Models/unsloth/Qwen3.6 -27 B-MTP/Qwen3.6 -27 B-UD-Q3_K_XL.ggufalias = 'Qwen36-27B-MTP' no-mmproj-offload = 1 slots = 1 mmap = 1 mlock = true n-gpu-layers = 40 spec-type = draft-mtpspec-draft-n-max = 2 cache-type-k = q8_0 cache-type-v = q8_0 ncmoe = 28 np = 1 threads = 8 threads-batch = 8 predict = -1 ctx-size = 49152 batch-size = 2048 ubatch-size = 2048 temp = 0.1 top-p =0.95 top-k =20 flash-attn = 1 reasoning-preserve = 1
1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 19 20 21 22 23 24 25 26 27 28 29 30 31 32 33 model = /home/qkboo/Models/unsloth/Qwen3.6 -27 B-MTP/Qwen3.6 -27 B-UD-Q3_K_XL.ggufalias = 'Qwen36-27B-MTP' no-mmproj-offload = 1 slots = 1 mmap = 1 mlock = true n-gpu-layers = 38 spec-type = draft-mtpspec-draft-n-max = 2 cache-type-k = q8_0 cache-type-v = q8_0 ncmoe = 15 np = 1 threads = 10 threads-batch = 10 predict = -1 ctx-size = 65536 batch-size = 2048 ubatch-size = 2048 temp = 0.1 top-p =0.95 top-k =20 flash-attn = 1 reasoning-preserve = 1
Qwen3.6-27B-UD-Q4_K_XL ngl 32 ncmoe 25 k q8 v q8 사용시 응답이 없음
1 2 # ngl 32 ncmoe 25 k q8 v q8 : 응답이 없음. #model = /home/qkboo/Models/unsloth/Qwen3.6-27B-MTP/Qwen3.6-27B-UD-Q4_K_XL.gguf
단일 RTX 3060에서 Qwen3.6-35B-A3B 실행. 12GB VRAM, 16GB RAM.
35B 파라미터. 150K 컨텍스트. 비전. ~45 tok/s.
모두가 안 맞을 거라고 하지만, 맞는다. 비밀은 아무도 말하지 않는 한 가지 플래그: -np 1
llama.cpp는 기본적으로 n_parallel을 4로 설정해서, 조용히 KV 캐시를 4배로 늘리고 OOM을 유발한다. 단일 슬롯으로 강제하면 150K 컨텍스트가 12GB 카드에 맞는다.
핵심 부분: –n-cpu-moe 26은 MoE 전문가를 시스템 RAM으로 밀어넣고, q8_0 KV 캐시는 메모리를 반으로 줄이며, –no-mmproj-offload는 비전 프로젝터를 CPU에서 실행해서 35B에 비전을 추가해도 ~0 추가 VRAM으로 끝난다.
클라우드 없음. API 없음. 그냥 3060이 할 줄 모르는 일을 하는 거다.
전체 llama-swap 설정:
1 2 3 4 5 6 7 8 9 10 11 $ llama-server -m Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf --mmproj mmproj-qwen3.6-35b-a3b-F16.gguf --no-mmproj-offload -ngl 99 --n-cpu-moe 26 -c 150000 -fa on -np 1 --cache-type-k q8_0 --cache-type-v q8_0 -b 2048 -ub 1024
1 $ llama-server --help | grep -E "slot|parallel|draft"
1 2 llama-server -hf unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0 \ --spec-type draft-mtp -ngl 999 -fa on -c 65536 --port 8080
vllm yep, plain vllm serve. the whole magic is one flag:
vllm serve QuantTrio/Qwen3.6-27B-AWQ -tp 2 –max-model-len 65536 –max-num-seqs 4 –speculative-config ‘{“method”:”dflash”,”model”:”“,”num_speculative_tokens”:15,”attention_backend”:”FLASH_ATTN”}’
vllm 0.23, works the same on 0.25 but there u have to strip layer_types from the draft config first or it wont load
Ultimated-OCR http://huggingface.co/baidu/Unlimited-OCR
bytkim/Qwen3.6-27B-MTP-pi-reasoning-GGUF
yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF https://huggingface.co/yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF
아쉽게도 llama-server 의 preset 으로 mtp 본체와 헤더를 탑재 못하고 있다….
Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF 로컬에서 질의 후 루프에 빠진다.
https://huggingface.co/Jackrong/Qwopus3.6-27B-Coder-Compat-MTP-GGUF
sci4ai/Qwen3.6-27B-Ablit-IQ2 https://huggingface.co/sci4ai/Qwen3.6-27B-Ablit-IQ2_XXS-GGUF