GearClue

로컬 LLM VRAM 계산기

모델·양자화·컨텍스트 길이를 넣으면 필요한 VRAM을 계산하고, 실제로 돌아가는 그래픽카드를 알려줍니다. 가중치와 KV 캐시를 따로 계산합니다.

자주 묻는 것

VRAM이 부족하면 어떻게 되나요?
llama.cpp/Ollama는 부족한 레이어를 시스템 RAM으로 내립니다. 실행은 되지만 속도가 급격히 떨어집니다. 절반만 GPU에 올라가도 체감 속도는 1/5 이하로 떨어지는 경우가 많습니다.
컨텍스트를 늘렸더니 갑자기 터집니다.
KV 캐시는 컨텍스트 길이에 정비례해서 커집니다. Llama 3.1 8B는 토큰당 128KiB라 32k 컨텍스트만으로 KV 캐시가 4GiB입니다. 가중치보다 KV가 더 커지는 구간이 옵니다.
KV 캐시 양자화는 써도 되나요?
q8_0 KV 양자화는 메모리를 정확히 절반으로 줄이고 품질 저하는 거의 체감되지 않습니다. 컨텍스트를 길게 쓸수록 이득이 큽니다. Ollama는 OLLAMA_KV_CACHE_TYPE=q8_0으로 켭니다.
양자화는 어디까지 내려도 되나요?
Q4_K_M이 크기 대비 품질의 실질적 기준점입니다. Q3 이하는 코드 생성이나 한국어에서 열화가 눈에 띕니다. VRAM이 모자라면 더 낮은 양자화보다 더 작은 모델을 쓰는 편이 대체로 낫습니다.

계산 방식

필요 VRAM은 가중치 + KV 캐시 + 실행 오버헤드입니다. 가중치는 파라미터수 × 양자화 비트 ÷ 8, KV 캐시는 2 × 레이어 × KV헤드 × head_dim × 컨텍스트 × 바이트로 구합니다. 레이어·KV헤드·head_dim은 각 모델의 config.json 실제 값을 씁니다. GPU 추천은 계산값에 10% 여유를 둔 기준입니다.