GearClue

그래픽카드별 로컬 LLM 실행 가능표

VRAM 용량별로 어떤 모델이 몇 토큰 컨텍스트까지 올라가는지 정리한 표입니다. Q4_K_M 양자화 기준으로 가중치와 KV 캐시를 모두 계산했습니다.

모델12GB
RTX 3060 12GB
16GB
RTX 4060 Ti 16GB
24GB
RTX 4090 24GB
32GB
RTX 5090 32GB
48GB
RTX 4090 24GB ×2
64GB
RTX 5090 32GB ×2
Llama 3.2 3B
3.2B
64k64k128k128k128k128k
Qwen2.5 7B
7.6B
64k128k128k128k128k128k
Mistral 7B
7.2B
32k64k128k128k128k128k
Llama 3.1 8B
8B
32k64k128k128k128k128k
Gemma 2 9B
9.2B
16k16k32k64k64k128k
Qwen2.5 14B
14.8B
8k16k64k64k128k128k
Gemma 2 27B
27.2B
8k32k64k64k
Qwen2.5 32B
32.8B
8k32k64k128k
Llama 3.1 70B
70.6B
4k32k
Qwen2.5 72B
72.7B
32k

숫자는 그 VRAM에서 올릴 수 있는 최대 컨텍스트 길이입니다. ✗는 4k 컨텍스트조차 전부 올릴 수 없다는 뜻입니다. Q4_K_M 양자화, KV 캐시 fp16, 여유 10% 기준. 조건을 바꿔 계산하려면 VRAM 계산기를 쓰세요.

이 표를 읽는 법

모델이 VRAM에 올라가느냐는 가중치 크기만으로 결정되지 않습니다. KV 캐시가 컨텍스트 길이에 정비례해 커지기 때문에, 같은 카드에서도 컨텍스트를 늘리면 어느 순간 넘칩니다. 예를 들어 Llama 3.1 8B는 가중치가 약 4.5GiB지만 128k 컨텍스트에서는 KV 캐시만 16GiB가 됩니다.

✗ 표시라도 실행 자체가 불가능한 것은 아닙니다. llama.cpp와 Ollama는 넘치는 레이어를 시스템 RAM으로 내려서 실행합니다. 다만 속도가 크게 떨어지므로, 실용적인 속도를 원한다면 전부 VRAM에 올라가는 조합을 고르는 편이 낫습니다.

KV 캐시를 q8_0으로 양자화하면 KV 부분이 정확히 절반이 되어 한 단계 긴 컨텍스트를 쓸 수 있습니다. 품질 저하는 거의 체감되지 않으므로, 긴 컨텍스트가 필요하면 먼저 이 옵션을 켜보세요.