그래픽카드별 로컬 LLM 실행 가능표
VRAM 용량별로 어떤 모델이 몇 토큰 컨텍스트까지 올라가는지 정리한 표입니다. Q4_K_M 양자화 기준으로 가중치와 KV 캐시를 모두 계산했습니다.
| 모델 | 12GB RTX 3060 12GB | 16GB RTX 4060 Ti 16GB | 24GB RTX 4090 24GB | 32GB RTX 5090 32GB | 48GB RTX 4090 24GB ×2 | 64GB RTX 5090 32GB ×2 |
|---|---|---|---|---|---|---|
| Llama 3.2 3B 3.2B | 64k | 64k | 128k | 128k | 128k | 128k |
| Qwen2.5 7B 7.6B | 64k | 128k | 128k | 128k | 128k | 128k |
| Mistral 7B 7.2B | 32k | 64k | 128k | 128k | 128k | 128k |
| Llama 3.1 8B 8B | 32k | 64k | 128k | 128k | 128k | 128k |
| Gemma 2 9B 9.2B | 16k | 16k | 32k | 64k | 64k | 128k |
| Qwen2.5 14B 14.8B | 8k | 16k | 64k | 64k | 128k | 128k |
| Gemma 2 27B 27.2B | ✗ | ✗ | 8k | 32k | 64k | 64k |
| Qwen2.5 32B 32.8B | ✗ | ✗ | 8k | 32k | 64k | 128k |
| Llama 3.1 70B 70.6B | ✗ | ✗ | ✗ | ✗ | 4k | 32k |
| Qwen2.5 72B 72.7B | ✗ | ✗ | ✗ | ✗ | ✗ | 32k |
숫자는 그 VRAM에서 올릴 수 있는 최대 컨텍스트 길이입니다. ✗는 4k 컨텍스트조차 전부 올릴 수 없다는 뜻입니다. Q4_K_M 양자화, KV 캐시 fp16, 여유 10% 기준. 조건을 바꿔 계산하려면 VRAM 계산기를 쓰세요.
이 표를 읽는 법
모델이 VRAM에 올라가느냐는 가중치 크기만으로 결정되지 않습니다. KV 캐시가 컨텍스트 길이에 정비례해 커지기 때문에, 같은 카드에서도 컨텍스트를 늘리면 어느 순간 넘칩니다. 예를 들어 Llama 3.1 8B는 가중치가 약 4.5GiB지만 128k 컨텍스트에서는 KV 캐시만 16GiB가 됩니다.
✗ 표시라도 실행 자체가 불가능한 것은 아닙니다. llama.cpp와 Ollama는 넘치는 레이어를 시스템 RAM으로 내려서 실행합니다. 다만 속도가 크게 떨어지므로, 실용적인 속도를 원한다면 전부 VRAM에 올라가는 조합을 고르는 편이 낫습니다.
KV 캐시를 q8_0으로 양자화하면 KV 부분이 정확히 절반이 되어 한 단계 긴 컨텍스트를 쓸 수 있습니다. 품질 저하는 거의 체감되지 않으므로, 긴 컨텍스트가 필요하면 먼저 이 옵션을 켜보세요.