그래픽카드별 로컬 LLM 실행 가능표 실측 검증됨
VRAM 용량별로 어떤 모델이 몇 토큰 컨텍스트까지 올라가는지 정리한 표입니다. Q4_K_M 양자화 기준으로 가중치와 KV 캐시를 모두 계산했습니다.
| 모델 | 12GB RTX 3060 12GB | 16GB RTX 4060 Ti 16GB | 24GB RTX 4090 24GB | 32GB RTX 5090 32GB | 48GB RTX 4090 24GB ×2 | 64GB RTX 5090 32GB ×2 |
|---|---|---|---|---|---|---|
| Llama 3.2 3B 3.2B | 64k | 96k | 128k | 128k | 128k | 128k |
| Qwen2.5 7B 7.6B | 96k | 128k | 128k | 128k | 128k | 128k |
| Mistral 7B 7.2B | 48k | 64k | 128k | 128k | 128k | 128k |
| Llama 3.1 8B 8B | 40k | 64k | 128k | 128k | 128k | 128k |
| Gemma 2 9B 9.2B | 16k | 24k | 48k | 64k | 96k | 128k |
| Qwen2.5 14B 14.8B | 8k | 24k | 64k | 96k | 128k | 128k |
| Gemma 2 27B 27.2B | ✗ | ✗ | 12k | 32k | 64k | 96k |
| Qwen2.5 32B 32.8B | ✗ | ✗ | 8k | 32k | 96k | 128k |
| Qwen3 30B-A3B (MoE) 30.5B | ✗ | ✗ | 32k | 96k | 128k | 128k |
| Llama 3.1 70B 70.6B | ✗ | ✗ | ✗ | ✗ | 4k | 48k |
| Qwen2.5 72B 72.7B | ✗ | ✗ | ✗ | ✗ | ✗ | 48k |
숫자는 그 VRAM에서 올릴 수 있는 최대 컨텍스트 길이입니다. ✗는 4k 컨텍스트조차 전부 올릴 수 없다는 뜻입니다. Q4_K_M 양자화, KV 캐시 fp16, 여유 10% 기준. 조건을 바꿔 계산하려면 VRAM 계산기를 쓰세요.
실측으로 확인했습니다
RTX 3060 12GB 두 장(합계 24GB)에서 Qwen3 30B-A3B Q4_K_M 을 컨텍스트를 바꿔가며 올려봤습니다. 전부 GPU에 올라간 세 지점(16k·32k·40k)에서 이 표가 예측한 VRAM 과 실제 사용량의 차이는 1.3~1.7%였고, 모두 표 쪽이 조금 더 크게 잡는 방향이었습니다.
시험한 지점 중 전부 GPU에 올라간 것은 40,960 컨텍스트까지였고, 49,152부터 일부가 CPU로 내려갔습니다. 같은 구간에서 생성 속도가 95.8에서 58.0 tok/s 로 39% 떨어졌습니다. 그 사이는 재지 않아 정확한 경계는 모릅니다.
표는 이 경계에서 한 칸을 안전한 쪽으로 틀리게 분류합니다. 24GB·이 모델의 경우 표는 32k 라고 하지만 실제로는 40,960 까지 올라갔습니다. 넘치는 순간 속도를 크게 잃기 때문에, 안 되는 것을 된다고 하는 쪽이 훨씬 비싸다고 보고 여유를 그대로 뒀습니다. 자세한 측정 과정은 매칭표 실측 검증에 있습니다.
이 표를 읽는 법
모델이 VRAM에 올라가느냐는 가중치 크기만으로 결정되지 않습니다. KV 캐시가 컨텍스트 길이에 정비례해 커지기 때문에, 같은 카드에서도 컨텍스트를 늘리면 어느 순간 넘칩니다. 예를 들어 Llama 3.1 8B는 가중치가 약 4.5GiB지만 128k 컨텍스트에서는 KV 캐시만 16GiB가 됩니다.
✗ 표시라도 실행 자체가 불가능한 것은 아닙니다. llama.cpp와 Ollama는 넘치는 레이어를 시스템 RAM으로 내려서 실행합니다. 다만 속도가 크게 떨어지므로, 실용적인 속도를 원한다면 전부 VRAM에 올라가는 조합을 고르는 편이 낫습니다.
KV 캐시를 q8_0으로 양자화하면 KV 부분이 정확히 절반이 되어 한 단계 긴 컨텍스트를 쓸 수 있습니다. 품질 저하는 거의 체감되지 않으므로, 긴 컨텍스트가 필요하면 먼저 이 옵션을 켜보세요.