GearClue

로컬 LLM VRAM 계산기 메모리 추정

모델·양자화·컨텍스트와 동시 요청 수로 VRAM을 추정한다. 내 GPU의 가용 메모리와 비교하고 설정별 차이를 확인할 수 있다.

긴 문서나 코딩 작업에서 컨텍스트를 늘리면 KV 캐시도 커진다. 먼저 현재 설정을 비교하고, 실행 후 ollama ps의 PROCESSOR와 CONTEXT를 확인한다.

이 범위는 메모리 비교용이다. 선택한 모델이 지원하는 길이를 뜻하지 않는다.

12 GiB는 입력 예시다. GPU 모니터에 표시된 여유 메모리로 바꾼다. MiB 표시값은 1,024로 나눈다. 모델이 이미 올라가 있다면 그 모델의 사용량을 뺀 잔여값을 넣지 않는다.

공식 설정과 실제 확인

  1. 사용할 모델과 작업의 컨텍스트 길이를 확인한다. Ollama 컨텍스트 안내는 긴 컨텍스트에서 메모리 사용량이 증가한다고 설명한다.
  2. 실행 후 ollama ps로 GPU/CPU 배치와 할당 컨텍스트를 확인한다. 메모리 부족 시 컨텍스트나 동시 요청 수를 낮춰 다시 확인한다.
  3. 캐시 양자화를 바꾸기 전 Ollama KV 캐시·Flash Attention 조건을 확인한다. 적용 후 답변 품질도 직접 비교한다.

공식 문서 확인: 2026-10-02. 기본 컨텍스트는 버전·기기에 따라 달라질 수 있어 실제 실행값을 확인한다. 직접 기기나 백엔드를 점검하는 도구는 아니다.

계산 방식과 한계

가중치는 파라미터 수 × 양자화 비트 ÷ 8, KV 캐시는 2 × 레이어 × KV 헤드 × head_dim × 컨텍스트 × 바이트 × 동시 요청 수로 추정한다. 기존 모델별 설정값을 사용한다. 양자화 비트는 Q4_K_M의 4.85처럼 저장 부가정보를 포함한 실효 비트 가정이며, 실제 파일 크기와 다를 수 있다. 실행 오버헤드는 가중치의 5%와 0.4 GiB 중 큰 값으로 잡은 가정이며, 추가 10% 여유는 이 도구의 비교 기준이다.

Hugging Face 캐시 문서처럼 캐시 방식과 레이어 구조에 따라 메모리·속도는 달라진다. 이 표는 성능 벤치마크나 구매 추천이 아니다. 기존 Qwen3 실측은 해당 기기·설정에만 적용된다.

계산값보다 메모리를 더 쓰는 이유
가중치 파일, 실행 버퍼, 모델 구조와 백엔드에 따라 실제 사용량이 달라진다. 이 계산은 모든 KV 레이어가 전체 컨텍스트를 저장한다고 가정한다. 슬라이딩 윈도·캐시 구현에 따른 절감은 반영하지 않는다.
KV 캐시 q8_0을 켜기 전에
이 계산은 KV 캐시를 f16의 약 절반으로 잡는다. Ollama의 캐시 양자화는 Flash Attention을 사용할 때 지원되며, 품질 영향은 모델과 작업에 따라 다르다. 현재 백엔드 지원과 공식 설정을 확인한다.
동시 요청을 늘리면
한 모델의 동시 요청 수만큼 KV 캐시를 계산한다. 가중치는 한 번만 더한다. 여러 모델을 동시에 띄우는 경우는 이 계산에 포함되지 않는다.
여유가 있으면 실행이 보장되는가
메모리 예상치만 비교한 결과다. GPU·드라이버·백엔드 호환성과 모델의 최대 컨텍스트는 별도로 확인해야 한다. 여러 GPU의 합계 용량만으로 각 GPU에 모델이 배치되는지도 보장할 수 없다.