로컬 LLM 장비, 놀 때 100W 돌릴 때 283W — 모델을 올려두는 것만으로는 안 올랐다
이 포스팅은 쿠팡 파트너스 및 네이버 쇼핑 커넥트 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.
로컬에서 LLM을 돌리면 장비를 잘 안 끕니다.
언제 쓸지 모르니 켜둡니다.
그 켜둔 시간이 얼마인지 재봤습니다.
무엇을 어떻게 쟀나
먼저 못 잰 것부터 밝힙니다.
콘센트 전력이 아닙니다. CPU 패키지와 GPU만 쟀습니다. 메인보드, RAM 125GB, NVMe 3개, 팬, 파워 효율 손실은 안 들어갑니다. 실제 벽면 소비는 이 값보다 높습니다.
잰 방법은 이렇습니다.
- GPU:
nvidia-smi의power.draw - CPU: RAPL 누적 에너지(
energy_uj)를 2초 간격으로 차분 - 9분, 264개 샘플
구성은 RTX 3060 12GB 두 장, Ryzen 7 5800X, X570S 보드입니다.
아무것도 안 돌릴 때 100W
모델을 올리지 않은 상태입니다.
| 대상 | 중앙값 | p10~p90 |
|---|---|---|
| CPU 패키지 | 56.0W | 53.8~62.7 |
| GPU 0 | 24.0W | 23.9~24.3 |
| GPU 1 | 20.0W | 19.9~20.1 |
| GPU 합계 | 44.0W | 43.9~44.3 |
| CPU + GPU | 100.0W | 97.8~106.8 |
평소 250kWh 쓰는 집에서 이걸 24시간 켜두면 월 72.0kWh, 18,540원입니다.
1년이면 222,480원입니다.
사용률 0%인데 GPU가 44W다
9분 내내 GPU 사용률은 0%였습니다. 팬도 안 돌았습니다(0%). 전력 상태는 가장 낮은 P8, 클럭은 SM 210MHz, 메모리 405MHz였습니다.
그런데 44W입니다.
새는 전력이 아닙니다. 외장 그래픽카드는 켜져 있는 동안 PCIe 링크를 유지하고, VRAM 셀을 주기적으로 재충전하고, 전원부를 대기 상태로 돌립니다. 연산을 안 해도 드는 몫입니다.
Ampere 세대 카드 두 장이면 합계 40~45W가 정상 범위입니다. 이 값이 이상한 게 아니라, 이만큼이 기본으로 든다는 사실이 잘 안 알려져 있을 뿐입니다.
더 눈에 띄는 건 변동폭입니다.
GPU는 43.7~45.0W, 9분 동안 1.3W 안에서만 움직였습니다.
전력을 안 쓰는 게 아니라 일정하게 씁니다.
같은 시간 CPU는 52.3~87.9W로 35.6W를 오르내렸습니다. 배경 작업이 있을 때마다 반응합니다. GPU는 그러지 않았습니다.
19GB 모델을 올려도 GPU는 그대로였다
여기가 이 글에서 재보고 싶었던 것입니다.
qwen3.8:27b 를 올렸습니다.
VRAM 19GB, GPU에 89% 배치됐습니다.
추론은 1토큰만 시키고 그대로 뒀습니다.
로드 직후 60초는 값이 튑니다. GPU가 순간 93.6W까지 갔습니다. 이건 로딩 자체의 부하라 빼고, 안정된 뒤 89개 샘플만 봤습니다.
| 모델 없음 | 모델 로드 | |
|---|---|---|
| GPU 합계 | 44.0W | 44.0W |
| CPU 패키지 | 56.0W | 59.5W |
| 합계 | 100.0W | 103.5W |
GPU는 0.0W 차이입니다.
이건 뜻밖이라기보다 VRAM 동작 방식대로입니다.
GDDR6 셀은 데이터가 들었든 비었든 전원이 켜진 동안 같은 주기로 스스로 재충전합니다. 읽거나 쓰지 않고 자리만 잡아두면 추가로 드는 전력이 없습니다.
단, 조건이 붙습니다. GPU가 저전력 상태(P8)를 유지할 때 얘기입니다. 드라이버 설정이나 다중 모니터, CUDA 컨텍스트 유지 방식에 따라 P-State 가 P0·P2 로 올라가 고정되는 환경이 있고, 그러면 메모리 클럭이 올라가 전력이 붙습니다. 이 측정에서는 내내 P8이었습니다.
오른 건 CPU 3.5W뿐
올라간 3.5W는 CPU 쪽입니다.
차이가 진짜인지부터 확인했습니다. 두 구간에서 무작위로 값을 뽑아 비교하면 82%에서 모델 로드 쪽이 높았습니다. (차이가 없으면 50%가 나옵니다) 사분위 구간도 거의 안 겹칩니다.
차이는 실재합니다. 다만 원인 지목은 추정입니다.
모델이 GPU에 89%, CPU에 11% 걸쳐 있고
ollama 러너가 상주하니 그 몫으로 보이지만,
두 측정을 동시에 한 게 아니라
앞뒤로 나눠 했습니다.
그 사이 다른 배경 작업이 달라졌을 수 있습니다.
RAPL은 패키지 전체 값만 주므로
프로세스별로 떼어 재지 못했습니다.
요금으로는 월 660원입니다. 19GB 모델을 한 달 내내 올려둔 값입니다.
내려두는 것이 절약이 되긴 하지만 그 폭은 660원입니다.
그래서 뭘 끄면 듣나
이 구성에서 큰 덩어리는 둘입니다.
- GPU 한 장을 빼면 월 4,440원
- CPU 쪽 배경 작업을 줄이면 그만큼
모델을 올렸다 내렸다 하는 건 월 660원짜리 조정입니다.
한 장의 12GB로 충분한 작업이라면 카드를 빼는 쪽이 여섯 배 넘게 큽니다. 24GB가 필요한 모델을 돌린다면 해당되지 않습니다.
덧붙이면, 이 측정 중에 프로세스 하나가 코어 하나를 100%로 8일째 물고 있었습니다. MCP 서버가 멈춘 채 돌고 있던 겁니다. CPU 56W에는 그 몫이 들어 있습니다.
그럼 실제로 돌리면 얼마인가
여기까지는 놀고 있을 때입니다. 작업을 돌리면 다른 이야기가 됩니다.
infoextract 작업을 걸어두고
6시간, 10,528개를 샘플링했습니다.
| 시간평균 | 중앙값 | 최고 | |
|---|---|---|---|
| GPU 합계 | 208.8W | 185.1W | 332.2W |
| CPU 패키지 | 74.2W | 77.6W | 114.4W |
| 합계 | 283.0W |
최고 332.2W는 두 장 전력 상한(340W)의 **98%**입니다. 거의 끝까지 갑니다.
시간을 쪼개보면 이렇습니다.
- 부하 구간(GPU 80W 이상) 72.0%, 중앙 316.6W
- 유휴 구간 28.0%, 중앙 44.1W
가른 기준 80W 는 GPU 두 장 합계입니다. 유휴가 44W 이니 그 두 배 언저리를 경계로 잡은 것이고, 임의로 정한 값입니다.
처음 40분만 봤을 때는 부하 구간이 13%였습니다. 그때 값으로 판단했으면 틀렸을 겁니다. 워밍업 구간이었어요.
유휴와 나란히 놓으면
| 상태 | 전력 | 월 요금 (24시간) |
|---|---|---|
| 유휴 (모델 없음) | 100.0W | 18,540원 |
| 유휴 (21GB 상주) | 103.5W | 19,200원 |
| 실작업 | 283.0W | 64,540원 |
전력은 2.8배인데 요금은 3.5배입니다. 누진 구간을 올라가서 그렇습니다.
현실적인 사용 시간으로 보면 이렇게 됩니다.
- 하루 2시간 → 월 4,380원
- 하루 4시간 → 월 8,750원
- 하루 8시간 → 월 17,500원
이번 6시간 작업 한 번이 1.70kWh, 440원이었습니다.
그래서 뭐가 전기를 쓰는가
세 상태의 총 전력으로 놓고 봅니다. (증분과 절대값을 섞으면 안 되니 전부 CPU+GPU 합계로 통일합니다)
- 그냥 켜둠: 100.0W
- 모델 21GB 올려둠: 103.5W (+3.5)
- 계산 중: 283.0W (+183.0)
모델을 올려두는 값은 3.5W, 계산하는 값은 183W 입니다. 52배 차이입니다.
모델을 내렸다 올렸다 하는 건 월 660원짜리 조정입니다.
정작 드는 건 연산하는 시간입니다.
그렇다고 “빨리 끝내면 무조건 이득”은 아닙니다. 쓰는 에너지는 전력 × 시간이라, 속도를 올리려고 전력이 더 크게 뛰면 총량은 늘 수도 있습니다. 전력이 완만하게 오르는 구간에서만 빨리 끝내는 쪽이 이득입니다. 이 경계가 어디인지는 재보지 않았습니다.
상시 가전 전부와 맞먹습니다
전에 계산한 값과 나란히 놓아 봅니다.
- 이 장비 유휴(CPU+GPU만) 100.0W → 월 18,540원
- 냉장고+김치냉장고+셋톱박스+공유기 103W → 월 19,110원
켜두기만 한 개발 장비 한 대가 집 안 상시 가전을 전부 합친 것과 거의 같습니다.
그런데 앞서 밝혔듯 100W는 콘센트 전력이 아닙니다. 보드와 메모리, SSD 세 개, 팬, 파워 효율 손실이 빠진 값입니다.
실제로는 더 벌어집니다.
정리
- 유휴 상태 CPU 56.0W + GPU 44.0W = 100.0W (중앙값, 264 샘플)
- GPU는 사용률 0%인데 44W입니다. 새는 게 아니라 카드 두 장의 정상 기저 전력입니다
- 19GB 모델을 VRAM에 올려도 GPU 전력은 0.0W 차이였습니다 (P8 유지 조건)
- 오른 건 CPU 3.5W, 월 660원입니다. 차이는 실재하나 원인 지목은 추정입니다
- GPU 한 장을 빼는 쪽이 월 4,440원으로 여섯 배 넘게 큽니다
- 이 유휴 전력이 상시 가전 전부와 맞먹습니다
- 실제 작업 6시간 평균은 283.0W, 최고는 상한의 98%까지 갔습니다
- 유휴 대비 전력 2.8배, 요금 3.5배입니다 (누진 때문)
- 드는 것은 모델을 올려둔 값(+3.5W)이 아니라 계산하는 값(+183.0W)입니다
계산 기준과 한계
- 콘센트 전력이 아닙니다. CPU 패키지(RAPL)와 GPU(nvidia-smi)만 잰 값입니다. 메인보드·RAM 125GB·NVMe 3개·팬·파워 효율 손실이 빠져 있어 실제 벽면 소비는 더 높습니다. 콘센트형 측정기가 없어 전체를 재지 못했습니다
- 깨끗한 유휴가 아닙니다. 측정 중 MCP 서버 프로세스 하나가 코어 하나를 100%로 점유하고 있었습니다. 그대로 두고 쟀으므로 CPU 56.0W에는 그 몫이 포함됩니다. 더 중요한 건 이 점유 때문에 CPU가 깊은 절전 상태(C6·C7)로 들어가지 못했다는 것입니다. 조용한 5800X 의 유휴는 훨씬 낮게 잡히는 것이 보통이라, 이 56.0W는 부풀려진 값으로 봐야 합니다
- RAPL 패키지 값에는 코어 외에 IO 다이(메모리 컨트롤러·인피니티 패브릭)도 들어갑니다. 코어만의 전력이 아닙니다
- CPU 11% 오프로드로 늘어난 시스템 RAM 쪽 전력은 RAPL 에 안 잡힙니다. 그만큼 누락됩니다
- GPU 전력이 모델 로드로 안 오른 것은 P8 저전력 상태가 유지되는 조건에서의 결과입니다. 드라이버 설정·다중 모니터·CUDA 컨텍스트 유지 방식에 따라 P-State 가 올라가 고정되는 환경이면 달라집니다
- CPU 3.5W 상승이
ollama러너 때문이라는 건 추정입니다. RAPL은 패키지 전체만 주므로 프로세스별로 떼어 재지 않았습니다 - RTX 3060 두 장 구성은 일반적이지 않습니다. 한 장이면 GPU 몫이 절반 가까이 내려갑니다
- 모델 하나(
qwen3.8:27b, 19GB)만 시험했습니다. 크기나 배치 비율이 다르면 결과가 다를 수 있습니다 - 작업 구간의 CPU 값은 깨끗하지 않습니다. 6시간을 재는 동안 같은 기계에서 제가 다른 작업(영상 자막 내려받기, 브라우저 자동화)을 함께 돌렸습니다. 부하가 올라간 시점과 제 작업을 시작한 시점이 겹쳐서 둘을 떼어낼 수 없습니다. GPU 는 제가 건드리지 않아 영향이 없지만, CPU 74.2W 에는 제 몫이 얼마간 섞여 있습니다
- 작업은
ollama추론입니다. 학습(파인튜닝)은 부하 패턴이 달라 이 값이 그대로 적용되지 않습니다 - 6시간 한 번의 기록입니다. 작업 종류와 길이가 다르면 듀티 사이클이 달라집니다
- LLM 추론은 프롬프트를 한꺼번에 처리하는 단계와 토큰을 하나씩 만드는 단계의 부하가 크게 다릅니다. 6시간 평균 283.0W 에 두 단계가 어떤 비율로 섞였는지는 나누지 않았습니다
- 파워서플라이 변환 효율이 부하율에 따라 달라집니다. 유휴(로드율 낮음)와 실작업(로드율 높음)의 효율이 다르므로, 콘센트에서 잰 값의 격차는 이 부품 단위 격차와 다르게 나옵니다
- 장시간 부하로 온도가 오르면 팬 전력과 반도체 누설 전류가 늘어납니다. 둘 다 이 측정에 안 잡혔습니다
- 부하/유휴를 가른 80W 는 제가 정한 임의 기준입니다. 다르게 자르면 비율도 달라집니다
- 요금은 평소 250kWh, 주택용 저압, 기타계절(9~11월), 30일 환산 기준입니다. 평소 사용량이 다르면 같은 kWh라도 붙는 금액이 달라집니다
- 2026년 3분기 요금표 기준이고, 연료비조정단가는 분기마다 바뀔 수 있습니다
측정 스크립트와 원자료는 저장소에 있습니다.
core/idlepower.py, data/measure/ 입니다.
이 측정에 쓴 장비
- RTX 3060 12GB — 쿠팡에서 보기 · 네이버 380,000원
이 측정에 쓴 그래픽카드 계열입니다. 두 장으로 24GB를 구성합니다.
- AMD Ryzen 7 5800X — 쿠팡에서 보기
측정 구성의 CPU입니다. RAPL 값은 이 패키지 기준입니다.
쓰지는 않았지만 관련 있는 것
아래는 제가 쓰지 않은 제품입니다. 직접 검증하지 않았습니다.
- 콘센트형 소비전력 측정기 — 쿠팡에서 보기 · 네이버 66,700원
본체 전체를 재려면 필요합니다. 저는 없어서 CPU·GPU 만 쟀습니다.