GearClue

로컬 LLM 장비, 놀 때 100W 돌릴 때 283W — 모델을 올려두는 것만으로는 안 올랐다

2026-09-07 · 실측

이 포스팅은 쿠팡 파트너스 및 네이버 쇼핑 커넥트 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

로컬에서 LLM을 돌리면 장비를 잘 안 끕니다.

언제 쓸지 모르니 켜둡니다.

그 켜둔 시간이 얼마인지 재봤습니다.

무엇을 어떻게 쟀나

먼저 못 잰 것부터 밝힙니다.

콘센트 전력이 아닙니다. CPU 패키지와 GPU만 쟀습니다. 메인보드, RAM 125GB, NVMe 3개, 팬, 파워 효율 손실은 안 들어갑니다. 실제 벽면 소비는 이 값보다 높습니다.

잰 방법은 이렇습니다.

구성은 RTX 3060 12GB 두 장, Ryzen 7 5800X, X570S 보드입니다.

아무것도 안 돌릴 때 100W

모델을 올리지 않은 상태입니다.

대상 중앙값 p10~p90
CPU 패키지 56.0W 53.8~62.7
GPU 0 24.0W 23.9~24.3
GPU 1 20.0W 19.9~20.1
GPU 합계 44.0W 43.9~44.3
CPU + GPU 100.0W 97.8~106.8

평소 250kWh 쓰는 집에서 이걸 24시간 켜두면 월 72.0kWh, 18,540원입니다.

1년이면 222,480원입니다.

사용률 0%인데 GPU가 44W다

9분 내내 GPU 사용률은 0%였습니다. 팬도 안 돌았습니다(0%). 전력 상태는 가장 낮은 P8, 클럭은 SM 210MHz, 메모리 405MHz였습니다.

그런데 44W입니다.

새는 전력이 아닙니다. 외장 그래픽카드는 켜져 있는 동안 PCIe 링크를 유지하고, VRAM 셀을 주기적으로 재충전하고, 전원부를 대기 상태로 돌립니다. 연산을 안 해도 드는 몫입니다.

Ampere 세대 카드 두 장이면 합계 40~45W가 정상 범위입니다. 이 값이 이상한 게 아니라, 이만큼이 기본으로 든다는 사실이 잘 안 알려져 있을 뿐입니다.

더 눈에 띄는 건 변동폭입니다.

GPU는 43.7~45.0W, 9분 동안 1.3W 안에서만 움직였습니다.

전력을 안 쓰는 게 아니라 일정하게 씁니다.

같은 시간 CPU는 52.3~87.9W로 35.6W를 오르내렸습니다. 배경 작업이 있을 때마다 반응합니다. GPU는 그러지 않았습니다.

19GB 모델을 올려도 GPU는 그대로였다

여기가 이 글에서 재보고 싶었던 것입니다.

qwen3.8:27b 를 올렸습니다. VRAM 19GB, GPU에 89% 배치됐습니다. 추론은 1토큰만 시키고 그대로 뒀습니다.

로드 직후 60초는 값이 튑니다. GPU가 순간 93.6W까지 갔습니다. 이건 로딩 자체의 부하라 빼고, 안정된 뒤 89개 샘플만 봤습니다.

모델 없음 모델 로드
GPU 합계 44.0W 44.0W
CPU 패키지 56.0W 59.5W
합계 100.0W 103.5W

GPU는 0.0W 차이입니다.

이건 뜻밖이라기보다 VRAM 동작 방식대로입니다.

GDDR6 셀은 데이터가 들었든 비었든 전원이 켜진 동안 같은 주기로 스스로 재충전합니다. 읽거나 쓰지 않고 자리만 잡아두면 추가로 드는 전력이 없습니다.

단, 조건이 붙습니다. GPU가 저전력 상태(P8)를 유지할 때 얘기입니다. 드라이버 설정이나 다중 모니터, CUDA 컨텍스트 유지 방식에 따라 P-State 가 P0·P2 로 올라가 고정되는 환경이 있고, 그러면 메모리 클럭이 올라가 전력이 붙습니다. 이 측정에서는 내내 P8이었습니다.

오른 건 CPU 3.5W뿐

올라간 3.5W는 CPU 쪽입니다.

차이가 진짜인지부터 확인했습니다. 두 구간에서 무작위로 값을 뽑아 비교하면 82%에서 모델 로드 쪽이 높았습니다. (차이가 없으면 50%가 나옵니다) 사분위 구간도 거의 안 겹칩니다.

차이는 실재합니다. 다만 원인 지목은 추정입니다.

모델이 GPU에 89%, CPU에 11% 걸쳐 있고 ollama 러너가 상주하니 그 몫으로 보이지만, 두 측정을 동시에 한 게 아니라 앞뒤로 나눠 했습니다. 그 사이 다른 배경 작업이 달라졌을 수 있습니다. RAPL은 패키지 전체 값만 주므로 프로세스별로 떼어 재지 못했습니다.

요금으로는 월 660원입니다. 19GB 모델을 한 달 내내 올려둔 값입니다.

내려두는 것이 절약이 되긴 하지만 그 폭은 660원입니다.

그래서 뭘 끄면 듣나

이 구성에서 큰 덩어리는 둘입니다.

모델을 올렸다 내렸다 하는 건 월 660원짜리 조정입니다.

한 장의 12GB로 충분한 작업이라면 카드를 빼는 쪽이 여섯 배 넘게 큽니다. 24GB가 필요한 모델을 돌린다면 해당되지 않습니다.

덧붙이면, 이 측정 중에 프로세스 하나가 코어 하나를 100%로 8일째 물고 있었습니다. MCP 서버가 멈춘 채 돌고 있던 겁니다. CPU 56W에는 그 몫이 들어 있습니다.

그럼 실제로 돌리면 얼마인가

여기까지는 놀고 있을 때입니다. 작업을 돌리면 다른 이야기가 됩니다.

infoextract 작업을 걸어두고 6시간, 10,528개를 샘플링했습니다.

시간평균 중앙값 최고
GPU 합계 208.8W 185.1W 332.2W
CPU 패키지 74.2W 77.6W 114.4W
합계 283.0W

최고 332.2W는 두 장 전력 상한(340W)의 **98%**입니다. 거의 끝까지 갑니다.

시간을 쪼개보면 이렇습니다.

가른 기준 80W 는 GPU 두 장 합계입니다. 유휴가 44W 이니 그 두 배 언저리를 경계로 잡은 것이고, 임의로 정한 값입니다.

처음 40분만 봤을 때는 부하 구간이 13%였습니다. 그때 값으로 판단했으면 틀렸을 겁니다. 워밍업 구간이었어요.

유휴와 나란히 놓으면

상태 전력 월 요금 (24시간)
유휴 (모델 없음) 100.0W 18,540원
유휴 (21GB 상주) 103.5W 19,200원
실작업 283.0W 64,540원

전력은 2.8배인데 요금은 3.5배입니다. 누진 구간을 올라가서 그렇습니다.

현실적인 사용 시간으로 보면 이렇게 됩니다.

이번 6시간 작업 한 번이 1.70kWh, 440원이었습니다.

그래서 뭐가 전기를 쓰는가

세 상태의 총 전력으로 놓고 봅니다. (증분과 절대값을 섞으면 안 되니 전부 CPU+GPU 합계로 통일합니다)

모델을 올려두는 값은 3.5W, 계산하는 값은 183W 입니다. 52배 차이입니다.

모델을 내렸다 올렸다 하는 건 월 660원짜리 조정입니다.

정작 드는 건 연산하는 시간입니다.

그렇다고 “빨리 끝내면 무조건 이득”은 아닙니다. 쓰는 에너지는 전력 × 시간이라, 속도를 올리려고 전력이 더 크게 뛰면 총량은 늘 수도 있습니다. 전력이 완만하게 오르는 구간에서만 빨리 끝내는 쪽이 이득입니다. 이 경계가 어디인지는 재보지 않았습니다.

상시 가전 전부와 맞먹습니다

전에 계산한 값과 나란히 놓아 봅니다.

켜두기만 한 개발 장비 한 대가 집 안 상시 가전을 전부 합친 것과 거의 같습니다.

그런데 앞서 밝혔듯 100W는 콘센트 전력이 아닙니다. 보드와 메모리, SSD 세 개, 팬, 파워 효율 손실이 빠진 값입니다.

실제로는 더 벌어집니다.

정리

계산 기준과 한계

측정 스크립트와 원자료는 저장소에 있습니다. core/idlepower.py, data/measure/ 입니다.

이 측정에 쓴 장비

쓰지는 않았지만 관련 있는 것

아래는 제가 쓰지 않은 제품입니다. 직접 검증하지 않았습니다.

#로컬LLM#RTX3060#유휴전력#전기요금#누진세#소비전력