GearClue

32GB 그래픽카드 799만원과 272만원 — 같은 모델로 재보니 생성은 1.52배, 프롬프트는 3.44배

2026-09-10 · 조사

이 포스팅은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.

RTX 3060 12GB 두 장으로 24GB 를 쓰고 있습니다.

MSI 지포스 RTX 3060 벤투스 2X OC D6 12GB 그래픽카드 (MSI코리아)RTX 3060 12GB (제가 쓰는 것은 ZOTAC 판입니다)

32GB 한 장으로 옮기고 싶어서 값을 봤습니다.

이 글에 제가 잰 값은 없습니다. 전부 다나와 가격과 공개된 벤치마크를 모은 것입니다. 그 점을 먼저 밝힙니다.

32GB 를 파는 곳이 셋뿐입니다

2026년 9월 7일 다나와 최저가입니다.

카드 VRAM 최저가
MSI RTX 5090 슈프림 SOC 32GB 7,999,000원
GIGABYTE 라데온 AI PRO R9700 32GB 2,724,350원
인텔 Arc Pro B70 32GB 2,716,840원
XFX RX 9070 XT 16GB 1,434,550원

5090 은 슈프림 SOC 라 최상위 모델입니다. 현금가는 710만원으로 적혀 있었습니다.

대역폭이 속도의 상한을 정합니다

LLM 추론은 토큰 하나마다 모델 전체를 메모리에서 읽습니다. 연산력이 아니라 대역폭이 속도를 정합니다.

카드 메모리 대역폭
RTX 5090 GDDR7 512bit 1,792 GB/s
R9700 GDDR6 256bit 640 GB/s
RX 9070 XT GDDR6 256bit 640 GB/s
Arc Pro B70 GDDR6 256bit 608 GB/s

R9700 과 RX 9070 XT 의 대역폭이 같습니다. R9700 은 9070 XT 에 메모리만 두 배로 얹은 카드입니다.

라데온 AI PRO R9700 32GB 쿠팡에서 보기

5090 은 2.8배입니다.

같은 모델로 직접 붙인 값이 있습니다

llama.cpp 저장소 토론에 5090 과 R9700 을 같은 모델·같은 양자화로 잰 llama-bench 결과가 올라와 있습니다. Qwen3.5-35B-A3B MoE 를 Q4_K_XL 로 돌렸습니다.

항목 RTX 5090 (CUDA) R9700 (Vulkan) 배수
토큰 생성 194.0 t/s 127.4 t/s 1.52
프롬프트 512 7,026 t/s 2,713 t/s 2.59
프롬프트 4,096 6,958 t/s 2,546 t/s 2.73
프롬프트 16,384 6,773 t/s 2,196 t/s 3.08
프롬프트 32,768 6,461 t/s 1,877 t/s 3.44

대역폭은 2.8배인데 토큰 생성은 1.52배만 벌어졌습니다.

반대로 프롬프트를 처리하는 쪽은 2.59배에서 시작해 컨텍스트가 길어질수록 3.44배까지 벌어집니다.

이게 체감을 가릅니다. 짧게 주고받으면 격차가 작습니다. 긴 문서를 통째로 넣고 물어보면 기다리는 시간이 세 배 넘게 차이 납니다.

R9700 쪽은 ROCm 이 아니라 Vulkan 으로 낸 값입니다.

ollama 가 그냥 되는 건 5090 뿐입니다

값이 갈리는 진짜 이유는 하드웨어가 아니라 소프트웨어입니다.

엔비디아는 ollama 를 깔면 끝납니다. llama.cpp, vLLM 도 카드를 바로 잡습니다.

R9700 은 ROCm 7.2(2026년 3월)부터 RDNA4(gfx1201)를 공식 지원합니다. 그런데 ollama 가 들고 다니는 ROCm 은 6.x 입니다. gfx1201 커널이 없어 HIP 초기화가 실패합니다. ollama 저장소에 R9700 이슈가 올라와 있고, 통하는 우회는 Vulkan 백엔드입니다.

Arc Pro B70 은 더 나쁩니다. 표준 ollama 바이너리는 인텔 Arc 를 지원하지 않습니다. GPU 모니터에 무엇이 뜨든 실제로는 CPU 로 돕니다.

llama.cpp 를 SYCL 백엔드로 직접 빌드해야 제 속도가 납니다. 같은 카드에서 SYCL 이 Vulkan 보다 2.2배 빨랐다는 측정이 있습니다 (Qwen 1.5B Q4_K_M 기준 229 대 102 t/s).

인텔이 밀던 IPEX-LLM 은 2026년 1월에 저장소가 보관 처리됐습니다. 그걸 앞세운 안내 글은 이미 낡은 것입니다.

16GB 는 27B 에서 벽에 부딪힙니다

RX 9070 XT 가 절반 값인 이유는 단순합니다.

27B 급을 Q4 로 줄여도 15GB 언저리입니다. 16GB 에 컨텍스트까지 얹으면 넘칩니다. 넘치는 순간 시스템 RAM 으로 밀려나고 속도가 한 자릿수로 떨어집니다.

14B 이하로 쓸 거면 값이 좋습니다. 큰 모델을 돌리려고 32GB 를 보는 것이라면 선택지가 아닙니다.

조사 기준과 한계

정리

이 측정에 쓴 장비

쓰지는 않았지만 관련 있는 것

아래는 제가 쓰지 않은 제품입니다. 직접 검증하지 않았습니다.

  • 라데온 AI PRO R9700 32GB — 쿠팡에서 보기

    이 글에서 5090 의 대안으로 조사한 카드입니다. 제가 쓰는 물건은 아닙니다.

#로컬LLM#RTX3060#그래픽카드#VRAM#소비전력