32GB 그래픽카드 799만원과 272만원 — 같은 모델로 재보니 생성은 1.52배, 프롬프트는 3.44배
이 포스팅은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.
RTX 3060 12GB 두 장으로 24GB 를 쓰고 있습니다.
32GB 한 장으로 옮기고 싶어서 값을 봤습니다.
이 글에 제가 잰 값은 없습니다. 전부 다나와 가격과 공개된 벤치마크를 모은 것입니다. 그 점을 먼저 밝힙니다.
32GB 를 파는 곳이 셋뿐입니다
2026년 9월 7일 다나와 최저가입니다.
| 카드 | VRAM | 최저가 |
|---|---|---|
| MSI RTX 5090 슈프림 SOC | 32GB | 7,999,000원 |
| GIGABYTE 라데온 AI PRO R9700 | 32GB | 2,724,350원 |
| 인텔 Arc Pro B70 | 32GB | 2,716,840원 |
| XFX RX 9070 XT | 16GB | 1,434,550원 |
5090 은 슈프림 SOC 라 최상위 모델입니다. 현금가는 710만원으로 적혀 있었습니다.
대역폭이 속도의 상한을 정합니다
LLM 추론은 토큰 하나마다 모델 전체를 메모리에서 읽습니다. 연산력이 아니라 대역폭이 속도를 정합니다.
| 카드 | 메모리 | 대역폭 |
|---|---|---|
| RTX 5090 | GDDR7 512bit | 1,792 GB/s |
| R9700 | GDDR6 256bit | 640 GB/s |
| RX 9070 XT | GDDR6 256bit | 640 GB/s |
| Arc Pro B70 | GDDR6 256bit | 608 GB/s |
R9700 과 RX 9070 XT 의 대역폭이 같습니다. R9700 은 9070 XT 에 메모리만 두 배로 얹은 카드입니다.
5090 은 2.8배입니다.
같은 모델로 직접 붙인 값이 있습니다
llama.cpp 저장소 토론에 5090 과 R9700 을
같은 모델·같은 양자화로 잰 llama-bench 결과가 올라와 있습니다.
Qwen3.5-35B-A3B MoE 를 Q4_K_XL 로 돌렸습니다.
| 항목 | RTX 5090 (CUDA) | R9700 (Vulkan) | 배수 |
|---|---|---|---|
| 토큰 생성 | 194.0 t/s | 127.4 t/s | 1.52 |
| 프롬프트 512 | 7,026 t/s | 2,713 t/s | 2.59 |
| 프롬프트 4,096 | 6,958 t/s | 2,546 t/s | 2.73 |
| 프롬프트 16,384 | 6,773 t/s | 2,196 t/s | 3.08 |
| 프롬프트 32,768 | 6,461 t/s | 1,877 t/s | 3.44 |
대역폭은 2.8배인데 토큰 생성은 1.52배만 벌어졌습니다.
반대로 프롬프트를 처리하는 쪽은 2.59배에서 시작해 컨텍스트가 길어질수록 3.44배까지 벌어집니다.
이게 체감을 가릅니다. 짧게 주고받으면 격차가 작습니다. 긴 문서를 통째로 넣고 물어보면 기다리는 시간이 세 배 넘게 차이 납니다.
R9700 쪽은 ROCm 이 아니라 Vulkan 으로 낸 값입니다.
ollama 가 그냥 되는 건 5090 뿐입니다
값이 갈리는 진짜 이유는 하드웨어가 아니라 소프트웨어입니다.
엔비디아는 ollama 를 깔면 끝납니다.
llama.cpp, vLLM 도 카드를 바로 잡습니다.
R9700 은 ROCm 7.2(2026년 3월)부터 RDNA4(gfx1201)를 공식 지원합니다.
그런데 ollama 가 들고 다니는 ROCm 은 6.x 입니다.
gfx1201 커널이 없어 HIP 초기화가 실패합니다.
ollama 저장소에 R9700 이슈가 올라와 있고, 통하는 우회는 Vulkan 백엔드입니다.
Arc Pro B70 은 더 나쁩니다.
표준 ollama 바이너리는 인텔 Arc 를 지원하지 않습니다.
GPU 모니터에 무엇이 뜨든 실제로는 CPU 로 돕니다.
llama.cpp 를 SYCL 백엔드로 직접 빌드해야 제 속도가 납니다.
같은 카드에서 SYCL 이 Vulkan 보다 2.2배 빨랐다는 측정이 있습니다
(Qwen 1.5B Q4_K_M 기준 229 대 102 t/s).
인텔이 밀던 IPEX-LLM 은 2026년 1월에 저장소가 보관 처리됐습니다. 그걸 앞세운 안내 글은 이미 낡은 것입니다.
16GB 는 27B 에서 벽에 부딪힙니다
RX 9070 XT 가 절반 값인 이유는 단순합니다.
27B 급을 Q4 로 줄여도 15GB 언저리입니다.
16GB 에 컨텍스트까지 얹으면 넘칩니다.
넘치는 순간 시스템 RAM 으로 밀려나고 속도가 한 자릿수로 떨어집니다.
14B 이하로 쓸 거면 값이 좋습니다. 큰 모델을 돌리려고 32GB 를 보는 것이라면 선택지가 아닙니다.
조사 기준과 한계
- 제가 잰 값이 하나도 없습니다. 네 카드 중 어느 것도 써본 적이 없습니다. 가격은 다나와, 사양은 제조사 공개값, 속도는 공개 벤치마크를 옮긴 것입니다
- 5090 대 R9700 비교는 한 사람이 올린 한 번의 측정입니다. 같은 모델·같은 양자화로 쟀다는 점에서 값이 있지만 표본이 하나입니다
- R9700 쪽은 Vulkan 값입니다. ROCm 7.2 로 다시 재면 달라질 수 있습니다
- B70 숫자는 다른 모델에서 나온 것이라 위 표에 나란히 놓지 않았습니다. SYCL 대 Vulkan 2.2배는
Qwen 1.5B기준이고, 35B 급에서 같은 배수가 나온다는 보장이 없습니다 llama.cpp는 몇 주마다 백엔드 성능이 달라집니다. 몇 달 전 벤치마크는 그대로 믿을 수 없습니다- MoE 모델(
35B-A3B)은 전체 파라미터 중 일부만 활성화됩니다. 같은 크기의 조밀 모델과 속도가 다릅니다 - B70 은 개인 후기가 거의 없습니다. B2B 워크스테이션용이라 자료가 기업 리뷰에 몰려 있습니다
- 다나와 최저가는 2026년 9월 7일 값입니다. 메모리 시황에 따라 자주 바뀝니다
- 전력 소비와 전기요금은 이 글에서 다루지 않았습니다. 카드값 차이가 528만원이라 전기로 메우려면 20년이 넘어 선택을 가르지 못합니다
- 중고 3090 24GB 같은 선택지는 넣지 않았습니다
정리
- 긴 문서를 자주 넣는 작업이면 5090 입니다. 프롬프트 처리 격차가 거기서 벌어집니다
- 짧게 주고받는 대화 위주면 R9700 의 127 t/s 로도 충분하고 값이 3분의 1 입니다
- B70 은 가장 싸지만 표준
ollama로는 GPU 를 못 씁니다. 빌드할 각오가 서야 합니다 - 저는 아직 안 샀습니다. 24GB 로 27B 모델이 돌아가고 있고, ROCm 7.2 로 다시 잰 값이 쌓이는 것을 보고 정하려고 합니다
이 측정에 쓴 장비
- RTX 3060 12GB — 쿠팡에서 보기 · 네이버 380,000원
지금 두 장으로 24GB 를 구성해 쓰는 카드입니다.
쓰지는 않았지만 관련 있는 것
아래는 제가 쓰지 않은 제품입니다. 직접 검증하지 않았습니다.
- 라데온 AI PRO R9700 32GB — 쿠팡에서 보기
이 글에서 5090 의 대안으로 조사한 카드입니다. 제가 쓰는 물건은 아닙니다.
