본문으로 건너뛰기
HBM·GDDR 심화 · 1/12

HBM과 GDDR 분기점 분석 — Bandwidth·Capacity·Cost 트레이드오프

· Hawk · 8분 읽기

#한 줄 요약

“같은 DRAM 셀에서 시작했지만, bus width와 packaging이 갈렸습니다.” — GDDR은 PCB 위 chip으로 pin rate를 끝까지 밀어 올린 방식, HBM은 interposer 위 stack으로 bus를 1024-bit까지 넓힌 방식입니다.

NVIDIA H100과 RTX 4090을 같이 놓고 보면 둘 다 최신 메모리를 씁니다. 그런데 H100 SXM은 80 GB HBM3에 3.35 TB/s, RTX 4090은 24 GB GDDR6X에 1,008 GB/s입니다. 같은 회사의 같은 시기 칩인데 메모리 선택이 완전히 다릅니다. 이 분기점이 어디서 생기는지가 이 시리즈의 시작입니다.

#DRAM 가족의 분기

JEDEC 표준 안에서 DRAM은 네 갈래로 갈렸습니다.

계열용도
DDR (Double Data Rate)CPU·서버 메인 메모리
LPDDR (Low Power DDR)모바일·랩탑·자동차
GDDR (Graphics DDR)GPU·그래픽 카드·일부 추론 카드
HBM (High Bandwidth Memory)HPC·AI 가속기

뿌리는 같은 DRAM 셀입니다. 갈리는 곳은 셀 밖입니다. 신호를 어떻게 보내는지, bus를 얼마나 넓게 가져가는지, 패키지를 어떻게 묶는지가 다릅니다.

#분기의 본질

축DDRGDDRHBM
Bus width64-bit/DIMM32-bit/chip1024-bit/stack (HBM4는 2048-bit)
Per-pin rate 예TBD21 Gbps (GDDR6X, RTX 4090)9.6 Gbps (HBM3E, SK hynix)
SignalingNRZNRZ (GDDR6) · PAM4 (GDDR6X) · PAM3 (GDDR7)NRZ
PackagingDIMM (PCB)BGA on PCBTSV stack on interposer

GDDR은 pin rate를 끝까지 밀어 올린 방식입니다. 32-bit 좁은 bus에 PAM4·PAM3 같은 멀티 레벨 signaling까지 끌어와 pin rate를 올립니다.

HBM은 반대 방향입니다. pin rate는 낮게 두고, 대신 bus width를 1024-bit까지 넓힙니다. 한 stack에 1024개 신호가 한꺼번에 움직입니다.

두 방식을 실제 제품으로 비교하면 이렇습니다.

GDDR6X 방식 (RTX 4090). 21 Gbps × 384-bit ÷ 8 = 1,008 GB/s. 32-bit chip 12개를 PCB 위에 놓습니다. chip 1개당 21 × 32 ÷ 8 = 84 GB/s입니다.

HBM3 방식 (H100 SXM5). HBM3 stack 5개를 interposer 위에 놓아 3.35 TB/s를 냅니다. HBM3 정격(6.4 Gbps, stack당 819 GB/s)으로 돌리면 5 stack이 4.1 TB/s지만, H100은 정격보다 낮게 돌려 stack당 약 670 GB/s입니다.

같은 총 대역폭을 만들어도 pin 수, 배선, 패키징이 완전히 다릅니다.

#Bandwidth per pin

핵심 지표 하나를 짚고 가야 합니다. pin 1개당 데이터 전송률입니다.

메모리기준per-pinsignaling
HBM2JESD235B (2018)2.4 GbpsNRZ
HBM2EJESD235C (2020) / SK hynix3.2 / 3.6 GbpsNRZ
HBM3JESD238 (2022)6.4 GbpsNRZ
HBM3ESK hynix 12-Hi (2024)9.6 GbpsNRZ
GDDR6JESD250 (2017)최대 16 GbpsNRZ
GDDR6XMicron (RTX 3090 Ti)21 GbpsPAM4
GDDR7JESD239 (2024)최대 48 GbpsPAM3

GDDR은 NRZ에서 PAM4, 다시 PAM3으로 signaling 자체를 바꿔 가며 pin rate를 올렸습니다. HBM은 HBM2(2.4 Gbps)에서 HBM3E(9.6 Gbps)까지 4배 늘었습니다. 대신 bus가 1024-bit라 HBM3 stack 하나(819 GB/s)가 GDDR6X chip(84 GB/s) 약 10개 분량입니다.

#패키징의 분기

GDDR chip은 일반 PCB 위 BGA로 붙습니다. HBM stack은 GPU die와 함께 silicon interposer 위에 올라가야 합니다. 1024개 신호를 PCB로 끌어낼 수는 없기 때문입니다. 그래서 HBM을 쓰려면 2.5D 패키징이 필요합니다. 세부 비용과 전력 분해는 벤더가 공개하지 않습니다.

#시장 분할

메모리 종류로 제품을 나누면 다음과 같습니다.

진영대표 제품
HBMNVIDIA H100·H200·B200 (HBM3·HBM3e)
AMD Instinct MI300X (HBM3)·MI325X (HBM3E)
Google TPU v5p
Intel Gaudi 3 (HBM2e)
Rebellions REBEL-Quad (HBM3E)
GDDRNVIDIA GeForce RTX 4090 (GDDR6X)
NVIDIA L4·L40 (GDDR6)

같은 NVIDIA 안에서도 H100은 HBM, RTX 4090은 GDDR입니다.

#HBM 양산 이력

HBM 양산은 한국 두 회사와 Micron이 이끌어 왔습니다.

시기회사내용
2015SK hynixAMD Radeon R9 Fury X의 1세대 HBM 공급
2016년 1월Samsung4 GB HBM2 양산
2020년 2월Samsung16 GB HBM2E (Flashbolt, 3.2 Gbps) 발표
2020년 7월SK hynix16 GB HBM2E 양산 (3.6 Gbps)
2022년 6월SK hynixHBM3 양산, NVIDIA H100에 공급
2024년 2월Micron24 GB HBM3E 양산 (9.2 Gbps, NVIDIA H200용)
2024년 9월SK hynix12-Hi 36 GB HBM3E 양산 (9.6 Gbps)

#시리즈 로드맵

이 시리즈는 HBM 중심으로 가지만 GDDR과의 비교도 빼지 않습니다. 뒤쪽 네 장은 HBM 너머의 메모리인 CXL.mem을 다룹니다.

챕터주제핵심
Ch 1개요 (이 글)HBM vs GDDR 분기
Ch 2HBM stack 구조TSV·base die·microbump
Ch 3세대 비교HBM2 → HBM4
Ch 4GDDRGDDR6·6X·7
Ch 5대역폭 병목sustained BW·roofline
Ch 6열·전력refresh·cooling
Ch 7메모리 컨트롤러bank·scheduling
Ch 8NPU·GPU 활용weight·KV cache
Ch 9CXL.memHBM·GDDR·DDR 다음의 메모리 계층
Ch 10CXL.mem 프로토콜왕복 지연과 링크 대역폭
Ch 11CXL 디바이스 타입Type 1·2·3
Ch 12메모리 풀링데이터센터 토폴로지

#자주 하는 실수

#“HBM이 항상 GDDR보다 빠르다”

per-stack과 per-chip을 헷갈리면 그런 결론이 나옵니다. HBM3 stack 1개는 819 GB/s, GDDR6X chip 1개는 84 GB/s입니다. 10배 차이로 보입니다. 하지만 RTX 4090은 GDDR6X chip 12개로 1,008 GB/s를 냅니다. HBM3 stack 약 1.2개 분량입니다. 시스템 레벨에서 봐야 합니다.

#“GDDR과 LPDDR이 같은 거다”

다릅니다. LPDDR은 모바일용 저전력 DRAM이고, GDDR은 그래픽용 고속 DRAM입니다. JEDEC 표준 자체가 따로 있습니다.

#HBM이 DDR5의 후속이라는 오해

HBM은 DDR5의 진화형이 아니라 패키징부터 다른 카테고리입니다. CPU가 HBM을 쓰는 예도 있습니다. Intel Xeon CPU Max는 패키지 안의 HBM2e(최대 64 GB)를 HBM-only, DDR과 함께 쓰는 Flat, DDR의 캐시로 쓰는 Cache 세 모드로 씁니다. Fujitsu A64FX(슈퍼컴퓨터 후가쿠)는 32 GB HBM2를 주 메모리로 씁니다.

#정리

  • DRAM 가족은 DDR·LPDDR·GDDR·HBM 네 갈래로 갈렸고, 셀은 같지만 패키징과 signaling이 다릅니다.
  • GDDR은 32-bit 좁은 bus에 PAM4·PAM3로 pin rate를 올린 방식입니다. GDDR7 규격은 최대 48 Gbps입니다.
  • HBM은 1024-bit 넓은 bus에 낮은 pin rate로 stack당 *819 GB/s(HBM3)~1.23 TB/s(HBM3E)*를 만든 방식입니다.
  • HBM은 1024개 신호 때문에 interposer 기반 2.5D 패키징이 필요합니다.
  • H100·H200·B200·MI300X는 HBM, RTX 4090·L4·L40은 GDDR입니다.
  • 다음 장부터 HBM stack 구조와 TSV부터 차근차근 들어갑니다.

#다음 편

Ch 2: HBM 스택 구조와 TSV에서는 base die와 DRAM die가 어떻게 적층되는지, *TSV(Through-Silicon Via)*가 어떻게 전기 신호를 위로 통과시키는지를 봅니다. microbump pitch와 yield 이슈도 함께 다룹니다.

#관련 항목