견적서에 A100이 두 줄입니다. 40GB, 80GB. Tensor 칸은 둘 다 312 TFLOP/s입니다. 용량만 두 배인 줄 알고 고릅니다.
NVIDIA 데이터시트를 세로로 읽으면 갈라지는 칸은 메모립니다. 40GB는 HBM2 1,555 GB/s. 80GB SXM은 HBM2e 2,039 GB/s. 80GB PCIe는 1,935 GB/s. 코어 수는 같습니다. 벨트가 다릅니다.
벽시계는 max(메모리 시간, 연산 시간)입니다. 바이트당 연산이 무릎보다 작으면 맷돌을 깎아도 가루는 벨트를 기다립니다.
방앗간의 맷돌 속도는 같고, 곡식을 나르는 벨트 폭만 다른 것과 같습니다. LLM 디코드에서 맷돌은 Tensor Core, 벨트는 HBM입니다.
숫자는 식입니다. 단위는 SI입니다. 1 GB = 10^9 B. Tensor 피크는 데이터시트 기본값 312 TFLOP/s입니다. 희소성 배수 624는 쓰지 않습니다.
1. 무릎이 SKU마다 다릅니다
무릎은 연산 피크를 대역으로 나눈 값입니다.
- 80GB SXM: 312e12 / 2039e9 ≈ 153 FLOP/B
- 80GB PCIe: 312e12 / 1935e9 ≈ 161 FLOP/B
- 40GB: 312e12 / 1555e9 ≈ 201 FLOP/B
같은 312라도, 벨트가 좁은 카드는 무릎이 더 높습니다. 메모리 바이트 하나당 더 많은 연산을 해야 맷돌이 바쁩니다.
앞 글의 디코드는 가중치만 보면 1 FLOP/B입니다. 40GB 무릎 201의 200분의 1, 80GB SXM 153의 150분의 1입니다. Util이 높아도 Tensor는 거의 놉니다. 두 SKU 모두 디코드는 벨트 쪽입니다.

2. 배치를 키워도 천장이 있습니다
점을 오른쪽으로 옮기는 손잡이는 배치입니다. 가중치 140 GB를 한 번 읽고 질문을 여러 개 얹으면, 가중치만 칠 때 강도는 대략 배치 B FLOP/B입니다. 80GB SXM 무릎은 B≈153, 40GB는 B≈201입니다.
KV가 붙으면 식이 바뀝니다. 강도는 2P / (2P/B + KV)입니다. B가 커져도 2P/KV에서 멈춥니다. 70B GQA, 컨텍스트 32K면 KV는 토큰당 0.328 MB × 32,768 ≈ 10.7 GB. 140 / 10.7 ≈ 13 FLOP/B. 무릎 153보다 아래입니다. 디코드는 배치를 키워도 메모리 쪽에 남습니다.
3. 같은 세대의 예측
40GB와 80GB는 코어를 더 박은 비교가 아닙니다. 벨트가 다를 때의 예측입니다. 배치 1 디코드에서 대역 비만큼 80GB SXM이 빠를 수 있습니다. 2039 / 1555 ≈ 1.31배. 이것은 데이터시트 나눗셈입니다. 이 글의 측정이 아닙니다.
MIG 7조각은 인스턴스마다 벨트를 자릅니다. 40GB는 조각당 5GB, 80GB는 10GB입니다. 조각을 늘린다고 카드 전체 대역이 넓어지지 않습니다.
「A100이면 다 같다.」 스펙 한 줄만 본 말입니다. 「배치를 키우면 디코드가 연산 쪽이 된다.」 무릎 앞에서 KV가 벨트를 다시 채웁니다.
참고
- Tensor 312 TFLOP/s, 대역 1,555 / 1,935 / 2,039 GB/s: NVIDIA A100 데이터시트 (SXM4·PCIe). 희소성 624는 제외.
- 70B GQA 토큰당 0.328 MB는 앞 글과 같은 식입니다. 32K KV 10.7 GB, 천장 13 FLOP/B는 그 나눗셈입니다.