개요
처음에는 GPU 의 높은 연산 성능이 핵심 경쟁력, 최근에는 HBM 의 용량과 대역포, 이를 활용한 서비스 운영 능력이 더욱 중요한 요소로 부상하고 있다.
1. 학습과 추론은 서로 다른 문제를 해결한다
LLM 의 동작은 크게 두 단계로 나눌 수 있다.
학습 : 대량의 데이터 - > 모델 가중치 생성
추론 : 사용자 입력 -> 학습된 가중치를 이용하여 출력 생성
많은 사람들이 추론도 계속 모델이 학습되는 과정이라고 생각하기 쉽다.
하지만 일반적인 LLM 서비스에서는 그렇지 않다.
학습이 끝난 이후에는 모델의 가중치는 거의 변하지 않는다.
2. 추론에서 실제로 변하는 것은 모델이 아니다
실제 구조, 과정
- 사용자 입력
- 고정된 모델
- 사용자별 상태 생성
- 다음 입력에서 활용
변하는 것은 모델이 아니라 사용자마다 따로 존재하는추론 상태이다.
3. 모델은 하나지만 상태는 사용자마다 존재한다.
LLM 서비스의 모델은 하나지만
각 사용자별 문맥은 서로 다르다,
따라서 각 사용자별 별도의 상태를 유지한다.
4. KV Cache 란
Transformer 는 이전 내용을 계속 참고해야 한다.
하지만 이전 문장을 매번 처음부터 다시 계산하면 매우 비효율적
그래서 계산 결과의 저장
- 입력
- Layer
- Key, Value 생성
- KV Cache 저장
다음 토큰에서는
- 새입력
- 기존 KV Cache
- Attention
- 새로운 KV 생성
이 과정을 반복한다.
즉 KV Cache 는 이전 계산 결과를 저장하는 임시 메모리라고 이해하면 된다.
5. 왜 메모리가 계속 증가하는가?
추론에서는 매 토큰마다 새로운 Key 와 Value 가 생성된다.
추론에서는 매 토큰마다
새로운 Key 와 Value가 생성된다.
문맥이 길어질수록 저장해야 하는 상태도 증가한다.
여기에
동시에 수많은 사용자가 존재하면
모든 사용자의 상태를 동시에 유지해야 한다.
6. 왜 GPU 메모리가 중요한가?
GPU 는 단순한 연산기가 아님
추론 중 GPU 는 다음을 모두 담당한다
- 모델 가중치
- 사용자별 KV Cache
- Activation
- Tensor Core 연산
- MBM 메모리
7. 학습보다 추론에서 메모리가 더 중요해지는 이유
학습에서는
- Forward
- Backward
- Weight Update
가 수행된다.
연산량이 매우 큼
반면 추론에서는
- Forward
- 출력
만 수행한다.
그러나 매 토큰마다
- 모델 전체의 Weight 를 읽고
- KV Cache 를 읽고
- KV Cache 를 다시 저장해야 한다.
즉
연산보다
메모리 접근이 병목이 되는 경우가 많다.
8. GPU 서버라는 말이 등장하는 이유
GPU 여러 장을 하나의 서버로 구성
수많은 사용자의 요청은
GPU 서버 안에서 처리된다.
9. 최근 AI 산업이 메모리를 강조하는 이유
초기에는
- 더 큰 GPU
- 더 빠른 학습
그러나 최근에는
- 더 큰 GPU 메모리
- 더 빠른 HBM
- 더 높은 Memory Bandwidth
- 더 많은 사용자를 동시에 처리
가 중요
즉,
서비스 단계에서는
HBM 용량과 Memory Bandwidth 가 성능을 결정하는 경우가 많다.
10. 앞으로의 연구 방향
단순히 메모리를 늘리는 것이 아닌
더 적은 메모리로 같은 성능 유지를 목표로 한다.
'명징직조' 카테고리의 다른 글
| 의미 있는 결과가 나오기 전의 프로젝트를 어떻게 바라볼 것인가 (0) | 2026.07.11 |
|---|---|
| 게임이론으로 바라본 하드웨어와 알고리즘 설계 (0) | 2026.07.11 |
| 0과 1은 물리적으로 무엇인가 (0) | 2026.07.08 |
| 기계어와 회로 연산 (0) | 2026.07.08 |
| 신경망은 왜 필요한 것보다 큰가 - MEASURING THE INTRINSIC DIMENSIONOF OBJECTIVE LANDSCAPES (0) | 2026.07.06 |