처음엔 KV 캐시를 재사용한다는 말이 메모리를 덜 쓴다는 뜻처럼 들렸다.
그런데 SK하이닉스가 9월 17일 소개한 SALT-KV를 보니, 질문이 조금 달라진다. 계산한 결과를 HBM·DRAM·SSD 중 어디에 남겨둘지가 핵심이다.
국내 메모리 기업을 볼 때도 HBM 하나의 수요만 따라가면 놓치는 부분이 생기겠다 싶다.
한 번 계산한 것을 다시 쓰면, HBM은 정말 덜 필요할까?
이전 Tech(KR) 글: AI 데이터센터, HBM 다음은 전력·냉각·기판일까
핵심 요약
- 같은 입력 앞부분을 재사용하면 입력 처리인 prefill을 줄일 수 있다. 새 답을 만드는 decode까지 없어지는 것은 아니다.
- 동일한 KV 블록을 공유하면 중복 저장을 줄일 수 있지만, 다음 요청에 쓰려고 남긴 캐시도 공간을 차지한다.
- 메모리가 부족해지면 프롬프트 구성, 요청 배분, 캐시 삭제 순서까지 함께 바뀐다.
- SK하이닉스의 계층화, 삼성전자의 CXL 메모리 확장, NVIDIA의 요청 배분은 서로 다른 사업 경로다. 기술 소개와 실제 매출 기여는 구분해야 한다.
자체 도식 · 자료 확인 2026-09-28
계산을 건너뛰는데 왜 HBM을 계속 읽을까?
KV 캐시 재사용은 이미 계산한 입력의 결과를 꺼내 쓰는 방식이다. 새 답을 생성할 때 그 결과를 참조하는 일은 남는다.
예를 들어 회사 규정집을 읽고 답하는 AI를 생각해보자. 여러 질문 앞에 같은 규정집이 붙는다면, 매번 처음부터 입력 처리를 반복할 이유가 없다. 공통 앞부분, 즉 prefix의 KV를 재사용하면 첫 답이 나오기까지의 일을 줄일 수 있다.
다만 답은 질문마다 새로 만들어야 한다. 전체 문맥에 주의를 기울이는 full attention 모델은 새 토큰을 만들 때 과거 문맥의 KV를 참조한다. 저장된 규정집 부분도 여기에 들어간다. 다시 계산하지 않는 것과 다시 읽지 않는 것은 다르다.
vLLM 공식 문서도 prefix caching이 줄이는 것은 prefill이며 decode 시간 자체를 줄이는 기능은 아니라고 설명한다. 답변 생성이 긴 작업이라면 체감 효과가 작을 수 있다.
그래서 나는 캐시 적중률 옆에 생성 토큰당 지연도 같이 놓고 싶다. 입력 처리만 빨라졌는지, 사용자가 끝까지 기다리는 시간도 좋아졌는지 구분하기 위해서다. 실제 HBM 트래픽은 attention 커널, 배치, 하드웨어 캐시에도 영향을 받으므로 재사용률만으로 계산할 수 없다.
같은 4GiB도 열 번 복사하면 이야기가 달라진다
규모를 보기 위해 가상의 모델을 하나 놓아보자. 32개 층, KV head 8개, head 차원 128, 원소당 2바이트, 문맥 32,768토큰인 full-attention GQA 모델이다. 요청 하나의 KV 데이터는 다음과 같다.
2(K와 V) × 32 × 8 × 128 × 2바이트 × 32,768 = 4GiB
이는 설명용 자체 계산이다. 모델 가중치, 관리 정보, 메모리 단편화는 제외했다. GQA는 여러 query head가 KV head를 공유하는 구조이며, 여기서는 KV head 수를 8로 가정했다. 모든 모델의 32K 문맥이 4GiB라는 뜻은 아니다.
이 전체 문맥이 열 요청의 완전히 동일한 prefix이고, PagedAttention 논문에서 설명한 것처럼 하나의 저장본을 공유하는 구현이라면 공통 부분은 논리적으로 4GiB면 된다. 요청마다 따로 복제하면 같은 부분만 40GiB다. 각 요청의 개별 질문과 출력 부분은 별도다.
그렇다고 실제 서버에서 항상 36GiB가 줄어드는 것은 아니다. 서로 다른 GPU에 복사본이 필요하거나 블록 경계가 맞지 않을 수 있다. 한 서버에서 아낀 공간을 더 많은 동시 요청에 쓰면 전체 점유량은 다시 늘 수 있다. 이 계산은 중복 제거의 가능성을 보여주며, HBM 구매량 전망은 아니다.
메모리 부족은 프롬프트와 요청 배분도 바꾼다
메모리가 빠듯할수록 같은 내용을 얼마나 오래, 어디에 보관할지 선택해야 한다. 그 선택이 소프트웨어 설계로 되돌아온다.
먼저 입력의 순서다. vLLM의 설계 문서에서 캐시 블록의 식별에는 해당 토큰뿐 아니라 앞선 prefix도 들어간다. 내용이 비슷하다는 이유만으로 공유되는 구조가 아니다. 이를 응용하면 고정 규칙과 도구 설명은 앞에, 매번 바뀌는 질문은 뒤에 두는 구성이 유리할 수 있다. 다만 순서를 바꿨을 때 답의 품질도 함께 검증해야 한다.
다음은 보관과 삭제다. 다시 오지 않을 요청의 캐시가 자리를 오래 차지하면 새로운 요청이 들어갈 여지가 줄어든다. 반대로 곧 이어질 대화의 캐시를 버리면 입력 처리를 다시 해야 한다. 큰 캐시를 남기는 비용과 버렸다가 다시 만드는 비용 사이의 선택이다.
9월 24일 공개된 prefix cache 교체 정책 연구는 두 회사의 운영 기록과 14개 정책을 분석했다. 해당 조건에서는 복잡한 전통적 정책의 개선 폭이 LRU보다 크지 않았다고 보고한다. 최근에 사용한 캐시를 중시하는 기본 판단부터 튼튼해야 한다는 얘기다. 아직 프리프린트이며 여기서 실험을 재현하지 않았으므로 모든 서비스에 일반화할 수는 없다.
마지막은 요청 배분이다. 캐시가 있는 GPU로 보내면 재계산을 피할 수 있지만, 그 GPU의 대기열이 길면 오히려 늦어진다. NVIDIA는 Dynamo 기술 설명에서 캐시 겹침과 decode 부하를 함께 고려하는 배분을 소개한다. 메모리의 위치가 트래픽을 보내는 기준이 된 셈이다.
SSD와 CXL은 HBM의 어떤 일을 나눠 맡을까?
다시 쓸 가능성은 있지만 당장 계산에 쓰이지 않는 캐시를 보관하는 일이 먼저다. SSD나 확장 메모리를 늘렸다고 GPU 가까이의 HBM과 같은 속도로 읽을 수 있는 것은 아니다.
계층화의 성패를 가르는 질문은 간단하다. 보관한 KV를 찾아 다시 가져오는 시간이, 그것을 재계산하는 시간보다 유리한가? 전송 크기뿐 아니라 연결 대역폭, 대기열, 복원 경로까지 영향을 준다. 복원 때문에 첫 응답이 늦어지면 높은 적중률도 만족스러운 서비스로 이어지지 않는다.
반대로 필요한 데이터를 미리 올려놓거나, 잠깐 멈춘 대화의 캐시를 넓은 보관 공간에 남길 수 있다면 HBM을 더 활발한 요청에 배정할 여지가 생긴다. 이것은 설계상의 조건부 효과다. 저장 장치 용량 증가가 곧 추론 성능 증가라는 주장은 아니다.
국내 메모리 기업과 NVIDIA를 잇는 실제 경로
SK하이닉스(KRX: 000660)는 9월 17일 공식 행사 소개에서 자사 eSSD를 장착한 SALT-KV 시연을 공개했다. 문맥별 KV 조각의 재사용 가치와 저장 비용을 따져 HBM·DRAM·SSD에 배치한다고 설명한다. 국내 투자자가 확인할 경로는 캐시 보관 계층의 도입이 실제 eSSD·DRAM 구성과 출하로 이어지는지다. 시연만으로 고객 채택량이나 매출 기여를 알 수는 없다.
삼성전자(KRX: 005930)는 CMM-D MD220 제품 문서에서 CXL 기반 DRAM 메모리 확장을 제시한다. 이는 서버가 확보할 수 있는 메모리 용량과 관련된 직접적인 제품 노출이다. 다만 이 문서는 특정 KV 서비스 채택이나 SALT-KV 연동을 확인해주지 않는다. KV 보관용으로 쓰일 가능성은 분석상의 연결이며, 실제 경로는 서버 지원, 소프트웨어 통합, 고객 채택으로 검증해야 한다.
NVIDIA(NASDAQ: NVDA)의 Dynamo는 GPU 추론 시스템에서 캐시를 재사용하도록 요청을 배분하는 소프트웨어 경로다. 같은 GPU 구성으로 목표 지연을 지키며 더 많은 요청을 처리할 수 있는지가 중요한 검증 대상이다. 소프트웨어 효율 개선을 곧바로 GPU 판매 증가로 환산할 수는 없다. 필요한 장비 수가 줄어드는 효과와 서비스 사용량이 늘어나는 효과를 모두 봐야 한다.
적중률 다음에 확인할 숫자들
기업 자료를 읽을 때 나는 다음 항목을 함께 확인하려 한다.
- 얼마나 비싼 계산을 아꼈나: 요청 수 기준 적중률만 보지 말고, 재사용한 토큰과 절약한 prefill 계산량을 확인한다.
- 복원이 얼마나 걸렸나: HBM 밖에서 가져오는 시간과 첫 토큰 지연의 상위 구간을 함께 본다.
- 동시에 얼마나 처리했나: 같은 모델·문맥 길이·응답 길이·지연 목표에서 처리량을 비교한다.
- 제품 매출로 연결됐나: 시연 이후 고객 검증, 실제 탑재, 출하·매출 공시가 이어지는지 확인한다.
반대 사례도 분명하다. 입력이 제각각이면 공유할 prefix가 적고, 답이 길면 decode 비용이 더 중요해진다. 모델이나 보안 격리 조건이 다르면 같은 문장도 공유하지 못할 수 있다. 확장 메모리에 많이 남겨놨는데 전송 경로가 막히는 경우도 있다.
결국 제목의 질문에는 조건부로 답해야 한다. KV 공유는 요청당 중복 저장을 줄일 수 있지만, 그것만으로 HBM 수요 감소를 결론낼 수 없다. 국내 기업을 볼 때는 HBM을 얼마나 대체하는가와 함께 DRAM·eSSD·CXL 제품이 어떤 역할을 추가로 맡는지 살펴볼 만하다. 이 글은 매수·매도 추천이 아니라 산업·기업을 읽기 위한 정보다.
Appendix. KV 캐시 재사용은 어디에 쓰일까
동일한 규정집을 두고 여러 질문을 받는 업무, 긴 대화를 이어가는 상담, 같은 도구 설명을 반복해서 보내는 에이전트가 이해하기 쉬운 사례다. 재사용되는 것은 최종 답변이 아니라 입력 처리 과정의 중간 결과다. 따라서 캐시에 적중해도 사용자의 새 질문에 대한 답은 다시 생성한다.
여기서 사용한 4GiB는 이진 단위로 4,294,967,296바이트다. 모델 구조와 KV 정밀도가 바뀌면 값도 바뀐다. 용량 계산과 실제 메모리 대역폭 측정은 별도의 작업이다.
출처와 확인일
자료 확인일은 2026년 9월 28일이다. 아래 발표들을 최근 72시간의 신규 발표로 취급하지 않았다.
- vLLM Automatic Prefix Caching — 지속 갱신 문서, 2026-09-28 확인.
- vLLM prefix caching 설계 — 지속 갱신 문서, 2026-09-28 확인.
- When Fancy Eviction Fails — 2026-09-24 제출, 프리프린트.
- NVIDIA Dynamo의 agentic inference 최적화 — 2026-04-17.
- SK하이닉스 AI Infra Summit 2026 소개 — 2026-09-17.
- 삼성전자 CMM-D MD220 — 제품 페이지, 발행일 미표기.
- PagedAttention 원 논문 — 2023-09-12 최초 제출.
- 상장정보 확인: 삼성전자 IR, SK하이닉스 IR, NVIDIA IR — 2026-09-28 확인.
댓글 없음:
댓글 쓰기
안녕하세요 :)