APPENDIX · THEORY

최근 여섯 모델

Gemma4 · Qwen3.6 · DeepSeek V4

저자가 관심 있게 보는 최근 여섯 모델

연관 문서: KV 캐시, 어텐션 변형, 메모리·대역폭 지도, 397B를 이긴 27B

2026년 봄의 오픈웨이트 모델들을 보면, "몇 B인가"만으로는 체급을 설명하기 어려워졌어요. 같은 30B 안팎이어도 어떤 모델은 MoE(Mixture of Experts, 여러 전문가 블록 중 일부만 켜는 구조)로 활성 파라미터를 줄이고, 어떤 모델은 linear attention(linear attention, 긴 문맥에서 메모리 증가를 줄이는 attention 계열)으로 KV cache(Key-Value cache, 긴 대화 중 이미 계산한 attention 중간 결과를 저장하는 작업 메모리)를 줄이고, 어떤 모델은 CSA+HCA(Compressed Sparse Attention + Heavily Compressed Attention, KV cache를 압축한 뒤 필요한 정보만 보는 구조)로 1M 컨텍스트를 밀어붙여요.

이 부록은 최근에 특히 눈여겨볼 만한 여섯 모델을 한 장에 놓고 봅니다.

모델구조컨텍스트왜 관심이 가나
Gemma4 26B-A4BMoE + Hybrid Attention256K25B급 파일인데 활성은 약 4B, Global KV cache도 작아요
Gemma4 31BDense + Hybrid Attention256K작은 dense 모델에서 KV cache가 가중치만큼 커지는 대표 사례예요
Qwen3.6 27BDense + DeltaNet hybrid262K native, YaRN 확장27B가 397B급 코딩 모델을 일부 벤치에서 따라잡아요
Qwen3.6 35B-A3BMoE + DeltaNet hybrid262K native, YaRN 확장활성 3B급 MoE인데 긴 문맥 메모리도 줄였어요
DeepSeek V4 FlashMoE + CSA/HCA1MV4 구조를 작게 줄인 실험적 1M 모델이에요
DeepSeek V4 Pro1.6T MoE + CSA/HCA1M공개 오픈웨이트 중 최대급인데 1M KV cache가 약 9.6 GiB예요

비유로 보면, 이 여섯 모델은 같은 "자동차"가 아니에요. Gemma4는 차체는 익숙하지만 연료 탱크를 작게 쓰는 하이브리드차에 가깝고, Qwen3.6은 고속도로 주행 방식을 바꾼 차에 가깝고, DeepSeek V4는 짐칸에 모든 짐을 그대로 싣지 않고 압축 상자로 바꿔 싣는 트럭에 가까워요.


한눈에 보는 구조 차이

flowchart LR Gemma["Gemma4<br/>SWA + Global Attention"] Qwen["Qwen3.6<br/>Gated DeltaNet + Full Attention"] DeepSeek["DeepSeek V4<br/>CSA + HCA + Sliding Window"] Gemma --> GKV["일부 Global layer만<br/>긴 KV cache 보유"] Qwen --> QKV["대부분 linear layer라<br/>표준 KV cache 비중 감소"] DeepSeek --> DKV["4토큰/128토큰 단위<br/>compressed KV cache"]

Gemma4의 핵심은 Hybrid Attention(Hybrid Attention, 서로 다른 attention 레이어를 섞는 구조)이에요. 대부분의 레이어는 SWA(Sliding Window Attention, 가까운 토큰만 보는 attention)로 최근 토큰만 보고, 일부 Global Attention(Global Attention, 전체 문맥을 보는 attention) 레이어만 긴 문맥 전체를 봐요.

Qwen3.6의 핵심은 Gated DeltaNet(Gated DeltaNet, 긴 문맥 정보를 고정 크기 상태로 압축해 다루는 선형 attention 계열) 중심의 hybrid 구조예요. 표준 full attention(full attention, 전체 문맥을 직접 보는 attention)이 전체 레이어의 약 25%만 남아요.

DeepSeek V4의 핵심은 compressed KV예요. 가까운 토큰은 sliding window(sliding window, 최근 일부 토큰만 자세히 보는 창)로 보고, 오래된 토큰은 CSA(Compressed Sparse Attention, 4토큰 단위 압축 뒤 필요한 블록만 고르는 attention)와 HCA(Heavily Compressed Attention, 128토큰 단위로 크게 압축해 전역 요약을 보는 attention)로 바꿔 저장해요.


Gemma4 26B-A4B

Gemma4 26B-A4B는 MoE(Mixture of Experts, 여러 전문가 블록 중 일부만 켜는 구조) 모델이에요. 총 파라미터는 약 25.2B지만, 이름의 A4B는 token 하나를 처리할 때 실제로 켜지는 active parameters(active parameters, 매 토큰 계산에 참여하는 파라미터)가 약 4B급이라는 뜻에 가까워요.

구조상 눈에 띄는 점은 두 가지예요.

항목
레이어30
attention 패턴sliding 25층 + full/global 5층
sliding window1024
experts128
top-k experts8
컨텍스트256K
Q4_K_M 크기약 17.0 GB

이 모델은 "작은 활성 파라미터"와 "작은 KV cache"가 같이 옵니다. MoE 덕분에 token당 계산량이 줄고, Hybrid Attention 덕분에 모든 레이어가 256K 전체를 들고 있지 않아도 돼요.

주의할 점도 있어요. Gemma4 26B-A4B는 attention_k_eq_v 같은 특수 구현이 있어, TurboQuant(TurboQuant, KV cache를 vector quantization으로 더 작게 저장하는 실험적 압축) fork에서 K cache와 V cache를 단순히 같은 것으로 취급하면 안 된다는 구현 메모가 있어요. 즉 "TurboQuant가 잘 맞는다"는 말은 방향성이지, 아무 구현에나 켜도 된다는 뜻은 아니에요.


Gemma4 31B

Gemma4 31B는 dense(dense, 모든 파라미터가 매 토큰 계산에 참여하는 구조) 모델이에요. MoE가 아니라서 구조는 더 단순하지만, attention은 Gemma4 26B-A4B처럼 Hybrid Attention을 씁니다.

항목
레이어60
attention 패턴sliding 50층 + full/global 10층
컨텍스트256K
BF16 크기약 61.4 GB
Q4_K_M 크기약 19.6 GB
256K KV cache약 20.8 GiB

이 모델은 KV cache 착시를 보여주는 좋은 예예요. Q4_K_M(Q4_K_M, GGUF 생태계에서 널리 쓰는 표준 4비트 가중치 압축)으로 모델 파일을 약 20GB까지 줄여도, 256K 컨텍스트를 길게 채우면 KV cache가 그와 비슷한 20GB대까지 올라와요.

그래서 Gemma4 31B는 TurboQuant 같은 KV cache 압축 실험의 관심 대상이 됩니다. 줄일 대상이 꽤 남아 있기 때문이에요. 다만 공식 Google/Transformers 문서가 "Gemma4에는 TurboQuant를 쓰라"고 권장한 것은 아니고, 커뮤니티 fork와 실측 중심의 흐름이라는 점은 분리해서 봐야 해요.


Qwen3.6 27B

Qwen3.6 27B는 dense 모델이지만, 표준 Transformer(Transformer, attention과 FFN을 반복하는 LLM 기본 구조)만 반복하지 않아요. 64개 레이어 중 48개가 Gated DeltaNet 계열이고, 16개만 full attention이에요.

항목
레이어64
linear 계열 레이어48
full attention 레이어16
컨텍스트262K native, YaRN 확장으로 1M 근처
BF16 크기약 53.8 GB
Q4_K_M 크기약 17.5 GB

이 구조는 "긴 문맥의 기억장을 아예 덜 만든다"는 쪽에 가까워요. TurboQuant는 이미 만들어진 KV cache를 더 작게 포장하는 기술인데, Qwen3.6은 표준 KV cache가 필요한 레이어 수 자체를 줄여요.

그래서 "Qwen3.6은 TurboQuant보다 표준 KV cache 양자화가 더 낫다"는 말은 절반만 맞아요. 더 정확히는, Qwen3.6은 full attention 레이어 비중이 낮아서 TurboQuant가 줄일 표준 KV cache가 Gemma4보다 적고, 커뮤니티 실측에서는 q8_0/q4_0 같은 표준 KV cache 양자화가 품질·속도 균형에서 더 나은 사례가 보고됐다는 뜻이에요. 공식 모델 카드가 "TurboQuant보다 표준 양자화가 좋도록 설계했다"고 말한 것은 아니에요.


Qwen3.6 35B-A3B

Qwen3.6 35B-A3B는 Qwen3.6의 MoE 버전이에요. 총 파라미터는 약 35B지만, active parameters는 약 3B급이에요.

항목
레이어40
linear 계열 레이어30
full attention 레이어10
experts256
routed experts8
shared experts1
컨텍스트262K native, YaRN 확장으로 약 1M
Q4_K_M/UD 계열 크기약 21.4 GB
262K KV cache약 5 GiB

Qwen3.6 35B-A3B는 두 가지 절약을 동시에 합니다. MoE로 token당 켜지는 파라미터를 줄이고, Gated DeltaNet 중심 구조로 표준 KV cache 비중도 줄여요. Gated Attention 10층만 2개 KV head를 들고 가기 때문에, 262K 컨텍스트에서도 BF16 KV cache가 약 5 GiB 수준이에요. 이 때문에 "35B 모델"이라는 이름보다 실제 구동 감각이 훨씬 가볍게 느껴질 수 있어요.

단, 1M은 native context(native context, 모델이 기본 설정으로 지원하는 길이)가 아니라 YaRN(YaRN, RoPE 위치 인코딩을 더 긴 문맥으로 확장하는 방법) 확장 쪽에 가까워요. 문서에서는 262K native, YaRN 확장으로 약 1M이라고 쓰는 게 안전합니다.


DeepSeek V4 Flash

DeepSeek V4 Flash는 V4 구조를 작게 줄인 모델이에요. Pro와 같은 계열의 attention 압축 구조를 쓰지만, 레이어 수와 expert 수가 줄어 있어요.

항목
총 파라미터284B
active parameters13B
레이어43
experts256
routed experts6
컨텍스트1M
CSA 레이어21
HCA 레이어20
1M KV cache약 6.7 GiB

Flash는 이름처럼 작은 V4예요. "작다"는 말은 284B가 작다는 뜻이 아니라, Pro의 1.6T와 비교해 작다는 뜻이에요. 그래도 1M context와 CSA/HCA 구조를 공유하므로, DeepSeek V4 아키텍처를 실험하기에는 더 현실적인 선택지일 수 있어요.


DeepSeek V4 Pro

DeepSeek V4 Pro는 1.6T total parameters(total parameters, 모델 파일 전체 파라미터 수), 49B active parameters(active parameters, 매 토큰 실제 계산에 참여하는 파라미터 수)의 대형 MoE 모델이에요. 공개 오픈웨이트 중에서도 체급이 매우 큽니다.

항목
총 파라미터1.6T
active parameters49B
레이어61
experts384
routed experts6
컨텍스트1M
CSA 레이어30
HCA 레이어31
1M KV cache약 9.6 GiB

가장 놀라운 지점은 KV cache예요. 표준 attention 모델이라면 1M 컨텍스트에서 cache가 수백 GB로 커질 수 있는데, V4 Pro는 batch 1, BF16 cache 기준 계산이 약 9.6 GiB예요.

계산은 이렇게 잡을 수 있어요.

DeepSeek-V4-Pro, 1M context, batch=1, BF16 cache:
  CSA 30층: 30 x (256 MiB compressor + 64 MiB indexer) = 9,600 MiB
  HCA 31층: 31 x   8 MiB compressor                      =   248 MiB
  sliding branch: 61층 x 128 tokens x 512 dim x 2 bytes   =   ~8 MiB
  합계:                                                     ~9.6 GiB

이것은 "모든 과거 토큰을 그대로 기억한다"가 아니라, 오래된 토큰을 압축 요약으로 바꿔 보관한다는 뜻이에요. 책상 위에 모든 문서를 펼쳐두는 대신, 최근 문서만 펼쳐두고 오래된 문서는 색인 붙은 요약철로 바꿔 꽂아두는 방식에 가까워요.


TurboQuant와 Unsloth Dynamic은 어디에 있나

두 기술은 이 부록의 여섯 모델을 볼 때 꼭 같이 봐야 하지만, 서로 같은 층의 기술은 아니에요.

기술줄이는 대상적용 시점현재 이 노트의 위치
Q4_K_M모델 가중치(weight, 모델 파일 안 숫자)모델 파일 로드 전메모리·대역폭 지도
Unsloth Dynamic모델 가중치(weight, 모델 파일 안 숫자)모델 파일 생성/배포 단계메모리·대역폭 지도
표준 KV 양자화KV cache(Key-Value cache, 추론 중 생기는 작업 메모리)추론 런타임KV 캐시
TurboQuantKV cache(Key-Value cache, 추론 중 생기는 작업 메모리)추론 런타임KV 캐시

Unsloth Dynamic(Unsloth가 모델별·레이어별로 압축 강도를 다르게 고르는 양자화 방식)은 Q4_K_M보다 더 똑똑한 포장법에 가까워요. 같은 "4비트급"이라도 깨지기 쉬운 텐서(tensor, 모델 내부 숫자 덩어리)는 덜 누르고, 덜 민감한 텐서는 더 세게 누릅니다.

TurboQuant는 모델 파일 포장이 아니라 작업 중 생기는 KV cache 포장이에요. 긴 대화나 긴 코드베이스처럼 context가 길어질수록 생기는 "작업 메모리"를 더 작게 저장하려는 기술입니다.

따라서 Gemma4/Qwen3.6/DeepSeek V4를 볼 때 질문은 이렇게 나뉘어요.

  • 모델 파일을 줄이고 싶은가: Q4_K_M 또는 Unsloth Dynamic을 봐요.
  • 긴 컨텍스트의 작업 메모리를 줄이고 싶은가: q8_0/q4_0 같은 표준 KV 양자화나 TurboQuant를 봐요.
  • 모델 자체가 이미 KV cache를 줄이는 구조인가: Qwen3.6의 Gated DeltaNet, DeepSeek V4의 CSA/HCA처럼 아키텍처부터 봐야 해요.

출처와 검증 기준