AI 에이전트의 뇌, 신체, 그리고 한계
같은 LLM 이 어느 환경에선 문장 한 줄을 다듬는 데 그치고, 어느 환경에선 수백 줄짜리 코드를 자율적으로 고쳐내요. 이 격차를 설명하는 단어는 하네스. 그리고 그 모든 최적화가 부딪히는 천장이 메모리 대역폭. 본 노트는 그 양 끝을 잇는 정리예요.
들어가며 →Appendix · Theory
심화 부록 — Theory
모델 내부 동역학과 시스템 아키텍처 — 트랜스포머, KV 캐시, 양자화와 KV 압축, 어텐션 변형, 추론 시스템, 리즈닝, 얼라인먼트, 경량 모델, 최근 모델 사례, 투기적 디코딩, RAG, 평가.
트랜스포머 추론의 두 단계
Prefill 과 Decode
THEORY파라미터 착시: KV 캐시의 진실
KV 캐시 폭발과 대역폭 병목
THEORY양자화와 KV 압축
Unsloth Dynamic · TurboQuant
THEORY어텐션 변형
SWA · GQA · MLA · RoPE / YaRN · SSM Hybrid
THEORY추론 시스템·커널 최적화
FlashAttention · PagedAttention · CB · Prefix Caching
THEORY리즈닝 모델의 딜레마
thinking 토큰의 비용 감각
THEORY안전한 AI 는 더 약한 AI 인가?
Alignment tax 와 over-refusal
THEORY397B 를 이긴 27B
경량 모델이 따라잡는 이유
THEORY최근 여섯 모델
Gemma4 · Qwen3.6 · DeepSeek V4
THEORYDFlash
블록 확산 드래프터 투기적 디코딩
THEORYRAG 아키텍처
검색 증강 생성의 실전 패턴
THEORYLLM 평가
벤치마크 · LLM-as-Judge · 골든셋 · 에이전트 평가
Appendix · Hardware
심화 부록 — Hardware
구동 환경 — 메모리 용량/대역폭, 로컬 LLM 플랫폼 생태계.
Appendix · Tools
심화 부록 — Tools
에이전트 사용 도구와 실무 — Claude Code 3축, Codex 가이드, 커밋 기초, 비용 최적화, 에이전트 프레임워크.
Appendix · Perspectives
심화 부록 — Perspectives
AI 가 사람과 코드에 남기는 자국 — 기술 부채, 일자리에 대한 합리적 공포와 회의.