tag

#tokenization

총 3개의 글

AI 2026.05.03 · 12 min Intermediate Nlp Foundations Deep Dive · 5

OOV 문제의 본질부터 BPE·WordPiece·Unigram·SentencePiece의 설계 철학까지, 현대 LLM이 Subword를 표준으로 삼은 이유를 추적한다.

AI 2026.05.03 · 13 min Advanced Llm Pretraining Deep Dive · 5

BPE의 탐욕 병합부터 Unigram LM의 전역 확률 최적화, 어휘 크기 스케일링 법칙까지 — 토큰화 설계 결정이 LLM 성능에 미치는 영향을 추적한다.

AI 2026.05.03 · 15 min Advanced Audio Speech Deep Dive · 7

AudioLM의 계층적 분해부터 VALL-E의 in-context 클로닝, MusicGen의 delay pattern, Moshi의 풀-듀플렉스 대화까지, 오디오 생성 모델의 공통 설계 철학을 추적한다.