tag

#scaling-law

총 5개의 글

AI 2026.05.03 · 10 min Advanced Llm Pretraining Deep Dive · 1

Kaplan의 power law부터 Chinchilla의 joint law, Broken Scaling Law, 그리고 scaling law의 본질적 한계까지 — LLM 사전학습의 수학적 의사결정을 추적한다.

AI 2026.05.03 · 11 min Advanced Llm Pretraining Deep Dive · 2

C ≈ 6ND 유도부터 over-training의 경제학, μP의 width transfer, GNS 기반 배치 스케줄, WSD까지 — LLM 사전학습의 핵심 설계 결정을 하나의 프레임으로 추적한다.

AI 2026.05.03 · 10 min Advanced Llm Efficiency Deep Dive · 5

Sparse activation의 정식화부터 load balancing loss, token dropping, 그리고 scaling law까지 — MoE가 dense를 넘어서는 이유를 추적한다.

AI 2026.05.03 · 13 min Advanced Llm Pretraining Deep Dive · 6

깊이-너비 비율부터 KV 캐시, MoE 라우팅, 위치 인코딩, 활성화 함수까지 — LLM 아키텍처의 모든 설계 결정이 하나의 원칙으로 수렴하는 이유를 추적한다.

AI 2026.05.03 · 15 min Advanced Vision Transformer Deep Dive · 7

토큰 기반 이미지 생성부터 Scaling Law, 3D 장면 표현, 영상 이해, 세계 모델까지 — Vision Transformer 설계 철학의 공통 실을 추적한다.