논문 제목은 원문 그대로 둔다. 인용할 때 찾지 못하면 곤란하기 때문이다.
warmup 메커니즘에 대해 내가 읽은 가장 깔끔한 진술이고, Warmup은 adaptive optimizer의 초기 분산을 억제한다의 근거다.
다루지 않는 것: 큰 배치 학습. 분산 논증은 배치가 커질수록 약해져야 하는데 경험적으로는 warmup이 더 중요해진다. 내 열린 질문이 정확히 그 틈에 있다.
Paper
Claim
warmup은 초기 몇 스텝에서 적응적 학습률의 분산이 커지는 것을 보상해 준다. 그 분산을 직접 보정하면 warmup 자체가 필요 없어진다.
Where it's shaky
분산 유도가 gradient i.i.d. 가정에 의존하는데, 그 가정이 가장 안 맞는 구간이 바로 이 논문이 다루는 학습 초반이다. 실험은 그럼에도 잘 맞고, 그래서 메커니즘은 옳되 유도는 사후적으로 붙인 설명이라는 인상을 받았다.
논문 제목은 원문 그대로 둔다. 인용할 때 찾지 못하면 곤란하기 때문이다.
warmup 메커니즘에 대해 내가 읽은 가장 깔끔한 진술이고, Warmup은 adaptive optimizer의 초기 분산을 억제한다의 근거다.
다루지 않는 것: 큰 배치 학습. 분산 논증은 배치가 커질수록 약해져야 하는데 경험적으로는 warmup이 더 중요해진다. 내 열린 질문이 정확히 그 틈에 있다.