메모리 아끼면서 Cross Entropy Loss 계산하기
메모리 아끼면서 Cross Entropy Loss 계산하기 긴 context, 큰 vocab의 LLM 학습에서 LM head + cross entropy가 왜 가장 큰 메모리 소비처 중 하나가 되는지 짚어본 글. 1
메모리 아끼면서 Cross Entropy Loss 계산하기 긴 context, 큰 vocab의 LLM 학습에서 LM head + cross entropy가 왜 가장 큰 메모리 소비처 중 하나가 되는지 짚어본 글. 128K context에서는 logits 텐서 하나가 40GB에 육박해서, 모델 weight보다도 커진다. 16B 모델을 128K context로 학습하다 실제로 겪은 OOM에서 출발해, cross entropy의 f
정리
핵심 요약
메모리 아끼면서 Cross Entropy Loss 계산하기 긴 context, 큰 vocab의 LLM 학습에서 LM head + cross entropy가 왜 가장 큰 메모리 소비처 중 하나가 되는지 짚어본 글. 128K context에서는 logits 텐서 하나가 40GB에 육박해서, 모델 weight보다도 커진다. 16B 모델을 128K context로 학습하다 실제로 겪은 OOM에서 출발해, cross entropy의 f
출처: GeekNews
이 아티클로 만든 나만의 공식 0개
아직 이 아티클로 만든 공식이 없어요. 첫 번째 공식을 남겨보세요!
나도 공식 만들기
댓글
0댓글을 남기려면 로그인이 필요해요.
아직 댓글이 없어요. 첫 댓글을 남겨보세요.