어텐션의 등장
번역가는 원문을 한 번만 볼까요?
사람은
쓰면서 계속 다시 봅니다
단어 하나를 쓸 때마다 원문에서 지금 필요한 부분을 찾아봅니다. 전부 외워서 쓰지 않습니다.
2014년
이 방식이 모델에 들어갑니다
이름은 바흐다나우 어텐션입니다. 디코더가 메모 한 장에만 기대지 않고, 원문의 모든 위치를 직접 참조합니다.
바흐다나우는 논문 제1저자의 이름입니다.
어디를 얼마나
볼 비중을 숫자로 정합니다
'met'을 쓰는 순간, 원문 각 단어의 비중
이 숫자가 어텐션 가중치입니다. 단어를 하나 쓸 때마다 새로 계산합니다.
이해를 돕는 예시 값입니다.
2017년
RNN을 빼고 어텐션을 중심에 둡니다
이 모델이 트랜스포머입니다. 그리고 그 안에 셀프 어텐션이 들어 있습니다.
무엇이 다른가
'셀프'는 같은 문장 안이라는 뜻입니다
- 어텐션
- 번역문을 쓰면서 원문을 본다서로 다른 두 문장 사이
- 셀프
- 한 문장의 단어들이 서로를 본다한 문장 안
그래서 중요합니다
GPT의 핵심 부품이 셀프 어텐션입니다
GPT 같은 LLM은 트랜스포머를 바탕으로 만들고, 그 중심에 셀프 어텐션이 있습니다. 이번 강의는 이 부품 하나를 끝까지 따라갑니다.
다음 편