어텐션의 등장

번역가는 원문을 한 번만 볼까요?

사람은

쓰면서 계속 다시 봅니다

단어 하나를 쓸 때마다 원문에서 지금 필요한 부분을 찾아봅니다. 전부 외워서 쓰지 않습니다.

2014년

이 방식이 모델에 들어갑니다

이름은 바흐다나우 어텐션입니다. 디코더가 메모 한 장에만 기대지 않고, 원문의 모든 위치를 직접 참조합니다.

바흐다나우는 논문 제1저자의 이름입니다.

어디를 얼마나

볼 비중을 숫자로 정합니다

'met'을 쓰는 순간, 원문 각 단어의 비중
  • 나는0.05
  • 어제0.05
  • 친구를0.15
  • 만났다0.75

이 숫자가 어텐션 가중치입니다. 단어를 하나 쓸 때마다 새로 계산합니다.

이해를 돕는 예시 값입니다.

2017년

RNN을 빼고 어텐션을 중심에 둡니다

이 모델이 트랜스포머입니다. 그리고 그 안에 셀프 어텐션이 들어 있습니다.

무엇이 다른가

'셀프'는 같은 문장 안이라는 뜻입니다

어텐션
번역문을 쓰면서 원문을 본다서로 다른 두 문장 사이
셀프
한 문장의 단어들이 서로를 본다한 문장 안

그래서 중요합니다

GPT의 핵심 부품이 셀프 어텐션입니다

GPT 같은 LLM은 트랜스포머를 바탕으로 만들고, 그 중심에 셀프 어텐션이 있습니다. 이번 강의는 이 부품 하나를 끝까지 따라갑니다.

다음 편

단어들이 서로를 보면 무엇이 달라질까?

3편'배'는 무슨 뜻일까? 4강 목록