콘텐츠로 이동

Transformer와 어텐션 직관

01장에서 “토큰 임베딩이 주변을 보고 갱신된다”고 했다. 그 “주변을 본다”의 정체가 어텐션(Attention)이고, 그 어텐션을 여러 층으로 쌓아 만든 골격이 트랜스포머(Transformer)다.

어텐션은 “지금 토큰이 다른 어떤 토큰을 얼마나 봐야 하는가”를 가중치로 계산하는 연산이며, 트랜스포머는 이 연산을 다중 헤드(Multi-Head)·다층(Stack)으로 쌓아 토큰 의미를 문맥에 맞게 거듭 갱신하는 신경망 골격이다.

개발자(주). 비개발자도 직관 절(01-개념)까지는 무리 없이 읽을 수 있다.

  • “Attention Is All You Need” 논문이 무엇을 없앴고 무엇을 남겼는지 한 줄로 말할 수 있다.
  • 자기-어텐션(self-attention)이 동음이의어 해석에 어떻게 도움이 되는지 설명할 수 있다.
  • 멀티-헤드 어텐션·위치 인코딩의 존재 이유를 안다.
  • 인코더 전용·디코더 전용·인코더-디코더의 용도 차이를 안다.
  • Part 1/01 — LLM이란 무엇인가