AI(Artificial Intelligence, 인공지능)는 가장 넓은 개념이고, 그 안에 데이터에서 패턴을 배우는 머신러닝(Machine Learning), 그 안에 신경망(Neural Network)을 깊게 쌓는 딥러닝(Deep Learning), 그 안에 사람의 언어를 다루는 LLM(Large Language Model, 대규모 언어 모델)이 있다.
AI
└─ 머신러닝: 데이터에서 패턴을 학습
└─ 딥러닝: 여러 층의 신경망으로 비정형 데이터(이미지·텍스트·음성) 학습
└─ LLM: 대량의 텍스트로 다음 토큰을 예측하도록 학습한 언어 모델머신러닝의 학습 방식
손글씨 '8'을 알아보는 규칙을 직접 짜기는 불가능에 가깝다. 대신 많은 예시를 보여 주고 패턴을 배우게 한다.
- 지도 학습(Supervised Learning): 사람이 정답(라벨)을 붙인 데이터로 배운다. 스팸 분류, 숫자 인식
- 비지도 학습(Unsupervised Learning): 라벨 없이 데이터 안의 구조를 스스로 찾는다. 취향이 비슷한 사용자 묶기
- 강화 학습(Reinforcement Learning): 행동을 해 보고 목표에 가까워지면 보상을 받아 전략을 배운다. 바둑 AI가 대표적이다
딥러닝
사람 뇌의 뉴런에서 착안한 신경망을 여러 층 쌓는다. 앞쪽 층은 가장자리 같은 단순한 특징을, 뒤쪽 층은 모양 같은 복잡한 특징을 잡아 비정형 데이터를 다룬다.
LLM과 트랜스포머
- 인터넷 문서와 책으로 자기 지도 학습(Self-Supervised Learning)을 한다. 문장의 다음 토큰을 맞히는 문제로 스스로 정답을 만든다
- GPT는 Generative(생성), Pre-trained(사전 학습), Transformer(구조)의 줄임말이다
- 트랜스포머는 2017년 구글 연구진의 논문 "Attention Is All You Need"에서 나왔다. 어텐션(Attention)은 문장 안의 각 토큰이 다른 토큰과 얼마나 관련 있는지를 한꺼번에 계산하는 방식이라, 긴 문맥을 병렬로 처리할 수 있다
- 텍스트 말고 이미지·음성까지 함께 받는 모델은 멀티모달 모델이라고 부른다
- 컨텍스트 윈도우(Context Window)는 한 번에 넣을 수 있는 토큰의 최대 수다. 이 범위를 넘는 내용은 잘라 내거나 요약해야 하고, 빠진 부분은 모델이 보지 못한다 → LLM 사용 습관
한 토큰이 나오기까지
GPT 같은 생성형 LLM은 트랜스포머의 디코더 부분만 쓴다. 문장 하나를 넣으면 다음 흐름으로 다음 토큰 하나를 고른다.
텍스트 → 토큰화(Tokenization): 단어·하위 단어 조각으로 자르고 번호를 매김
→ 임베딩(Embedding): 토큰마다 벡터로 바꾸고 위치 정보를 더함
→ 트랜스포머 블록 × N: 마스크드 셀프 어텐션(앞 토큰만 봄) + MLP(Multi-Layer Perceptron)
→ 로짓(Logit): 어휘 전체에 대한 점수
→ 소프트맥스(Softmax): 확률로 바꿈 → 온도(Temperature) 등으로 하나를 고름고른 토큰을 입력 끝에 붙여 다시 돌리기를 반복해 문장을 만든다. 같은 질문에도 답이 조금씩 달라지는 것은 마지막에 확률로 고르기 때문이다. 트랜스포머 블록을 GPT-2 크기 모델로 직접 만져 보려면 Transformer Explainer, 원 논문의 인코더-디코더 구조를 그림으로 따라가려면 The Illustrated Transformer가 좋다. 임베딩으로 의미가 가까운 문서를 찾는 쓰임은 RAG (검색 증강 생성)에서 다룬다.
LLM은 이렇게 배운 확률로 답을 만들기 때문에 그럴듯하지만 틀린 답(환각, Hallucination)을 낼 수 있다. 결과를 검증하는 습관은 AI 시대 변경에 대한 책임 질문에서 다룬다.
출처: Succeed in the Age of AI Angela Yu (Udemy 강의) · Attention Is All You Need Vaswani et al. (2017)
참고: Transformer Explainer Georgia Tech Polo Club · The Illustrated Transformer Jay Alammar