본문 바로가기
쪼랩 성장기/AI

지도학습·비지도학습·강화학습 차이점 완벽 정리 — 머신러닝은 이렇게 세 가지로 배운다

by ssyeon 2026. 9. 10.

머신러닝(ML)을 공부하다 보면 반드시 마주치는 세 가지 용어가 있습니다. 바로 지도학습(Supervised Learning), 비지도학습(Unsupervised Learning), 강화학습(Reinforcement Learning)입니다. 이 세 가지는 머신러닝이라는 큰 범주 안에서 "기계가 어떤 방식으로 학습하는가"에 따라 나뉘는 분류입니다. 이 글에서는 각각이 무엇을 의미하는지, 어떤 차이가 있는지를 예시와 함께 차근차근 정리해 드리겠습니다.

구분 기준은 딱 하나

지도학습, 비지도학습, 강화학습을 구분하는 기준은 본질적으로 하나입니다.

학습 과정에서 "정답"을 어떤 형태로 주느냐, 아니면 아예 주지 않느냐

  • 지도학습: 문제와 정답을 함께 줍니다.
  • 비지도학습: 문제만 주고 정답은 주지 않습니다.
  • 강화학습: 정답 대신 행동에 대한 보상과 벌점을 줍니다.

이 기준 하나만 기억하고 아래 설명을 읽으시면 훨씬 쉽게 이해하실 수 있습니다.

1. 지도학습(Supervised Learning) — 정답이 있는 문제집으로 공부하기

지도학습은 문제와 정답을 함께 제공하고, 그 둘 사이의 관계를 모델이 학습하도록 하는 방식입니다.

정답에 해당하는 데이터를 흔히 "라벨(label)"이라고 부르며, 지도학습은 라벨이 붙은 데이터를 필요로 한다는 특징이 있습니다.

 

대표적인 예시는 다음과 같습니다.

  • 스팸 메일 분류: 메일 수천 건을 준비하되, 각 메일에 "스팸" 또는 "정상"이라는 정답을 미리 붙여 둡니다. 모델은 이 데이터를 반복해서 학습하며 "이런 특징을 가진 메일은 스팸일 가능성이 높다"는 규칙을 스스로 찾아냅니다.
  • 집값 예측: 방 개수, 평수, 위치 등의 정보와 함께 실제 거래된 가격을 정답으로 제공합니다. 모델은 이 관계를 학습해 새로운 집의 가격을 예측합니다.
  • 이미지 분류: 고양이 사진에는 "고양이", 강아지 사진에는 "강아지"라는 라벨을 붙여서 학습시킵니다.

이는 정답지가 딸린 문제집으로 공부하는 것에 비유할 수 있습니다. 문제를 풀고 정답과 비교해 틀린 부분을 고쳐 나가는 과정을 반복하면서 점점 더 정확하게 맞히게 되는 방식입니다. 실무에서 활용되는 머신러닝 사례의 상당수가 이 지도학습 방식에 해당합니다.

 

2. 비지도학습(Unsupervised Learning) — 정답 없이 스스로 규칙성 찾기

비지도학습은 정답(라벨) 없이 데이터만 제공하고, 그 안에 숨어 있는 구조나 패턴을 모델이 스스로 찾아내도록 하는 방식입니다.

대표적인 예시는 다음과 같습니다.

  • 고객 세분화(클러스터링): 쇼핑몰 고객의 구매 데이터를 제공하되 "이 사람은 VIP", "이 사람은 이탈 고객"과 같은 정답은 알려 주지 않습니다. 모델은 구매 패턴을 분석해 스스로 비슷한 성향을 가진 고객끼리 몇 개의 그룹으로 묶어냅니다.
  • 이상 탐지: 정상적인 거래 데이터만 대량으로 보여 주면, 모델은 전형적인 패턴을 학습한 뒤 그 패턴에서 크게 벗어나는 데이터를 "이상 거래"로 스스로 구분해 냅니다.
  • 임베딩(Embedding): 문장이나 단어의 의미를 벡터 좌표로 변환하는 기술도 비지도학습에 해당합니다. "의미가 비슷한 문장은 가까운 좌표에, 의미가 다른 문장은 먼 좌표에 배치하라"는 규칙을 사람이 정답으로 알려 주지 않아도 모델이 스스로 학습합니다.

이는 정답지 없이 데이터 더미만 주고 그 안에서 패턴을 찾아보라고 하는 것에 비유할 수 있습니다. "정답이 무엇인가"에는 관심이 없고, "데이터 안에 어떤 구조가 숨어 있는가"를 발견하는 것이 목표입니다.

 

3. 강화학습(Reinforcement Learning) — 시행착오와 보상으로 배우기

강화학습은 정답을 직접 알려주는 대신, 행동을 하게 하고 그 결과에 따라 보상 또는 벌점을 주어 점점 더 나은 행동을 하도록 학습시키는 방식입니다.

대표적인 예시는 다음과 같습니다.

  • 알파고(AlphaGo): "이 수가 정답이다"라고 알려준 적이 없습니다. 대신 바둑을 스스로 수백만 번 두면서, 이기면 보상을 받고 지면 벌점을 받는 과정을 반복하며 점점 더 나은 수를 두는 법을 스스로 터득했습니다.
  • 로봇의 보행 학습: 로봇이 넘어지면 벌점을 주고, 앞으로 나아가면 보상을 줍니다. 수많은 시행착오를 거치며 로봇은 걷는 방법을 스스로 익히게 됩니다.
  • 거대 언어 모델(LLM)의 정렬(RLHF) 단계: ChatGPT와 같은 언어 모델을 만드는 과정에도 강화학습이 활용됩니다. 사람이 "이 답변이 저 답변보다 더 낫다"는 선호도만 알려 주면, 모델은 이 보상 신호를 바탕으로 더 선호되는 답변을 하도록 스스로 조정해 나갑니다.

이는 점수를 매기는 게임을 하며 배우는 것에 비유할 수 있습니다. 정답을 알려주는 선생님은 없지만, "잘했다(플러스 점수)" 또는 "못했다(마이너스 점수)"라고 알려주는 심판이 있고, 그 점수를 최대화하는 방향으로 스스로 시행착오를 겪으며 학습해 나가는 방식입니다.

 

세 가지 방식 한눈에 비교하기

구분 학습에 주어지는 것 학습의 목표 비유

지도학습 문제 + 정답(라벨) 문제와 정답 사이의 관계를 학습 정답지가 있는 문제집
비지도학습 문제만 제공(정답 없음) 데이터 속에 숨은 구조를 발견 정답 없는 퍼즐 맞추기
강화학습 행동에 대한 보상·벌점 보상을 최대화하는 행동을 탐색 점수를 매기는 게임

 

세 방식은 서로 배타적이지 않다

여기서 한 가지 유의할 점은, 이 세 가지 학습 방식이 서로 완전히 분리되어 사용되는 것은 아니라는 사실입니다. 실제로 하나의 모델을 만드는 과정에서 여러 방식이 함께 활용되는 경우가 많습니다.

 

대표적인 예가 거대 언어 모델(LLM)입니다. LLM을 만드는 과정에는 "질문과 좋은 답변" 쌍으로 대화 형식을 가르치는 지도학습 단계와, 사람의 선호도를 바탕으로 모델을 조정하는 강화학습 단계가 함께 사용됩니다. 여기에 더해, 모델이 인터넷 규모의 텍스트로 언어와 지식을 익히는 사전학습 단계에서는 사실상 비지도학습에 가까운 방식이 사용되기도 합니다.

즉, 딥러닝(신경망을 깊게 쌓는 구조)이라는 큰 틀 위에, 지도학습·비지도학습·강화학습이라는 서로 다른 "학습 방식"이 목적에 따라 조합되어 사용된다고 이해하시면 됩니다.

 

세 줄 요약

  • 지도학습은 정답이 있는 데이터로 문제와 정답의 관계를 배우는 방식입니다.
  • 비지도학습은 정답 없이 데이터만으로 숨겨진 구조나 패턴을 스스로 찾아내는 방식입니다.
  • 강화학습은 정답 대신 보상과 벌점을 통해 시행착오를 거치며 최적의 행동을 배우는 방식입니다.

이 세 가지 학습 방식의 차이를 명확히 구분해 두면, 이후 머신러닝이나 인공지능 관련 자료를 읽을 때 "지금 설명하는 모델이 어떤 방식으로 학습된 것인지" 훨씬 수월하게 파악하실 수 있을 것입니다.

반응형

댓글