머신러닝을 공부하다 보면 가장 먼저 배우는 개념 중 하나가 지도학습(Supervised Learning)과 비지도학습(Unsupervised Learning)이다. 이름만 보면 어렵게 느껴질 수 있지만, 두 방식의 핵심 차이는 생각보다 단순하다.
쉽게 말해 정답을 알고 학습하는가, 아니면 정답 없이 스스로 규칙을 찾는가의 차이다. 이 개념을 이해하면 다양한 머신러닝 알고리즘이 어떤 문제를 해결하기 위해 만들어졌는지 자연스럽게 연결된다.
필자도 처음에는 두 용어를 외우는 데 집중했지만, 간단한 예제를 직접 실행해 보면서 각각의 활용 방식이 완전히 다르다는 점을 알게 되었다. 이번 글에서는 지도학습과 비지도학습의 특징, 대표 알고리즘, 실제 활용 사례를 함께 살펴보자.
지도학습이란 무엇일까?
지도학습은 입력 데이터와 정답(Label)을 함께 제공하여 모델을 학습시키는 방법이다.
예를 들어 학생들의 공부 시간과 시험 점수를 이용해 합격 여부를 예측한다고 가정해 보자.
| 공부 시간 | 합격 여부 |
|---|---|
| 2시간 | 불합격 |
| 4시간 | 합격 |
| 6시간 | 합격 |
| 1시간 | 불합격 |
이처럼 이미 정답이 포함된 데이터를 사용하면 모델은 입력과 결과의 관계를 학습하게 된다.
학습이 끝난 뒤에는 새로운 학생의 공부 시간을 입력했을 때 합격 가능성을 예측할 수 있다.
지도학습은 "정답을 맞히는 연습"을 반복한다고 생각하면 이해하기 쉽다.
지도학습의 대표적인 문제
지도학습은 크게 두 가지 유형으로 나뉜다.
분류(Classification)
결과가 정해진 범주 가운데 하나인 경우이다.
예를 들면 다음과 같다.
- 스팸 메일인지 아닌지
- 정상 거래인지 이상 거래인지
- 고양이인지 강아지인지
- 질병 여부 예측
즉, 결과가 "예" 또는 "아니오", 혹은 여러 종류 중 하나로 결정된다.
회귀(Regression)
숫자를 예측하는 문제이다.
대표적인 예는 다음과 같다.
- 아파트 가격 예측
- 판매량 예측
- 기온 예측
- 매출 예측
분류와 달리 결과가 연속적인 숫자로 표현된다.
비지도학습이란 무엇일까?
비지도학습은 정답이 없는 데이터를 사용한다.
모델은 데이터를 스스로 분석하면서 비슷한 특징을 가진 것끼리 묶거나 숨겨진 패턴을 찾아낸다.
예를 들어 고객 정보만 있다고 가정해 보자.
| 나이 | 구매 금액 |
|---|---|
| 20 | 3만 원 |
| 21 | 4만 원 |
| 45 | 25만 원 |
| 47 | 28만 원 |
정답은 없지만 모델은 비슷한 고객끼리 자동으로 그룹을 만들 수 있다.
이를 통해 기업은 고객 유형을 분석하거나 마케팅 전략을 세우는 데 활용할 수 있다.
비지도학습의 대표 알고리즘
가장 많이 사용되는 알고리즘은 군집화(Clustering)이다.
대표적으로 다음과 같은 알고리즘이 있다.
- K-Means
- DBSCAN
- 계층적 군집화
군집화는 데이터의 공통점을 찾아 그룹을 만드는 데 활용된다.
또 다른 대표 기법은 차원 축소(Dimensionality Reduction)이다.
대표 알고리즘은 다음과 같다.
- PCA
- t-SNE
- UMAP
차원 축소는 복잡한 데이터를 단순하게 표현하거나 시각화할 때 자주 사용된다.
지도학습과 비지도학습의 차이
두 방법을 비교하면 다음과 같다.
| 구분 | 지도학습 | 비지도학습 |
|---|---|---|
| 정답(Label) | 있음 | 없음 |
| 목적 | 예측 | 패턴 발견 |
| 활용 | 분류, 회귀 | 군집화, 차원 축소 |
| 예시 | 이메일 분류 | 고객 그룹 분석 |
핵심은 정답 데이터의 존재 여부다.
실제 활용 사례
지도학습
지도학습은 이미 정답이 있는 데이터를 기반으로 미래를 예측하는 데 적합하다.
활용 사례는 다음과 같다.
- 스팸 메일 분류
- 음성 인식
- 상품 추천
- 신용카드 이상 거래 탐지
- 이미지 분류
최근 생성형 AI에서도 일부 학습 과정에는 지도학습이 활용된다.
비지도학습
비지도학습은 데이터 속 숨겨진 구조를 이해하는 데 활용된다.
대표적인 사례는 다음과 같다.
- 고객 유형 분석
- 쇼핑 패턴 분석
- 뉴스 기사 분류
- 이미지 그룹화
- 데이터 압축
정답이 없는 데이터를 분석해야 하는 상황에서 강력한 도구가 된다.
어떤 방법을 먼저 배워야 할까?
AI 입문자라면 지도학습을 먼저 공부하는 것이 이해하기 쉽다.
그 이유는 다음과 같다.
- 결과를 확인하기 쉽다.
- 정확도를 계산할 수 있다.
- 예제가 많다.
- 실습 자료가 풍부하다.
지도학습을 충분히 이해한 뒤 비지도학습을 배우면 데이터 분석의 폭이 훨씬 넓어진다.
지도학습과 비지도학습을 함께 사용하는 경우도 많다
실제 프로젝트에서는 두 방법을 함께 사용하는 경우도 적지 않다.
예를 들어 고객 데이터를 군집화하여 비슷한 그룹을 찾은 뒤, 각 그룹의 구매 여부를 지도학습으로 예측할 수 있다.
또는 차원 축소를 통해 데이터를 정리한 뒤 분류 모델을 학습시키는 방법도 자주 활용된다.
즉, 두 기술은 경쟁 관계가 아니라 서로를 보완하는 관계라고 이해하는 것이 좋다.
초보자가 자주 헷갈리는 부분
처음 머신러닝을 공부할 때 다음과 같은 오해를 하기 쉽다.
- 딥러닝은 지도학습만 사용한다고 생각한다.
- 비지도학습은 활용도가 낮다고 생각한다.
- 정확도가 없으면 의미 없는 모델이라고 생각한다.
하지만 실제 AI 프로젝트에서는 데이터의 특성과 목적에 따라 적절한 학습 방법을 선택하는 것이 가장 중요하다.
마무리
지도학습과 비지도학습은 머신러닝의 가장 기본적인 개념이다. 지도학습은 정답을 이용해 미래를 예측하는 데 강점을 가지며, 비지도학습은 정답 없이 데이터 속 숨겨진 패턴을 발견하는 데 활용된다.
두 방법 모두 AI 프로젝트에서 중요한 역할을 하며, 문제의 성격에 따라 적절하게 선택하거나 함께 사용하는 경우도 많다. 이 개념을 이해하면 앞으로 배우게 될 다양한 머신러닝 알고리즘도 훨씬 쉽게 받아들일 수 있다.
다음 글에서는 AI 모델의 성능을 크게 좌우하는 데이터 전처리(Data Preprocessing)의 중요성과 기본 방법을 알아보겠다.
FAQ
Q1. 지도학습이 비지도학습보다 더 많이 사용되나요?
많은 예측 문제에서는 지도학습이 자주 사용되지만, 고객 분석이나 데이터 탐색처럼 정답이 없는 경우에는 비지도학습도 매우 중요한 역할을 한다.
Q2. 비지도학습은 정확도를 측정할 수 없나요?
지도학습처럼 정답과 비교하는 정확도는 사용할 수 없지만, 군집의 품질을 평가하는 다양한 지표와 분석 방법이 존재한다.
Q3. 딥러닝에도 지도학습과 비지도학습이 있나요?
있다. 대부분의 이미지 분류나 음성 인식은 지도학습을 사용하지만, 최근에는 자기지도학습(Self-Supervised Learning)과 비지도학습을 활용하는 딥러닝 기술도 활발하게 연구되고 있다.
0 댓글