머신러닝 수학 완벽 정리: 선형대수·미분 딱 2개만 직관으로 잡는 법

머신러닝 수학은 ‘전부’가 아니라 ‘핵심 2개’만 알면 됩니다. 선형대수와 미분을 증명 없이 그림과 직관으로 잡는 방법, 그리고 3Blue1Brown·공돌이의 수학정리노트로 0원에 채우는 학습 순서를 정리했어요.


머신러닝 수학, 수학과 수준으로 공부해야 한다고 생각하셨나요?

머신러닝을 시작하려면 미적분학 교재부터 다시 펴야 한다고 생각하셨다면, 그 통념이 오히려 학습을 막고 있을 가능성이 높아요. 실무에서 모델을 돌리는 데 필요한 머신러닝 수학은 생각보다 좁고, 그마저도 수식 증명이 아니라 ‘이 개념이 어디에 쓰이는지’ 아는 직관이 먼저거든요. 저도 처음엔 수학책부터 샀다가 3장에서 덮은 경험이 있습니다. 😅

이 글은 머신러닝 독학 완벽 로드맵 연재의 2화입니다. 1화에서 소개한 스타 3.2k 자료집의 7단계 중 2단계 ‘수학·통계’를 실제로 어떻게 통과하는지, 필요한 최소 범위와 무료 자료 순서까지 이 글 하나로 완결되게 정리했어요.

⚡ 이 글의 핵심만 먼저 보기 (Key Takeaways)

  • 범위는 딱 2개: ML 입문에 필요한 수학은 선형대수(벡터·행렬·내적)와 미분(기울기·경사하강법)이 사실상 전부예요.
  • 데이터 = 행렬: 고객 1만 명 × 특성 20개 데이터는 그 자체로 10,000×20 행렬. 행렬을 알면 코드의 shape 에러가 읽히기 시작합니다.
  • 내적 = 유사도: 추천 시스템·RAG 검색의 핵심인 코사인 유사도는 결국 내적 하나로 설명됩니다.
  • 경사하강법 = 하산: 미분은 ‘기울기가 가장 가파른 방향’을 알려주는 나침반이고, 학습은 안개 낀 산에서 한 걸음씩 내려오는 과정이에요.
  • 비용 0원: 3Blue1Brown(유튜브) → 공돌이의 수학정리노트 → Khan Academy 순서면 교재 없이 2~3주 만에 직관을 잡을 수 있어요.
  • 당장 할 액션: 오늘 3Blue1Brown ‘Essence of Linear Algebra’ 1편(10분)만 보세요. 행렬을 보는 눈이 달라집니다.

📌 목차

  1. ML에 진짜 쓰이는 수학, ‘최소 생존셋’
  2. 벡터·행렬: 데이터가 표가 되는 순간
  3. 미분·기울기: 경사하강법은 산에서 내려오기
  4. 0원으로 직관 잡는 3단계 학습 순서
  5. 이런 분들께 적극 추천합니다
  6. 자주 묻는 질문 (FAQ)

1. ML에 진짜 쓰이는 수학, ‘최소 생존셋’

대학 수학 커리큘럼을 기준으로 잡으면 미적분학·선형대수·확률통계·해석학까지 끝이 없어요. 하지만 모델을 이해하고 돌리는 데 실제로 반복 등장하는 개념은 놀랄 만큼 좁습니다. 여기서 핵심이 있어요. 증명이 아니라 ‘역할’을 아는 것이 목표라는 점이에요.

① Minimum Survival Set — 이것만 알면 일단 굴러갑니다

개념 ML에서의 역할 깊이
벡터·행렬 데이터와 가중치의 표현 방식 연산 규칙 + 그림 직관
내적 유사도 계산, 뉴런의 가중합 기하학적 의미까지
미분·기울기 손실을 줄이는 방향 찾기 ‘순간 변화율’ 개념까지
연쇄법칙 역전파의 원리 ‘겹친 함수는 곱한다’ 정도
확률·통계 평가 지표, 분포 이해 다음 화에서 별도 정리

🛠️ 실전 학습 루틴:
위 표에서 확률·통계를 뺀 상위 4개만 목표로 잡으세요. 각 개념을 ‘증명’하려 들지 말고, 3Blue1Brown 영상으로 그림 직관을 잡은 뒤 numpy로 한 번 실행해 보는 것까지가 한 사이클입니다. 이 글의 다음 섹션들이 정확히 그 순서(직관 영상 → Colab 코드)로 이어져요.

② Just-in-Time Learning — 필요할 때 되돌아와 채우기

수학을 ‘선수과목’으로 두고 완주한 뒤 ML을 시작하는 전략은 대부분 수학 단계에서 이탈로 끝나요. 반대로 모델을 먼저 만지다가 “이 개념이 왜 필요하지?”라는 질문이 생겼을 때 되돌아와 채우는 방식이 기억에도 훨씬 오래 남더라고요. 이 글의 모든 섹션은 그 ‘되돌아올 지점’으로 쓰시면 됩니다.

🛠️ 실전 학습 루틴:
먼저 numpy·sklearn으로 코드를 돌려보다가 막히는 지점이 생기면, 그때 해당 개념의 3Blue1Brown 영상 한 편을 찾아보세요. ‘왜 필요한지’ 아는 상태에서 보는 영상은 흡수율이 다릅니다. 아래 각 개념 옆에 Colab 실습 코드를 붙여 뒀으니 ‘되돌아올 지점’으로 쓰세요.


2. 벡터·행렬: 데이터가 표가 되는 순간

선형대수가 어렵게 느껴지는 이유는 ‘숫자 배열의 계산 규칙’으로만 배웠기 때문이에요. 머신러닝 수학에서 행렬은 계산 대상이 아니라 데이터 그 자체입니다.

① Data as Matrix — 엑셀 표가 곧 행렬이에요

고객 10,000명의 나이·구매액·방문횟수 등 특성 20개를 기록한 엑셀 표. 이게 바로 10,000×20 행렬입니다. 행(row) 하나가 고객 한 명의 벡터, 즉 ‘20차원 공간의 한 점’이에요. 비슷한 고객은 이 공간에서 가까이 모여 있고, 클러스터링·분류는 결국 이 점들을 나누는 작업입니다.

고객1 → [34, 120000, 5, ...]   ← 벡터 (공간의 한 점)
고객2 → [29,  98000, 7, ...]
...
전체  → 10,000 x 20 행렬 (X.shape = (10000, 20))

🛠️ Colab에서 직접 확인:
Google Colab을 열고 아래 몇 줄만 실행해 보세요. shape가 ‘행 = 샘플, 열 = 특성’으로 찍히는 걸 눈으로 보면 pandas의 df.shape나 numpy 브로드캐스팅 에러가 훨씬 잘 읽힙니다.

import numpy as np
X = np.array([[34, 120000, 5],
              [29,  98000, 7]])
print(X.shape)   # (2, 3) → 샘플 2명, 특성 3개
print(X[0])      # 고객1 벡터: [   34 120000     5]

② Dot Product — 내적은 ‘닮은 정도’를 재는 자

내적은 두 벡터가 같은 방향을 얼마나 향하는지 재는 도구예요. 방향이 비슷하면 큰 양수, 직각이면 0, 반대면 음수. 이걸 길이로 나눠 정규화한 게 코사인 유사도이고, 추천 시스템의 ‘비슷한 상품’, RAG의 ‘관련 문서 검색’, 임베딩 비교가 전부 이 하나의 연산 위에 서 있습니다. 이게 생각보다 중요한 이유가 있어요. 요즘 가장 뜨거운 벡터 DB·시맨틱 검색의 수학적 본질이 고등학교 때 배운 내적이라는 거죠. 🙂

🛠️ Colab에서 직접 확인:
내적과 코사인 유사도는 numpy로 두세 줄이면 계산됩니다. 방향이 비슷한 벡터일수록 유사도가 1에 가까워지는 걸 직접 찍어 보면 ‘내적 = 닮은 정도’가 손에 잡혀요. RAG·추천의 검색이 바로 이 연산입니다.

import numpy as np
a = np.array([1, 2, 3])
b = np.array([2, 4, 6])   # a와 같은 방향
print(a @ b)              # 행렬곱/내적: 28
print(np.dot(a, b))       # @ 와 동일
cos = a @ b / (np.linalg.norm(a) * np.linalg.norm(b))
print(round(cos, 3))      # 1.0 → 방향 완전 일치
머신러닝 수학 개념이 적힌 칠판 이미지

3. 미분·기울기: 경사하강법은 산에서 내려오기

모델 ‘학습’의 정체는 단순합니다. 손실(오차)이라는 산에서 가장 낮은 골짜기를 찾아 내려오는 것. 미분은 이때 발밑의 경사를 재는 도구예요.

① Gradient Descent — 안개 낀 산에서 하산하는 법

안개가 짙어 정상도 골짜기도 안 보이는 산에 서 있다고 상상해 보세요. 할 수 있는 건 발밑 경사를 확인하고, 가장 가파르게 내려가는 방향으로 한 걸음 딛는 것뿐. 이걸 반복하면 언젠가 낮은 곳에 도착합니다. 여기서 발밑 경사 = 기울기(gradient), 보폭 = 학습률(learning rate), 걸음 반복 = 에폭이에요. 경사하강법 수식 전체가 이 비유 하나로 번역됩니다.

🛠️ Desmos로 시각화하기:
무료 그래프 도구 Desmosy = x^2를 입력하고 한 점의 접선 기울기를 슬라이더로 움직여 보세요. 골짜기(최솟값)에 가까워질수록 기울기가 0에 수렴하는 게 보입니다. 이게 경사하강법이 멈추는 지점이에요. GeoGebra로도 같은 실습이 가능합니다.

② Chain Rule — 역전파는 ‘책임 소재 나누기’

딥러닝의 역전파(backpropagation)는 연쇄법칙의 반복 적용이에요. 직관은 이렇습니다. 최종 오차라는 결과에 대해 “각 층의 가중치가 얼마나 책임이 있는가”를 출력층에서 입력층 방향으로 거슬러 올라가며 배분하는 것. 겹쳐진 함수의 기울기는 각 단계 기울기의 곱이라는 것만 알면, 증명 없이도 프레임워크의 loss.backward()가 무슨 일을 하는지 설명할 수 있어요.

🛠️ 직관만 잡고 넘어가기:
연쇄법칙 증명을 붙들 필요 없어요. ‘겹친 함수의 기울기 = 각 단계 기울기의 곱’이라는 한 줄만 기억하면, 1보다 작은 수를 수십 번 곱해 0에 가까워지는 ‘기울기 소실’ 현상과 그 해법(ReLU·잔차 연결)까지 자연스럽게 연결됩니다. 3Blue1Brown의 ‘신경망(Neural networks)’ 시리즈가 이 그림을 애니메이션으로 보여줘요.


4. 0원으로 직관 잡는 3단계 학습 순서

교재나 유료 강의 없이, 순서만 지키면 2~3주 안에 위 개념 전부를 잡을 수 있어요. 1화 자료집(스타 3.2k)에서도 수학 단계의 1순위로 꼽힌 조합입니다.

1) 3Blue1Brown — 직관의 뼈대 세우기 (유튜브 무료)

Essence of Linear Algebra(16편)와 Essence of Calculus(12편)를 순서대로 보세요. 행렬 곱을 ‘공간의 변환’으로 보여주는 애니메이션은 수식 100줄보다 강력합니다. 한글 자막이 지원되고, 편당 10~15분이라 출퇴근 시간에도 충분해요.

🛠️ 추천 시청 순서:
전편을 순서대로 다 볼 필요는 없어요. 선형대수의 본질은 1편(벡터) → 3편(선형변환과 행렬) → 4편(행렬곱) → 9편(내적) 순으로 보면 ML에 바로 쓰이는 개념이 먼저 잡힙니다. 미적분의 본질은 1편(도함수의 의미) → 2~3편(멱법칙·연쇄법칙)만 봐도 경사하강법 직관에는 충분해요. 하루 2편이면 부담 없습니다.

2) 공돌이의 수학정리노트 — 한국어로 빈틈 메우기 (블로그 무료)

영상으로 잡은 직관을 글로 한 번 더 굳히는 단계예요. 고유값, 특이값 분해(SVD), 경사하강법 등 ML에 바로 연결되는 주제를 그림과 함께 한국어로 설명해서, 3Blue1Brown에서 놓친 부분을 정확히 보충해 줍니다. 애니메이션 시각화도 함께 제공돼요.

🛠️ 이렇게 쓰세요:
3Blue1Brown에서 ‘고유값’이나 ‘SVD’가 흐릿하게 남았다면, 공돌이의 수학정리노트에서 같은 키워드를 검색해 한국어 설명 + 시각화로 한 번 더 굳히세요. 영상 → 한국어 글 순서로 겹쳐 보는 게 직관을 오래 남기는 핵심이에요.

3) Khan Academy — 연습 문제로 손에 익히기 (무료)

직관만 있고 손이 안 움직이면 코드 앞에서 다시 막혀요. Khan Academy의 선형대수·미분 코스에서 기초 연산 문제만 골라 풀어보세요. 전 과정 완주는 불필요합니다. 행렬 곱셈, 간단한 도함수 계산 정도면 충분해요.

🛠️ 실전 마무리:
손으로 몇 문제 푼 뒤엔 곧바로 numpy로 같은 연산을 재현해 보세요. 행렬곱은 A @ B, 내적은 np.dot, 도함수 근사는 np.gradient. 손계산과 코드 결과가 일치하는 걸 확인하는 순간 수학과 코드가 처음으로 연결됩니다.


5. 이런 분들께 적극 추천합니다

  • 수학이 무서워 머신러닝 입문을 미루고 있는 비전공 직장인
  • sklearn·pandas는 쓰지만 원리는 설명 못 하는 주니어 데이터 분석가
  • RAG·임베딩을 다루면서 코사인 유사도의 의미가 궁금했던 백엔드 개발자
  • ML 면접에서 ‘경사하강법 설명’ 질문에 막혔던 취업 준비생
  • 자녀·팀원에게 AI 원리를 비유로 설명하고 싶은 기획자·관리자
  • 수학 교재를 사놓고 3장에서 멈춘 경험이 있는 모든 독학러

6. 자주 묻는 질문 (FAQ)

Q. 고등학교 수학도 다 잊어버렸는데 가능할까요?

A. 처음부터 다시 배워야 하는 건 아닙니다. 3Blue1Brown은 사전 지식 없이 그림으로 시작하도록 설계돼 있어요. 벡터 덧셈 → 내적 → 행렬 순서로 영상을 따라가고, 막히는 지점에서만 Khan Academy로 내려가 채우면 됩니다. ‘다 잊었다’는 상태가 오히려 잘못된 암기 습관 없이 직관부터 쌓기 좋은 조건이기도 해요.

Q. 통계는 안 해도 되나요?

A. 이 글에서 뺀 건 ‘안 중요해서’가 아니라 ‘단계가 달라서’예요. 선형대수·미분이 모델의 작동 원리라면, 통계는 모델의 평가와 해석에 쓰입니다. 입문 순서상 이 글의 범위를 먼저 잡고, p-value·분포·베이즈는 다음 화에서 같은 방식(직관 우선)으로 정리할 예정이에요.

Q. 수식 증명은 정말 영영 안 봐도 되나요?

A. 연구자가 목표라면 언젠가 필요합니다. 하지만 그 시점은 ‘논문을 읽다가 막혔을 때’이지 ‘입문 첫 주’가 아니에요. 실무 적용·포트폴리오·서비스 개발이 목표라면 이 글의 직관 수준으로 충분히 오래 갈 수 있고, 증명이 필요해지는 순간엔 이미 직관이 있어서 훨씬 빠르게 이해됩니다.


✍️ 글을 마치며

머신러닝 수학의 진입 장벽은 양이 아니라 순서였다고 생각해요. 증명부터 시작하면 3장에서 멈추지만, ‘데이터는 행렬이고, 학습은 하산’이라는 그림부터 잡으면 나머지는 필요할 때 채우면 되는 각주가 됩니다.

저는 오늘 퇴근길에 3Blue1Brown 선형대수 1편부터 다시 볼 것 같아요. 알던 내용도 이 채널로 다시 보면 새로운 그림이 하나씩 생기더라고요.

여러분은 수학의 어느 지점에서 막히셨었나요? 댓글로 자유롭게 의견 남겨주세요! 😊

댓글 남기기