콘텐츠로 이동
Study Note강화학습

개요

강화학습의 어려움은 알고리즘이 아니다 — 무엇을 보상으로 줄 것인가와 그걸 어디서 연습시킬 것인가다

지도학습은 정답이 붙은 데이터를 준다. 강화학습에는 정답이 없다. 해 보고, 점수를 받고, 그 점수가 좋아지는 쪽으로 행동을 바꾸는 것이 전부다. 그래서 문제는 “어떤 모델을 쓰나”가 아니라 “점수를 뭐로 주지”, 그리고 “몇 백만 번 시행착오를 어디서 하지” 로 옮겨 간다.

이 덱은 그 두 질문을 축으로 강화학습의 이론 → 실전 → 두 응용을 관통한다. 응용 둘은 겉보기에 멀지만, 강화학습 관점에서는 정확히 반대편에 있는 한 쌍이라 같이 둔다.

로봇 (피지컬 AI)시스템 트레이딩
연습장(시뮬레이터)관련 동역학을 근사할 수 있다시장 반응까지 충실하게 만들기 어렵다
그래서 쓰는 방법대량 병렬 시뮬에서 PPO 등을 비교과거 로그 중심의 오프라인 RL + 보수적 검증
진짜 적sim-to-real — 시뮬에서 되던 게 실물에서 안 된다과최적화 — 백테스트에서 되던 게 내일 안 된다
공개 사례보행 sim-to-real과 조작 모방학습 사례가 활발전자 체결 산업 사례가 있고, 장기 방향 매매는 검증 난도가 높다

이 대비가 이 덱의 뼈대다. 같은 알고리즘이 왜 한쪽에서는 주력이고 다른 쪽에서는 쓰이지 않는지가 매 장에서 다시 나온다.

수학은 직관까지만 판다 — 증명과 수렴 정리는 없고, 식은 나올 때마다 “이 식이 하는 말”을 한국어 한 문장으로 붙인다. 파이썬과 신경망 기초(층·손실·경사하강)는 전제하지만 강화학습 경험은 전제하지 않는다.

도구 버전과 현재성 판단은 0장에 한곳으로 모았다. 이 개요는 덱의 구조와 판정 기준만 설명한다.

첫 장부터 읽기
  1. 0~1장시작

    범위와 기준 시점 · 2026년의 강화학습 지형 · 언제 강화학습을 쓰고 언제 안 쓰나

    이 문제가 정말 강화학습 문제인가

  2. 2~3장문제를 세우기

    MDP 다섯 요소 · 부분 관측 · 할인율 · 가치와 벨만 방정식 · 탐색과 활용

    현실을 어떻게 상태·행동·보상으로 옮기나

  3. 4~7장알고리즘

    Q러닝과 DQN · 정책 경사와 액터-크리틱 · PPO와 SAC · 오프라인 RL과 모델 기반

    무엇을 언제 고르나 — 샘플이 싼가 비싼가

  4. 8~10장실전 공통

    보상 설계와 리워드 해킹 · 학습 파이프라인과 디버깅 · 평가와 재현성

    왜 안 되는가, 그리고 잘된 걸 어떻게 아는가

  5. 11~13장시스템 트레이딩

    시장이 환경으로서 특이한 점 · 상태·행동·보상 설계와 백테스트 · 체결·마켓메이킹·배분

    어디까지가 실전이고 어디부터가 논문인가

  6. 14~16장피지컬 AI (로봇)

    연속 제어와 sim-to-real · 대규모 병렬 시뮬레이션 스택 · 모방학습과 VLA

    왜 로봇에서는 RL이 실제로 굴러가나

  7. 17~19장마무리

    직무 지형과 갖춰야 할 스택 · 학습 경로와 포트폴리오 · 용어 사전 · 전체 요약

첫째, 강화학습을 쓸지부터 판정한다. 핵심 질문은 셋이다 — 결정이 여러 번 이어지고 · 지금 행동이 미래 상태·선택지를 바꾸며 · 행동 순서 전체를 채점할 수 있는가. 지연 보상은 필수조건이 아니라 이 얽힘을 어렵게 만드는 대표 특성이다. 순차적 결합이 약하면 지도학습이나 수학적 최적화가 대개 더 싸고 검증하기 쉽다. “예측해서 사고팔면 되는” 문제는 사실 예측 문제이지 강화학습 문제가 아니다 (1장).

둘째, 에이전트는 시킨 대로 하지 않고 준 대로 한다. 보상을 “수익률”로 주면 레버리지를 최대로 당기고, “빨리 가라”고 주면 넘어져서 굴러간다. 실패의 대부분은 알고리즘이 아니라 보상 함수와 종료 조건에서 나온다 (8장).

셋째, 샘플 하나의 가격이 방법을 정한다. 시뮬레이터에서 대량 병렬 수집이 가능하면 on-policy(PPO) 가 강한 출발점이 된다. 샘플이 비싸거나 아예 새로 못 뽑으면(실물 로봇, 시장) off-policy와 오프라인 RL로 가고, 그 순간 “데이터에 없는 행동을 과대평가하는” 완전히 다른 싸움이 시작된다 (6장 · 7장).