개요
강화학습의 어려움은 알고리즘이 아니다 — 무엇을 보상으로 줄 것인가와 그걸 어디서 연습시킬 것인가다
지도학습은 정답이 붙은 데이터를 준다. 강화학습에는 정답이 없다. 해 보고, 점수를 받고, 그 점수가 좋아지는 쪽으로 행동을 바꾸는 것이 전부다. 그래서 문제는 “어떤 모델을 쓰나”가 아니라 “점수를 뭐로 주지”, 그리고 “몇 백만 번 시행착오를 어디서 하지” 로 옮겨 간다.
이 덱은 그 두 질문을 축으로 강화학습의 이론 → 실전 → 두 응용을 관통한다. 응용 둘은 겉보기에 멀지만, 강화학습 관점에서는 정확히 반대편에 있는 한 쌍이라 같이 둔다.
| 로봇 (피지컬 AI) | 시스템 트레이딩 | |
|---|---|---|
| 연습장(시뮬레이터) | 관련 동역학을 근사할 수 있다 | 시장 반응까지 충실하게 만들기 어렵다 |
| 그래서 쓰는 방법 | 대량 병렬 시뮬에서 PPO 등을 비교 | 과거 로그 중심의 오프라인 RL + 보수적 검증 |
| 진짜 적 | sim-to-real — 시뮬에서 되던 게 실물에서 안 된다 | 과최적화 — 백테스트에서 되던 게 내일 안 된다 |
| 공개 사례 | 보행 sim-to-real과 조작 모방학습 사례가 활발 | 전자 체결 산업 사례가 있고, 장기 방향 매매는 검증 난도가 높다 |
이 대비가 이 덱의 뼈대다. 같은 알고리즘이 왜 한쪽에서는 주력이고 다른 쪽에서는 쓰이지 않는지가 매 장에서 다시 나온다.
수학은 직관까지만 판다 — 증명과 수렴 정리는 없고, 식은 나올 때마다 “이 식이 하는 말”을 한국어 한 문장으로 붙인다. 파이썬과 신경망 기초(층·손실·경사하강)는 전제하지만 강화학습 경험은 전제하지 않는다.
도구 버전과 현재성 판단은 0장에 한곳으로 모았다. 이 개요는 덱의 구조와 판정 기준만 설명한다.
첫 장부터 읽기- 17~19장마무리
직무 지형과 갖춰야 할 스택 · 학습 경로와 포트폴리오 · 용어 사전 · 전체 요약
전체를 관통하는 세 문장
섹션 제목: “전체를 관통하는 세 문장”첫째, 강화학습을 쓸지부터 판정한다. 핵심 질문은 셋이다 — 결정이 여러 번 이어지고 · 지금 행동이 미래 상태·선택지를 바꾸며 · 행동 순서 전체를 채점할 수 있는가. 지연 보상은 필수조건이 아니라 이 얽힘을 어렵게 만드는 대표 특성이다. 순차적 결합이 약하면 지도학습이나 수학적 최적화가 대개 더 싸고 검증하기 쉽다. “예측해서 사고팔면 되는” 문제는 사실 예측 문제이지 강화학습 문제가 아니다 (1장).
둘째, 에이전트는 시킨 대로 하지 않고 준 대로 한다. 보상을 “수익률”로 주면 레버리지를 최대로 당기고, “빨리 가라”고 주면 넘어져서 굴러간다. 실패의 대부분은 알고리즘이 아니라 보상 함수와 종료 조건에서 나온다 (8장).
셋째, 샘플 하나의 가격이 방법을 정한다. 시뮬레이터에서 대량 병렬 수집이 가능하면 on-policy(PPO) 가 강한 출발점이 된다. 샘플이 비싸거나 아예 새로 못 뽑으면(실물 로봇, 시장) off-policy와 오프라인 RL로 가고, 그 순간 “데이터에 없는 행동을 과대평가하는” 완전히 다른 싸움이 시작된다 (6장 · 7장).
참고 자료
섹션 제목: “참고 자료”- Reinforcement Learning: An Introduction, 2판 — 덱 전체의 이론 기준
- Gymnasium 공식 문서 — 이 덱에서 사용하는 환경 API