원리를 제대로
MDP · 벨만 · 정책 경사까지, 왜 그 식이 그렇게 생겼는지를 안다. 논문을 읽을 때 기호에서 막히지 않을 정도까지가 목표다.
이 덱은 “강화학습이 무엇인가”보다 “이 문제에 그걸 쓸 것인가” 를 먼저 묻는다
RLReinforcement Learning · 강화학습에이전트 · 환경Agent · Environment정책Policy · π스텝 · 에피소드Step · Episode피지컬 AIPhysical AIsim-to-real시뮬레이션-실물 전이강화학습을 실제로 쓰는 자리로 가려는 사람을 대상으로 한다. 구체적으로는 세 가지를 준비한다 —
원리를 제대로
MDP · 벨만 · 정책 경사까지, 왜 그 식이 그렇게 생겼는지를 안다. 논문을 읽을 때 기호에서 막히지 않을 정도까지가 목표다.
트레이딩에 적용
시장을 환경으로 놓으면 무엇이 특이한가. 어디까지가 실전에서 돌아가고 어디부터가 백테스트 착시인가 (11~13장).
피지컬 AI로 진입
로봇에서 RL이 실제로 굴러가는 이유와 그 스택 — 시뮬레이터 · 병렬 학습 · sim-to-real · 모방학습 (14~16장).
일자리 관점
이 분야의 직무가 실제로 어떻게 나뉘고, 각 자리에서 뭘 시키고, 뭘 준비해 두면 되는지 (17장).
| 전제한다 | 전제하지 않는다 |
|---|---|
| 파이썬 · NumPy | 강화학습 경험 전혀 없어도 된다 |
| 신경망 기초 — 층 · 손실 함수 · 경사하강 | PyTorch 숙련도 (코드는 읽을 수 있는 수준으로만) |
| 미분·확률의 학부 1학년 수준 감각 | 측도론 · 확률 과정 · 볼록 최적화 |
| — | 금융 지식 (11장이 필요한 만큼 준다) |
| — | 로봇 제어 이론 (14장이 필요한 만큼 준다) |
깊게 파는 것과 이름만 남기는 것을 미리 정해 둔다. 강화학습은 알고리즘 이름이 지나치게 많은 분야라, 다 훑으면 아무것도 안 남는다.
| 다룬다 | 정도 | 안 다룬다 | 이유 |
|---|---|---|---|
| MDP · 벨만 · 탐색과 활용 | 전부 | 수렴 증명 · 후회 경계 | 이 덱은 이론 교재가 아니다 |
| DQN 계열 · PPO · SAC | 실제로 쓰는 수준까지 | A3C · TRPO · Rainbow 개별 트릭 | 이름과 “언제 필요한가”만 |
| 오프라인 RL (CQL · IQL) | 개념과 함정 | 최신 변종 논문 | 두 응용 모두에 필요한 만큼 |
| 보상 설계 · 평가 · 디버깅 | 가장 두껍게 | — | 여기서 성패가 갈린다 |
| 모방학습 · VLA | 개념과 RL과의 관계 | 모델별 구조 상세 | 세대가 반년마다 바뀐다 |
| LLM 쪽 RL (RLHF · GRPO) | 직무 지형으로만 (17장) | 구현 · 실습 | 이 덱의 두 응용 축이 아니다 |
| 멀티 에이전트 · 게임 이론 | 이름만 | — | 두 응용에서 주력이 아니다 |
알고리즘 장(4~7) 은 네 단계로 고정한다. 이 순서가 이 덱의 약속이다.
| 단계 | 무엇 |
|---|---|
| ① | 앞의 방법이 어디서 막혔나 — 새 알고리즘은 항상 앞의 실패에서 나온다 |
| ② | 아이디어 한 문장 — 무엇을 바꿨나 |
| ③ | 실제 동작 — 의사코드와 그림 |
| ④ | 언제 쓰고 언제 안 쓰나 — 고르는 기준 |
응용 장(11~16) 도 네 단계로 고정한다.
| 단계 | 무엇 |
|---|---|
| ① | 이 도메인을 MDP로 놓으면 — 상태 · 행동 · 보상 표 |
| ② | 여기서만 생기는 함정 |
| ③ | 실제로 쓰이는 자리와 안 쓰이는 자리 |
| ④ | 도구와 시작점 |
이 사이트에는 수식 렌더러가 없다. 그래서 식은 코드 블록과 백틱으로 적고, 바로 아래에 그 식이 하는 말을 한국어 한 문장으로 붙인다.
Q(s,a) ← Q(s,a) + α · [ r + γ · max_a' Q(s',a') − Q(s,a) ] └──────── TD 타깃 ────────┘지금 칸에 적어 둔 점수를, “받은 보상 + 다음 칸의 최고 점수” 쪽으로 조금씩 옮긴다.
식을 못 읽어도 그 아래 문장만 읽으면 진도가 나가게 쓴다.
기호는 유니코드로 쓴다 — α(학습률) · γ(할인율) · π(정책) · θ(신경망 파라미터).
강화학습은 게임을 넘어 여러 제품·연구 시스템에 쓰이지만, 적용 범위와 공개 근거의 강도는 영역마다 다르다. 어디에 공개 사례가 있고 어디가 아직 검증하기 어려운지를 구분한다.
| 영역 | 상태 | 이 덱 |
|---|---|---|
| LLM 후처리 (RLHF · 검증 가능한 보상) | 널리 쓰임 선호·검증 보상 기반 후처리의 공개 사례가 많고 구체 레시피는 다르다 | 17장에서 직무로만 |
| 로봇 제어 (보행 · 조작) | 활발 보행 sim-to-real과 조작 모방학습의 공개 사례가 많다 | 14~16장 |
| 최적 체결 · 입찰 · 추천 | 사례 있음 공개 산업 사례가 있으나 내부 운영 근거는 제한적이다 | 13장 |
| “주가를 예측해 매매” | 검증 주의 공개 연구는 많지만 실제 운용 성과 검증이 어렵다 | 11~12장에서 왜인지 |
| 산업 제어 · 냉각 · 물류 | 사례 있음 성공 사례는 있으나 도입 장벽이 높다 | 1장 |
| 자율주행 전체를 RL로 | 아님 부분 모듈(계획·시뮬)에 쓴다 | 14장 |
이 덱이 쓰는 도구다. 버전은 아래 표에 있는 것만 신뢰한다.
| 자리 | 도구 | 성격 |
|---|---|---|
| 환경 인터페이스 | Gymnasium 1.3 | reset() / step() 규약의 사실상 표준. 옛 gym의 후계 |
| 알고리즘 구현 | Stable-Baselines3 2.9 | 검증된 구현체. 실험의 기준선을 잡을 때 |
| 알고리즘 학습용 | CleanRL | 알고리즘 하나 = 파일 하나. 읽고 고치기 위한 것 |
| 물리 시뮬레이션 | MuJoCo 3.11 | 연구·벤치마크의 기본. 무료 |
| 로봇 대규모 학습 | Isaac Lab 3.0(beta) | GPU에서 수천 개 로봇을 동시에. Isaac Sim 6.0 위 |
| 실물 로봇 · 모방학습 | LeRobot 0.6 | 데이터셋 · 정책 · 실기 제어를 한 스택으로 |
| 금융 RL | (특정 프레임워크 없음) | 아래 주의 |
2026-08-12에 공식 출처(PyPI · GitHub Releases)로 확인한 값이다.
| 항목 | 버전 | 날짜 |
|---|---|---|
| Gymnasium | 1.3.0 | 2026-04-22 |
| Stable-Baselines3 | 2.9.0 (Python ≥3.10, PyTorch ≥2.8) | — |
| MuJoCo | 3.11.0 | 2026-07-28 |
| Isaac Lab | 3.0.0 beta2 패치 (Isaac Sim 6.0.1) | 2026-07-02 |
| LeRobot | v0.6.1 | 2026-08-03 |
| Isaac GR00T | n1.7 (early access) | 2026-04-18 |
| FinRL | 0.3.7 | 2024-04-12 |
모델 이름(π0.x · GR00T N1.x 등)은 세대가 반년마다 바뀐다. 이 덱은 특정 세대에 서술을 걸지 않고 “이 자리를 채우는 물건” 으로 역할을 쓴다.