콘텐츠로 이동
Study Note강화학습

1. 왜 강화학습인가 — 그리고 언제 쓰면 안 되나

강화학습을 아는 것보다 안 써도 되는 문제를 알아보는 것이 먼저다

이 장에서 처음 나오는 말6개
지도학습Supervised Learning
입력마다 정답이 붙은 데이터로 배우는 방식. 정답을 누가 달아 주느냐가 전제다.
보상Reward · r
행동 뒤에 환경이 주는 점수 하나. "무엇이 정답인지"가 아니라 "얼마나 좋았는지"만 알려 준다.
지연 보상Delayed Reward
지금 한 행동의 결과가 한참 뒤에 나타나는 것. 어느 행동 덕이었는지 가려내는 문제(공로 배분)를 만든다.
공로 배분Credit Assignment
좋은 결과가 나왔을 때 여러 행동 중 무엇 덕분인지를 나누는 일. 강화학습이 어려운 근본 이유다.
밴딧Multi-Armed Bandit
한 번 고르고 바로 점수를 받는 문제. 다음 상태가 없다 — 강화학습의 가장 단순한 사촌이다.
MPCModel Predictive Control · 모델 예측 제어
시스템의 수식 모델을 알 때 매 순간 앞을 내다보고 최적 입력을 계산하는 제어 기법. 학습 없이 잘 돌아간다면 RL이 필요 없다.

문제 — 정답을 적어 줄 수 없는 일들

섹션 제목: “문제 — 정답을 적어 줄 수 없는 일들”

지도학습은 이렇게 쓴다. 사진에 “고양이”를 붙이고, 문장에 “긍정”을 붙이고, 모델이 그 짝을 외우게 한다. 정답을 사람이 적어 줄 수 있다는 것이 전제다.

그런데 이런 일에는 그 전제가 없다.

일정답을 적어 보려 하면
로봇 팔로 컵을 집기관절 7개의 각도를 매 20ms마다 사람이 적어 줄 수 없다
100만 주를 하루에 걸쳐 파는 순서“이 순간 몇 주”의 정답이 없다. 다 팔고 나서야 잘했는지 안다
데이터센터 냉각기 밸브 조절지금 여는 게 옳은지는 30분 뒤 온도를 봐야 안다
게임에서 이기기한 수 한 수의 정답이 없다. 결과는 300수 뒤 승패뿐

공통점이 셋이다. 정답 대신 점수만 있고, 여러 행동의 결과가 뒤에서 얽혀 나타나고, 무엇보다 내가 한 행동이 다음에 마주칠 상황을 바꾼다.

마지막 것이 특히 지독하다. 지도학습에서는 내 예측이 데이터를 바꾸지 않는다. 고양이 사진을 잘못 맞혀도 다음 사진은 그대로 온다. 하지만 로봇이 왼쪽으로 가면 앞으로 볼 세상 전체가 왼쪽 것이 된다. 대량 매도 주문을 내면 다음 호가가 내려가 있다.

데이터셋 (고정)
(x₁, y₁), (x₂, y₂), … , (xₙ, yₙ)
↓
모델이 x → y 를 맞히게 학습
↓
틀린 만큼 손실. 정답과의 거리가 바로 신호다

데이터가 먼저 있고 모델이 나중에 온다. 모델이 뭘 하든 데이터셋은 안 변한다.

이 셋은 RL의 수학적 정의가 아니라 실무 판정 질문이다. 순차적 결정과 행동 간 결합이 강하고 전체 행동을 채점할 수 있을수록 RL 후보가 된다. 지연 보상은 필수조건이 아니라 학습을 어렵게 만드는 대표 특성이다.

조건뜻빠지면 대신 쓸 것
① 순차적 결정한 번이 아니라 연달아 결정한다한 번뿐이면 → 밴딧 · 지도학습
② 행동 간 결합지금 행동이 다음 상태·선택지를 바꿔 뒤 결정과 얽힌다독립 채점 가능하면 → 밴딧·예측 + 최적화
③ 보상을 정의할 수 있다행동 순서 전체의 좋고 나쁨을 수치로 매길 수 있다못 매기면 → 시연·보상 모델·문제 재정의
순차적 결정인가·행동이 미래를 바꾸는가·전체를 채점할 수 있는가·수식 모델을 아는가·시행착오를 어디서 하는가 다섯 질문으로 강화학습을 쓸지 판정하는 분기도

이 그림의 마지막 갈래가 이 덱의 두 응용을 정확히 가른다 — 로봇은 왼쪽(시뮬레이터), 트레이딩은 가운데(로그) 로 간다.

경계에 있는 방법들이다. 이 중 하나로 되면 그걸 쓴다.

방법무엇강화학습과의 차이언제
밴딧여러 선택지 중 하나를 골라 즉시 보상다음 상태가 없다. 훨씬 쉽고 이론도 탄탄A/B 대체, 소재·가격 선택
맥락 밴딧밴딧 + 상황(사용자 정보)마찬가지로 상태 전이가 없다추천, 광고
예측 + 최적화미래를 예측하고 그 위에서 계획을 푼다학습이 행동에 반응하지 않는다수요예측+재고, 경로 최적화
MPC · 최적 제어수식 모델로 앞을 내다보며 계산모델을 안다는 전제. 학습이 없다드론·공정 제어. 되면 이게 낫다
모방학습사람 시연을 지도학습으로 따라한다보상 함수가 필요 없다시연을 모을 수 있을 때 (16장)
진화 알고리즘정책을 무작위로 흔들어 좋은 것만 남긴다경사(gradient)를 안 쓴다파라미터가 적고 시뮬이 빠를 때

쓰기로 했다면 이 비용을 받아들이는 것이다. 미리 알고 시작하는 것과 아닌 것의 차이가 크다.

항목실제로 무슨 일이 생기나
샘플 수간단한 보행 하나에 수천만~수십억 스텝. 실물로는 불가능한 숫자다
불안정성같은 코드, 시드만 바꿔 돌리면 성공과 완전 실패가 갈린다 (10장)
디버깅손실이 내려가도 성능은 안 오른다. 손실 곡선이 지표가 아니다
보상 설계코드보다 오래 걸린다. 대개 여기서 실패한다 (8장)
안전학습 중 에이전트는 일부러 나쁜 짓을 해 본다. 실물·실거래에서 이건 그냥 사고다
평가“좋아졌다”를 증명하는 게 어렵다. 시드 3개로는 아무 말도 못 한다

그래도 강화학습이 이기는 자리

섹션 제목: “그래도 강화학습이 이기는 자리”

앞의 청구서를 내고도 남는 자리가 있다. 셋으로 정리된다.

자리왜 이기나예
정답은 못 쓰지만 채점은 되는 일사람이 시범을 못 보이지만, 잘했는지는 계산할 수 있다보행, 체결 단가, LLM 응답 선호
시뮬레이터가 싼 일시행착오 비용이 GPU 시간뿐이다물리 시뮬, 게임, 대기열
손으로 만든 규칙이 한계에 온 일예외 처리가 수백 개로 불어난 규칙 기반 시스템냉각 제어, 입찰

이 덱이 두 응용을 같이 두는 이유

섹션 제목: “이 덱이 두 응용을 같이 두는 이유”

로봇과 트레이딩은 도메인은 멀지만, 강화학습이 부딪히는 벽이 정확히 서로 반대다. 한쪽만 보면 “RL은 이런 것”이라는 상이 한쪽으로 기운다.

로봇은 시뮬레이터를 만들 수 있어 샘플이 싸고 sim-to-real이 벽인 반면, 트레이딩은 시뮬레이터를 못 만들어 과거 로그뿐이고 비정상성·과최적화가 벽이라는 대비

같은 PPO가 로봇에서는 1순위, 트레이딩에서는 거의 안 쓰이는 이유가 이 그림에 다 있다. 알고리즘의 우열이 아니라 샘플을 새로 뽑을 수 있느냐의 차이다.

  • 지도학습은 정답을 적어 줄 수 있다는 전제 위에 있다. 그 전제가 없는 자리가 강화학습의 자리다
  • 판정 질문은 셋 — 순차적 결정 · 행동 간 결합 · 전체 행동을 보상으로 채점할 수 있는가
  • 지연 보상 자체는 필수조건이 아니다. 행동들이 미래 상태를 통해 얽히는가가 진짜 분기점이다
  • 밴딧 · MPC · 모방학습으로 되는 문제라면 그걸 쓴다. RL은 마지막 수단에 가깝다
  • 청구서는 샘플 수 · 불안정성 · 보상 설계 · 안전 · 평가다. 손실 곡선은 지표가 아니다
  • 판정 한 줄 — 정답 시범을 보일 수 있으면 모방학습, 못 보이지만 채점되면 강화학습
  • 로봇과 트레이딩은 시뮬레이터를 만들 수 있느냐로 갈리고, 그 차이가 알고리즘 선택까지 결정한다