콘텐츠로 이동
Study Note강화학습

18. 용어 사전

각 장 첫머리 상자에서 흩어져 나온 말들을 주제별로 다시 모은다

이 장의 사용법3개
묶음
기본 개념 → 알고리즘 → 학습·평가 → 로봇 → 트레이딩 순서다. 덱의 진행 순서와 같다.
장 열
각 항목 오른쪽은 그 말이 실제로 쓰이는 장이다. 뜻만 필요하면 여기서, 맥락이 필요하면 그 장으로 간다.
기호
수식 기호는 맨 아래 표에 모았다. 이 사이트에는 수식 렌더러가 없어 백틱과 코드 블록으로 적는다.
용어풀 이름뜻장
강화학습Reinforcement Learning정답 대신 점수(보상) 로 배우는 방식0
에이전트 · 환경Agent · Environment행동하는 쪽과 반응하는 쪽. 둘의 왕복이 유일한 데이터원0
MDPMarkov Decision Process문제를 적는 표준 양식 — S, A, P, R, γ2
마르코프 성질Markov Property“지금 상태가 미래 예측에 필요한 정보를 담는다”. 관측·이력으로 근사할 수 있지만 보장되지는 않는다2
POMDPPartially Observable MDP상태를 다 못 보는 경우. 현실 문제는 대부분 여기2
정책Policy · π“이 상태에서 무엇을 하나”. 학습의 최종 산출물2
리턴Return · G앞으로 받을 보상을 할인해 다 더한 값2
할인율Discount Factor · γ미래를 얼마나 쳐 줄지. 시야 길이 1/(1−γ)2
terminated · truncated—과제 정의상 끝과 과제 밖 사유로 잘림의 구분. 관측 가능한 고정 horizon은 전자일 수 있다2 · 9
가치 함수Value · V(s)이 자리가 얼마나 좋은가3
행동 가치Action Value · Q(s,a)이 자리에서 이 행동이 얼마나 좋은가3
벨만 방정식Bellman Equation가치를 “지금 보상 + 다음 가치” 로 쓴 재귀3
TD 학습Temporal Difference한 스텝만 가 보고 추정을 고치는 것3
부트스트래핑Bootstrapping추정치로 추정치를 고치는 것. 빠르지만 불안정3
어드밴티지Advantage · A(s,a)Q − V. 평균보다 얼마나 나은가 — 실질적 학습 신호5
GAEGeneralized Advantage Estimation여러 n-스텝을 λ로 섞은 어드밴티지 추정3 · 6
탐색과 활용Exploration / Exploitation새로 시도할까, 아는 최선을 할까3
on-policy · off-policy—지금 정책의 데이터로만 배우는가, 남의 데이터도 되는가3
공로 배분Credit Assignment좋은 결과가 어느 행동 덕인지 나누는 일1
밴딧Multi-Armed Bandit다음 상태가 없는 단발 선택 문제1
알고리즘갈래한 줄행동정책장
Q러닝가치벨만 최적 방정식을 TD로이산off4
SARSA가치실제로 한 행동으로 배운다이산on4
DQN가치Q러닝 + 신경망 + 재생 버퍼 + 타깃망이산off4
Double DQN가치고르기와 평가를 분리해 과대추정을 잡는다이산off4
REINFORCE정책좋았던 행동의 확률을 올린다둘 다on5
A2C액터-크리틱어드밴티지로 분산을 줄인다둘 다on5
PPO액터-크리틱확률 비율의 대리 목적을 잘라 큰 변화의 유인을 줄임둘 다on6
TD3액터-크리틱쌍둥이 크리틱 + 지연 갱신 + 타깃 평활화연속off6
SAC액터-크리틱보상 + 엔트로피를 같이 키운다연속off6
BC모방시연을 지도학습으로 흉내둘 다—7 · 16
CQL오프라인못 본 행동의 Q에 벌점둘 다오프라인7
IQL오프라인max 대신 expectile 회귀로 데이터 안 상위 행동을 강조둘 다오프라인7
Dreamer · MBPO모델 기반배운 세계 모델 안에서 연습둘 다—7
확산 정책모방행동 시퀀스를 확산 모델로 생성연속—16
상황고른다
이산 행동 + 샘플이 비싸다DQN 계열
연속 행동 + 시뮬레이터로 샘플을 대량 생산PPO
연속 행동 + 샘플이 아깝다SAC (안 되면 TD3)
새 샘플을 아예 못 뽑는다BC를 먼저 두고 오프라인 RL(IQL·CQL 등)을 비교
정답 시범을 보일 수 있다모방학습 (BC · 액션 청킹 · 확산 정책)
용어풀 이름뜻장
경험 재생Experience Replay버퍼에 쌓고 무작위로 꺼내 학습4
타깃 네트워크Target Network목표 계산용으로 얼려 둔 사본4
과대추정Overestimation Biasmax가 잡음 중 큰 값을 골라 Q가 부푸는 현상4
치명적 삼요소Deadly Triad함수 근사 + 부트스트래핑 + off-policy = 발산 위험4
클리핑ClippingPPO가 비율 밖의 추가 이득을 자르는 것. 비율·KL 상한을 보장하지는 않음6
엔트로피 보너스Entropy Bonus정책이 한쪽으로 쏠리는 것을 막는 항5
벡터 환경Vectorized Env환경 여러 개를 배치로 굴리는 것9
래퍼Wrapper관측·보상을 가공하는 얇은 층. 정규화가 여기9
SPSSteps Per Second초당 환경 스텝. 처리량 지표9
설명 분산Explained Variance크리틱이 리턴을 얼마나 맞히나. 0 근처면 무용지물9
리워드 해킹Reward Hacking보상은 최대인데 원한 일은 안 하는 해법8
보상 셰이핑Reward Shaping중간 과정에 점수를 주는 것8
잠재 기반 셰이핑Potential-Based ShapingγΦ(s') − Φ(s) 형태. 최적 정책이 안 바뀐다8
커리큘럼Curriculum쉬운 것부터 점점 어렵게. 셰이핑보다 안전8
분포 이탈Distributional Shift데이터에 없는 행동을 하려 드는 것7
OPEOff-Policy Evaluation굴려 보지 않고 정책을 평가하는 것7
IQMInterquartile Mean상하위 25%를 버린 평균. 여러 과제·실행 집계에 유용10
절제 실험Ablation부품을 빼 보며 기여를 가리는 실험10
용어풀 이름뜻장
피지컬 AIPhysical AI실제 물리 세계에서 행동하는 AI0
sim-to-real—시뮬에서 배운 정책을 실물로 옮기는 것과 그 격차14
도메인 랜덤화Domain Randomization물성치를 매번 무작위로 바꿔 견고하게 만든다14
액추에이터 모델Actuator Model모터의 실제 응답을 시뮬에 반영한 모형14
PD 제어기Proportional-Derivative목표 각도와의 차이로 토크를 내는 고전 제어기14
특권 정보Privileged Information시뮬에서만 알 수 있는 값(마찰·지형)14
교사-학생Teacher-Student특권 정보 교사 → 실물 관측만 쓰는 학생으로 증류14
시스템 식별System Identification실물을 측정해 시뮬 파라미터를 맞추는 것14
URDF · USD · MJCF—로봇 구조 기술 포맷15
모방학습Imitation Learning시연을 보고 배우는 것. 조작에서 널리 쓰임16
원격 조종Teleoperation사람이 로봇을 조종해 시연을 만드는 것16
누적 오차Compounding Error흉내 오차가 시연 밖 상태로 끌고 가 커지는 악순환16
액션 청킹Action Chunking여러 스텝의 행동을 한 번에 예측16
VLAVision-Language-Action이미지 + 언어 지시 → 로봇 행동 모델16
잔차 RLResidual RL기존 정책 출력에 RL이 보정만 더한다16
용어풀 이름뜻장
비정상성Non-stationarity전이·보상 분포가 시간에 따라 변하는 것11
신호 대 잡음비SNR예측 가능한 성분 대 잡음. 시장은 극도로 낮다11
시장 충격Market Impact내 주문이 가격을 불리하게 미는 현상11
슬리피지Slippage의도한 가격과 실제 체결가의 차이11
호가창Order Book · LOB가격별 미체결 주문 목록11
알파 소멸Alpha Decay전략이 알려지며 수익원이 사라지는 것11
미래 정보 누출Look-ahead Bias그 시점에 몰랐을 정보가 상태에 들어가는 것12
생존 편향Survivorship Bias살아남은 종목만으로 과거를 시험하는 것12
워크포워드Walk-forward학습 → 다음 기간 검증 → 창을 미는 검증 절차12
퍼지 · 엠바고Purge · Embargo학습과 검증 사이를 비워 누출을 막는 기법12
MDDMaximum Drawdown고점 대비 최대 하락폭12
샤프 지수Sharpe Ratio위험 대비 성과. 평가 지표로 쓴다12
최적 체결Optimal Execution큰 주문을 어떻게 쪼갤 것인가13
TWAP · VWAP—시간·거래량 비례 균등 분할. 기준선13
구현 부족분Implementation Shortfall결정 시점 가격 대비 실제 평균 체결가의 손실13
마켓메이킹Market Making양쪽 호가를 걸고 스프레드를 먹는 일13
재고 위험Inventory Risk원치 않게 떠안은 포지션의 가격 노출13
딥 헤징Deep Hedging비용·마찰을 넣어 헤지 비중을 학습으로13
기호읽기뜻
s · a · r—상태 · 행동 · 보상
s'에스 프라임다음 상태
π파이정책 — 상태에서 행동을 고르는 규칙(또는 그 확률 분포)
V(s) · Q(s,a)—가치 · 행동 가치
A(s,a)—어드밴티지 Q − V
G—리턴 (할인 누적 보상)
γ감마할인율. 시야 길이
α알파학습률
λ람다GAE의 편향-분산 손잡이
ε엡실론탐색 확률(ε-greedy) 또는 PPO 클립 폭
θ · w세타 · 더블유신경망 파라미터 (정책 · 가치)
δ델타TD 오차
τ타우소프트 타깃 갱신 비율, 또는 IQL의 기대분위수(expectile) 수준
E[·]기대값평균