18. 용어 사전
각 장 첫머리 상자에서 흩어져 나온 말들을 주제별로 다시 모은다
이 장의 사용법3개
묶음- 기본 개념 → 알고리즘 → 학습·평가 → 로봇 → 트레이딩 순서다. 덱의 진행 순서와 같다.
장 열- 각 항목 오른쪽은 그 말이 실제로 쓰이는 장이다. 뜻만 필요하면 여기서, 맥락이 필요하면 그 장으로 간다.
기호- 수식 기호는 맨 아래 표에 모았다. 이 사이트에는 수식 렌더러가 없어 백틱과 코드 블록으로 적는다.
기본 개념
섹션 제목: “기본 개념”| 용어 | 풀 이름 | 뜻 | 장 |
|---|---|---|---|
| 강화학습 | Reinforcement Learning | 정답 대신 점수(보상) 로 배우는 방식 | 0 |
| 에이전트 · 환경 | Agent · Environment | 행동하는 쪽과 반응하는 쪽. 둘의 왕복이 유일한 데이터원 | 0 |
| MDP | Markov Decision Process | 문제를 적는 표준 양식 — S, A, P, R, γ | 2 |
| 마르코프 성질 | Markov Property | “지금 상태가 미래 예측에 필요한 정보를 담는다”. 관측·이력으로 근사할 수 있지만 보장되지는 않는다 | 2 |
| POMDP | Partially Observable MDP | 상태를 다 못 보는 경우. 현실 문제는 대부분 여기 | 2 |
| 정책 | Policy · π | “이 상태에서 무엇을 하나”. 학습의 최종 산출물 | 2 |
| 리턴 | Return · G | 앞으로 받을 보상을 할인해 다 더한 값 | 2 |
| 할인율 | Discount Factor · γ | 미래를 얼마나 쳐 줄지. 시야 길이 1/(1−γ) | 2 |
terminated · truncated | — | 과제 정의상 끝과 과제 밖 사유로 잘림의 구분. 관측 가능한 고정 horizon은 전자일 수 있다 | 2 · 9 |
| 가치 함수 | Value · V(s) | 이 자리가 얼마나 좋은가 | 3 |
| 행동 가치 | Action Value · Q(s,a) | 이 자리에서 이 행동이 얼마나 좋은가 | 3 |
| 벨만 방정식 | Bellman Equation | 가치를 “지금 보상 + 다음 가치” 로 쓴 재귀 | 3 |
| TD 학습 | Temporal Difference | 한 스텝만 가 보고 추정을 고치는 것 | 3 |
| 부트스트래핑 | Bootstrapping | 추정치로 추정치를 고치는 것. 빠르지만 불안정 | 3 |
| 어드밴티지 | Advantage · A(s,a) | Q − V. 평균보다 얼마나 나은가 — 실질적 학습 신호 | 5 |
| GAE | Generalized Advantage Estimation | 여러 n-스텝을 λ로 섞은 어드밴티지 추정 | 3 · 6 |
| 탐색과 활용 | Exploration / Exploitation | 새로 시도할까, 아는 최선을 할까 | 3 |
| on-policy · off-policy | — | 지금 정책의 데이터로만 배우는가, 남의 데이터도 되는가 | 3 |
| 공로 배분 | Credit Assignment | 좋은 결과가 어느 행동 덕인지 나누는 일 | 1 |
| 밴딧 | Multi-Armed Bandit | 다음 상태가 없는 단발 선택 문제 | 1 |
알고리즘
섹션 제목: “알고리즘”| 알고리즘 | 갈래 | 한 줄 | 행동 | 정책 | 장 |
|---|---|---|---|---|---|
| Q러닝 | 가치 | 벨만 최적 방정식을 TD로 | 이산 | off | 4 |
| SARSA | 가치 | 실제로 한 행동으로 배운다 | 이산 | on | 4 |
| DQN | 가치 | Q러닝 + 신경망 + 재생 버퍼 + 타깃망 | 이산 | off | 4 |
| Double DQN | 가치 | 고르기와 평가를 분리해 과대추정을 잡는다 | 이산 | off | 4 |
| REINFORCE | 정책 | 좋았던 행동의 확률을 올린다 | 둘 다 | on | 5 |
| A2C | 액터-크리틱 | 어드밴티지로 분산을 줄인다 | 둘 다 | on | 5 |
| PPO | 액터-크리틱 | 확률 비율의 대리 목적을 잘라 큰 변화의 유인을 줄임 | 둘 다 | on | 6 |
| TD3 | 액터-크리틱 | 쌍둥이 크리틱 + 지연 갱신 + 타깃 평활화 | 연속 | off | 6 |
| SAC | 액터-크리틱 | 보상 + 엔트로피를 같이 키운다 | 연속 | off | 6 |
| BC | 모방 | 시연을 지도학습으로 흉내 | 둘 다 | — | 7 · 16 |
| CQL | 오프라인 | 못 본 행동의 Q에 벌점 | 둘 다 | 오프라인 | 7 |
| IQL | 오프라인 | max 대신 expectile 회귀로 데이터 안 상위 행동을 강조 | 둘 다 | 오프라인 | 7 |
| Dreamer · MBPO | 모델 기반 | 배운 세계 모델 안에서 연습 | 둘 다 | — | 7 |
| 확산 정책 | 모방 | 행동 시퀀스를 확산 모델로 생성 | 연속 | — | 16 |
고르는 기준 요약
섹션 제목: “고르는 기준 요약”| 상황 | 고른다 |
|---|---|
| 이산 행동 + 샘플이 비싸다 | DQN 계열 |
| 연속 행동 + 시뮬레이터로 샘플을 대량 생산 | PPO |
| 연속 행동 + 샘플이 아깝다 | SAC (안 되면 TD3) |
| 새 샘플을 아예 못 뽑는다 | BC를 먼저 두고 오프라인 RL(IQL·CQL 등)을 비교 |
| 정답 시범을 보일 수 있다 | 모방학습 (BC · 액션 청킹 · 확산 정책) |
학습과 평가
섹션 제목: “학습과 평가”| 용어 | 풀 이름 | 뜻 | 장 |
|---|---|---|---|
| 경험 재생 | Experience Replay | 버퍼에 쌓고 무작위로 꺼내 학습 | 4 |
| 타깃 네트워크 | Target Network | 목표 계산용으로 얼려 둔 사본 | 4 |
| 과대추정 | Overestimation Bias | max가 잡음 중 큰 값을 골라 Q가 부푸는 현상 | 4 |
| 치명적 삼요소 | Deadly Triad | 함수 근사 + 부트스트래핑 + off-policy = 발산 위험 | 4 |
| 클리핑 | Clipping | PPO가 비율 밖의 추가 이득을 자르는 것. 비율·KL 상한을 보장하지는 않음 | 6 |
| 엔트로피 보너스 | Entropy Bonus | 정책이 한쪽으로 쏠리는 것을 막는 항 | 5 |
| 벡터 환경 | Vectorized Env | 환경 여러 개를 배치로 굴리는 것 | 9 |
| 래퍼 | Wrapper | 관측·보상을 가공하는 얇은 층. 정규화가 여기 | 9 |
| SPS | Steps Per Second | 초당 환경 스텝. 처리량 지표 | 9 |
| 설명 분산 | Explained Variance | 크리틱이 리턴을 얼마나 맞히나. 0 근처면 무용지물 | 9 |
| 리워드 해킹 | Reward Hacking | 보상은 최대인데 원한 일은 안 하는 해법 | 8 |
| 보상 셰이핑 | Reward Shaping | 중간 과정에 점수를 주는 것 | 8 |
| 잠재 기반 셰이핑 | Potential-Based Shaping | γΦ(s') − Φ(s) 형태. 최적 정책이 안 바뀐다 | 8 |
| 커리큘럼 | Curriculum | 쉬운 것부터 점점 어렵게. 셰이핑보다 안전 | 8 |
| 분포 이탈 | Distributional Shift | 데이터에 없는 행동을 하려 드는 것 | 7 |
| OPE | Off-Policy Evaluation | 굴려 보지 않고 정책을 평가하는 것 | 7 |
| IQM | Interquartile Mean | 상하위 25%를 버린 평균. 여러 과제·실행 집계에 유용 | 10 |
| 절제 실험 | Ablation | 부품을 빼 보며 기여를 가리는 실험 | 10 |
로봇 (피지컬 AI)
섹션 제목: “로봇 (피지컬 AI)”| 용어 | 풀 이름 | 뜻 | 장 |
|---|---|---|---|
| 피지컬 AI | Physical AI | 실제 물리 세계에서 행동하는 AI | 0 |
| sim-to-real | — | 시뮬에서 배운 정책을 실물로 옮기는 것과 그 격차 | 14 |
| 도메인 랜덤화 | Domain Randomization | 물성치를 매번 무작위로 바꿔 견고하게 만든다 | 14 |
| 액추에이터 모델 | Actuator Model | 모터의 실제 응답을 시뮬에 반영한 모형 | 14 |
| PD 제어기 | Proportional-Derivative | 목표 각도와의 차이로 토크를 내는 고전 제어기 | 14 |
| 특권 정보 | Privileged Information | 시뮬에서만 알 수 있는 값(마찰·지형) | 14 |
| 교사-학생 | Teacher-Student | 특권 정보 교사 → 실물 관측만 쓰는 학생으로 증류 | 14 |
| 시스템 식별 | System Identification | 실물을 측정해 시뮬 파라미터를 맞추는 것 | 14 |
| URDF · USD · MJCF | — | 로봇 구조 기술 포맷 | 15 |
| 모방학습 | Imitation Learning | 시연을 보고 배우는 것. 조작에서 널리 쓰임 | 16 |
| 원격 조종 | Teleoperation | 사람이 로봇을 조종해 시연을 만드는 것 | 16 |
| 누적 오차 | Compounding Error | 흉내 오차가 시연 밖 상태로 끌고 가 커지는 악순환 | 16 |
| 액션 청킹 | Action Chunking | 여러 스텝의 행동을 한 번에 예측 | 16 |
| VLA | Vision-Language-Action | 이미지 + 언어 지시 → 로봇 행동 모델 | 16 |
| 잔차 RL | Residual RL | 기존 정책 출력에 RL이 보정만 더한다 | 16 |
트레이딩
섹션 제목: “트레이딩”| 용어 | 풀 이름 | 뜻 | 장 |
|---|---|---|---|
| 비정상성 | Non-stationarity | 전이·보상 분포가 시간에 따라 변하는 것 | 11 |
| 신호 대 잡음비 | SNR | 예측 가능한 성분 대 잡음. 시장은 극도로 낮다 | 11 |
| 시장 충격 | Market Impact | 내 주문이 가격을 불리하게 미는 현상 | 11 |
| 슬리피지 | Slippage | 의도한 가격과 실제 체결가의 차이 | 11 |
| 호가창 | Order Book · LOB | 가격별 미체결 주문 목록 | 11 |
| 알파 소멸 | Alpha Decay | 전략이 알려지며 수익원이 사라지는 것 | 11 |
| 미래 정보 누출 | Look-ahead Bias | 그 시점에 몰랐을 정보가 상태에 들어가는 것 | 12 |
| 생존 편향 | Survivorship Bias | 살아남은 종목만으로 과거를 시험하는 것 | 12 |
| 워크포워드 | Walk-forward | 학습 → 다음 기간 검증 → 창을 미는 검증 절차 | 12 |
| 퍼지 · 엠바고 | Purge · Embargo | 학습과 검증 사이를 비워 누출을 막는 기법 | 12 |
| MDD | Maximum Drawdown | 고점 대비 최대 하락폭 | 12 |
| 샤프 지수 | Sharpe Ratio | 위험 대비 성과. 평가 지표로 쓴다 | 12 |
| 최적 체결 | Optimal Execution | 큰 주문을 어떻게 쪼갤 것인가 | 13 |
| TWAP · VWAP | — | 시간·거래량 비례 균등 분할. 기준선 | 13 |
| 구현 부족분 | Implementation Shortfall | 결정 시점 가격 대비 실제 평균 체결가의 손실 | 13 |
| 마켓메이킹 | Market Making | 양쪽 호가를 걸고 스프레드를 먹는 일 | 13 |
| 재고 위험 | Inventory Risk | 원치 않게 떠안은 포지션의 가격 노출 | 13 |
| 딥 헤징 | Deep Hedging | 비용·마찰을 넣어 헤지 비중을 학습으로 | 13 |
| 기호 | 읽기 | 뜻 |
|---|---|---|
s · a · r | — | 상태 · 행동 · 보상 |
s' | 에스 프라임 | 다음 상태 |
π | 파이 | 정책 — 상태에서 행동을 고르는 규칙(또는 그 확률 분포) |
V(s) · Q(s,a) | — | 가치 · 행동 가치 |
A(s,a) | — | 어드밴티지 Q − V |
G | — | 리턴 (할인 누적 보상) |
γ | 감마 | 할인율. 시야 길이 |
α | 알파 | 학습률 |
λ | 람다 | GAE의 편향-분산 손잡이 |
ε | 엡실론 | 탐색 확률(ε-greedy) 또는 PPO 클립 폭 |
θ · w | 세타 · 더블유 | 신경망 파라미터 (정책 · 가치) |
δ | 델타 | TD 오차 |
τ | 타우 | 소프트 타깃 갱신 비율, 또는 IQL의 기대분위수(expectile) 수준 |
E[·] | 기대값 | 평균 |
참고 자료
섹션 제목: “참고 자료”- Reinforcement Learning: An Introduction, 2nd ed. — 기본 용어와 기호의 표준 정의
- Gymnasium: Handling Time Limits —
terminated·truncated구분 - Deep Reinforcement Learning at the Edge of the Statistical Precipice — IQM·성능 프로파일·개선 확률
- Implicit Q-Learning — IQL expectile 정의
19. 마무리덱 전체를 한 장으로 — 장별 한 문장, 판정·설계·디버깅 카드, 그리고 다음에 무엇을 할 것인가.