Off-Policy RL · Trajectory-Level Ratio (g11 칸)

TIC-GRPO: Provable and Efficient Optimization for Reinforcement Learning from Human Feedback

토큰별 importance ratio를 단일 trajectory-level 확률비로 대체해 수렴 분석을 제공한다 — 전체 교정(g11)의 계열로, 무편향이지만 궤적 길이에 따른 분산 문제를 안게 된다.

📄 arXiv:2508.02833 🗓️ arXiv 2025-08 ✍️ Lei Pang 외 2명 🏷️ cs.LG 원문 PDF ↗
g11
full trajectory IS 칸
무편향
이론상 정확한 교정
분산 저주
긴 궤적에서 실용성 붕괴
수렴 증명
GRPO 계열의 이론 보강
1SUMMARY

요약 — 이 논문이 한 일

논문 그대로

토큰별 importance ratio를 단일 trajectory-level 확률비로 대체해 수렴 분석을 제공한다 — 전체 교정(g11)의 계열로, 무편향이지만 궤적 길이에 따른 분산 문제를 안게 된다.

쉽게 풀면

'다 보정' 계열 — 이론상 정답이지만 보정 계수의 곱이 길어질수록 값이 터지거나 죽는다.

2RELATION

우리 논문(#68)과의 관계

위치 · g11

전체 교정 칸

우리 실측에서도 free fix가 아님을 확인(분산으로 인한 열화)

관계 · 근거

'그냥 다 보정해라'가 답이 아닌 이유

우리 서사의 전제 — 그래서 one-sided 타협이 생겼다

차이 · 목적

학습 수렴 vs 선택 순위

수렴 보장이 순위 보존을 의미하지 않는다

TAKEAWAY

한 장으로 끝내는 정리

논문 그대로

전체 교정의 대표 — '정답이 있는데 왜 안 쓰나(분산)'를 보여줘 one-sided 타협의 존재 이유를 설명한다.