Off-Policy RLVR · Forward-Trace Correction (g01 칸)

Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards

다단계 likelihood-ratio로 continuation(마무리) 쪽을 교정하는 forward-trace 계열 — occupancy는 미교정으로 남는다(g01). RLVR 설정에서의 다단계 보정을 다룬다.

📄 arXiv:2605.20865 🗓️ arXiv 2026-05 ✍️ Deokgyu Yoon 외 2명 🏷️ cs.LG 원문 PDF ↗
g01
continuation만 교정하는 칸
multi-step
다단계 likelihood-ratio 보정
RLVR
검증 가능 보상 설정
미교정
occupancy는 그대로
1SUMMARY

요약 — 이 논문이 한 일

논문 그대로

다단계 likelihood-ratio로 continuation(마무리) 쪽을 교정하는 forward-trace 계열 — occupancy는 미교정으로 남는다(g01). RLVR 설정에서의 다단계 보정을 다룬다.

쉽게 풀면

'마무리'만 보정하는 계열의 대표 — 반대쪽(occupancy)은 교정하지 않는다.

2RELATION

우리 논문(#68)과의 관계

위치 · g01

우리 2×2의 suffix-only 칸

14B/MATH-500에서 보존율이 가장 무너진 축(retention 0.44)

관계 · 대칭 표적

g10과 대칭인 one-sided 칸

우리 정리는 양쪽 one-sided 모두에 대칭으로 성립

차이 · 평가

gradient 품질 vs top-k 결정

선택 결정 단위의 평가는 우리가 처음

TAKEAWAY

한 장으로 끝내는 정리

논문 그대로

suffix-only 교정의 대표 — g10과 대칭인 one-sided 칸으로, 우리 부호 반전 정리가 대칭 적용되는 칸이다.