Off-Policy RL · Prefix Importance Ratio (g10 칸)

Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective

토큰별 비율 대신 누적 prefix 비율 $P_t$로 교정하는 관점 — current-policy advantage 전제 하에 correctness theorem을 제공한다. 실무 critic-free 구현은 그 자리에 behavior 정책의 결과 보상을 꽂아 넣어 정리의 전제가 조용히 위반된다.

📄 arXiv:2605.07331 🗓️ arXiv 2026-05 ✍️ Yuheng Zhang 외 2명 🏷️ cs.LG 원문 PDF ↗
g10
prefix(occupancy)만 교정하는 칸
정리
current-policy advantage 전제의 correctness
전제 위반
실무는 behavior 결과 보상을 대입
표적
우리 Proposition이 정확히 이 귀퉁이를 증명
1SUMMARY

요약 — 이 논문이 한 일

논문 그대로

토큰별 비율 대신 누적 prefix 비율 $P_t$로 교정하는 관점 — current-policy advantage 전제 하에 correctness theorem을 제공한다. 실무 critic-free 구현은 그 자리에 behavior 정책의 결과 보상을 꽂아 넣어 정리의 전제가 조용히 위반된다.

쉽게 풀면

'가는 길'만 보정하는 계열의 이론적 대표. 정리는 맞는데, 실무가 정리의 전제 밖에서 돌아간다.

2RELATION

우리 논문(#68)과의 관계

위치 · g10

우리 2×2의 prefix-only 칸

우리 실측에서 GSM8K 역선택(below-chance)이 난 칸

관계 · 최강 표적

출판된 정리, 조용히 깨진 전제

'정리가 있는데 왜 실패하나'가 우리 이론의 출발

차이 · 단위

학습 안정화 vs 선택 결정

이들은 gradient 품질, 우리는 top-k 결정을 estimand로

TAKEAWAY

한 장으로 끝내는 정리

논문 그대로

prefix-only 교정의 이론적 대표 — 전제 위반 지점이 우리 부호 반전 증명의 정확한 표적이다.