Off-Policy RL · Stale-Data 학습 안정화

Prosperity before Collapse: How Far Can Off-Policy RL Reach with Stale Data on LLMs?

stale 데이터로 학습을 얼마나 멀리 끌고 갈 수 있는가를 다루고, second-moment trust region(M2PO)으로 학습 붕괴를 늦춘다 — 축은 학습 안정성이지 선택 결정이 아니다.

📄 arXiv:2510.01161 🗓️ arXiv 2025-10 ✍️ Haizhong Zheng 외 2명 🏷️ cs.LG 원문 PDF ↗
학습축
stale 데이터 훈련 안정화
M2PO
second-moment trust region
붕괴 지연
prosperity before collapse
축 상이
선택 결정은 다루지 않음
1SUMMARY

요약 — 이 논문이 한 일

논문 그대로

stale 데이터로 학습을 얼마나 멀리 끌고 갈 수 있는가를 다루고, second-moment trust region(M2PO)으로 학습 붕괴를 늦춘다 — 축은 학습 안정성이지 선택 결정이 아니다.

쉽게 풀면

낡은 답안지로 '공부'를 오래 버티는 법 — 우리는 낡은 답안지로 '문제 고르기'가 언제 틀리는가.

2RELATION

우리 논문(#68)과의 관계

관계 · 이웃 축

같은 stale, 다른 질문

학습(training) vs 선택(selection)의 축 분리

위치 · related

stale-data training 문단

우리 인증 분석이 이 계열의 allocation 질문과 접점

차이 · estimand

손실 안정성 vs top-k precision

우리의 단위는 결정이다

TAKEAWAY

한 장으로 끝내는 정리

논문 그대로

stale 데이터 '학습' 축의 대표 — 우리의 '선택' 축과 상보적이며 estimand가 다르다.