RLVR · Epoch 간 Rollout 재사용

Cross-Epoch Adaptive Rollout Optimization for RL Post-Training

epoch을 넘겨 rollout을 재사용·배분해 post-training 비용을 줄인다 — stale 재사용의 비용 절감 축.

📄 arXiv:2606.05606 🗓️ arXiv 2026-06 ✍️ Yiming Zong 외 2명 🏷️ cs.LG 원문 PDF ↗
재사용
cross-epoch rollout
비용
post-training 절감 축
배분
적응적 rollout 최적화
축 상이
결정 정확성은 미평가
1SUMMARY

요약 — 이 논문이 한 일

논문 그대로

epoch을 넘겨 rollout을 재사용·배분해 post-training 비용을 줄인다 — stale 재사용의 비용 절감 축.

쉽게 풀면

지난 학기 답안지를 다음 학기에도 아껴 쓰는 살림 연구.

2RELATION

우리 논문(#68)과의 관계

관계 · 이웃

재사용의 '양' vs 재사용의 '신뢰'

우리는 재사용된 점수가 결정을 얼마나 틀리게 하는가

위치 · related

allocation 문단

VIP·DUET과 같은 계열

차이 · 질문

얼마나 아끼나 vs 언제 믿나

보완적

TAKEAWAY

한 장으로 끝내는 정리

논문 그대로

stale 재사용의 비용 축 — 우리의 신뢰 축과 보완 관계.