RLVR · Rollout 배분 (분산 감소)

Adaptive Rollout Allocation for Online Reinforcement Learning with Verifiable Rewards

프롬프트별 rollout 수를 적응적으로 배분해 gradient 분산을 줄이고 학습 수율을 높인다 — ICLR 2026 채택작. 배분의 목적함수가 학습 수율이라는 점이 핵심.

📄 arXiv:2602.01601 🗓️ ICLR 2026 ✍️ Hieu Trung Nguyen 외 2명 🏷️ cs.LG 원문 PDF ↗
ICLR 2026
채택 확인
배분
프롬프트별 rollout 수 적응 결정
목적
gradient 분산 감소·학습 수율
활발성
이 문제 공간의 시의성 근거
1SUMMARY

요약 — 이 논문이 한 일

논문 그대로

프롬프트별 rollout 수를 적응적으로 배분해 gradient 분산을 줄이고 학습 수율을 높인다 — ICLR 2026 채택작. 배분의 목적함수가 학습 수율이라는 점이 핵심.

쉽게 풀면

어느 문제에 몇 번 풀이 기회를 줄지 예산을 배분하는 연구 — 목적이 '공부 효율'이다.

2RELATION

우리 논문(#68)과의 관계

관계 · 축 분리

학습 수율용 배분 vs 결정 인증용 배분

우리 C4: 후자는 이 체제에서 도달 불가능한 목표

위치 · related

allocation 문단의 대표

스쿱 아님 — 원문로 축 상이 확인

의미 · 시의성

인접 분야 채택 흐름

이 문제 공간이 뜨겁다는 근거

TAKEAWAY

한 장으로 끝내는 정리

논문 그대로

rollout 배분(분산 감소)의 채택작 — 우리의 '결정 인증용 배분 불가능' 결과와 축이 다름을 명시하는 짝.