RLVR · 토큰 예산 배분

DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards

토큰 단위 예산을 프롬프트·롤아웃에 배분해 RLVR 비용 대비 효과를 최적화한다.

📄 arXiv:2605.08441 🗓️ arXiv 2026-05 ✍️ Haoyu Hu 외 2명 🏷️ cs.LG 원문 PDF ↗
토큰 예산
배분 단위의 세분화
RLVR
검증 보상 설정
효율
비용 대비 학습 효과
축 상이
선택 결정 미평가
1SUMMARY

요약 — 이 논문이 한 일

논문 그대로

토큰 단위 예산을 프롬프트·롤아웃에 배분해 RLVR 비용 대비 효과를 최적화한다.

쉽게 풀면

풀이 기회가 아니라 '풀이 길이 예산'을 나눠주는 연구.

2RELATION

우리 논문(#68)과의 관계

관계 · 이웃

배분 계열의 변형

우리 frontier의 예산 축 개념과 접점

위치 · related

allocation 문단

VIP·CERO와 병기

차이 · 단위

토큰 vs 결정

estimand가 다름

TAKEAWAY

한 장으로 끝내는 정리

논문 그대로

배분 계열의 토큰 단위 판 — 우리 비용–품질 frontier의 이웃 문헌.