RLVR · Historical + Online Hybrid 선택

Train at Moving Edge: Online-Verified Prompt Selection for Efficient RL Training of Large Reasoning Model

historical reward 궤적으로 거칠게 고르고 online 신호로 보정하는 hybrid 선택 — stale 신호를 갱신해 쓰는 실무형 설계.

📄 arXiv:2603.25184 🗓️ arXiv 2026-03 ✍️ Jiahao Wu 외 2명 🏷️ cs.LG 원문 PDF ↗
hybrid
historical 거름 + online 보정
predictor 계열
reward-history 신호
실무형
비용-정확도 절충 설계
F3
우리 predictor family 비교 대상
1SUMMARY

요약 — 이 논문이 한 일

논문 그대로

historical reward 궤적으로 거칠게 고르고 online 신호로 보정하는 hybrid 선택 — stale 신호를 갱신해 쓰는 실무형 설계.

쉽게 풀면

작년 성적표로 1차 거르고, 오늘 쪽지시험으로 미세 조정하는 2단계 선발.

2RELATION

우리 논문(#68)과의 관계

관계 · 스펙트럼

우리가 특성화하는 '사이' 지대의 실존 방법

stale과 fresh 사이 hybrid

적용 범위 · 밖

gradient estimand 아님

우리 정리의 직접 표적 아님 — 별도 family로 비교

접점 · audit

보정 아이디어의 이웃

우리 audit 정책과 문제의식 공유

TAKEAWAY

한 장으로 끝내는 정리

논문 그대로

stale 신호를 갱신해 쓰는 hybrid 실무형 — 우리 frontier의 predictor family 비교 대상.