RLVR · 난이도 Posterior 기반 동적 선택

Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning

프롬프트 난이도의 posterior를 Kalman 스타일로 유지하고 policy 갱신이 크면 불확실성을 키워 재방문한다 — online으로 소개되지만 신호의 상당 부분은 historical 관측에서 온다.

📄 arXiv:2607.27610 🗓️ arXiv 2026-07 ✍️ Haodong Zhu 외 2명 🏷️ cs.LG 원문 PDF ↗
posterior
난이도 추정의 불확실성 관리
재방문
policy 변화 시 uncertainty 증가
계열
reward-history predictor
F3
우리 Beta-posterior baseline의 원형
1SUMMARY

요약 — 이 논문이 한 일

논문 그대로

프롬프트 난이도의 posterior를 Kalman 스타일로 유지하고 policy 갱신이 크면 불확실성을 키워 재방문한다 — online으로 소개되지만 신호의 상당 부분은 historical 관측에서 온다.

쉽게 풀면

문제마다 '난이도 추정치+불확실성'을 장부로 관리하고, 학생이 크게 변하면 장부를 의심해 다시 재는 방식.

2RELATION

우리 논문(#68)과의 관계

관계 · 원형

우리 pass-rate Beta posterior baseline

F3 비교의 문헌적 근거

적용 범위 · 밖

gradient estimand 아님

정리의 표적 아님 — 대안 family

접점 · drift

policy 변화 감지라는 문제의식

우리 조건 지표(F4)와 접점

TAKEAWAY

한 장으로 끝내는 정리

논문 그대로

난이도 posterior 관리의 대표 — 우리 predictor baseline(Beta posterior)의 문헌적 원형.