RLVR · Predictive Prompt Selection (predictor family)

Small Generalizable Prompt Predictive Models Can Steer Efficient RL Post-Training of Large Reasoning Models

작은 예측 모델로 프롬프트의 학습 가치를 예측해 RL post-training을 조향한다 — gradient가 아니라 예측 신호로 고르는 predictor family의 대표.

📄 arXiv:2602.01970 🗓️ arXiv 2026-02 ✍️ Yun Qu 외 2명 🏷️ cs.LG 원문 PDF ↗
predictor
gradient 없는 선택 신호
소형 모델
작은 예측기의 일반화
조향
RL post-training steering
F3
우리 frontier의 비교 family
1SUMMARY

요약 — 이 논문이 한 일

논문 그대로

작은 예측 모델로 프롬프트의 학습 가치를 예측해 RL post-training을 조향한다 — gradient가 아니라 예측 신호로 고르는 predictor family의 대표.

쉽게 풀면

문제를 직접 풀려보지 않고 '이 문제는 도움될 것'을 작은 모델이 점치는 방식.

2RELATION

우리 논문(#68)과의 관계

관계 · 대안 가족

정리의 적용 범위 밖

reward-history/예측 신호는 우리 부호 반전 정리의 표적이 아님

역할 · baseline

'그냥 예측으로 고르면?'

우리 F3 비교가 정면으로 답하는 질문

차이 · 신호원

예측 vs gradient 정렬

비용–정확도 트레이드오프의 반대쪽

TAKEAWAY

한 장으로 끝내는 정리

논문 그대로

predictor family의 대표 — '그냥 pass-rate/예측으로 고르면 되잖아'라는 반박의 문헌적 실체.