작은 예측 모델로 프롬프트의 학습 가치를 예측해 RL post-training을 조향한다 — gradient가 아니라 예측 신호로 고르는 predictor family의 대표.
작은 예측 모델로 프롬프트의 학습 가치를 예측해 RL post-training을 조향한다 — gradient가 아니라 예측 신호로 고르는 predictor family의 대표.
문제를 직접 풀려보지 않고 '이 문제는 도움될 것'을 작은 모델이 점치는 방식.
reward-history/예측 신호는 우리 부호 반전 정리의 표적이 아님
우리 F3 비교가 정면으로 답하는 질문
비용–정확도 트레이드오프의 반대쪽
predictor family의 대표 — '그냥 pass-rate/예측으로 고르면 되잖아'라는 반박의 문헌적 실체.