대규모 언어모델 강화학습 · Data-Efficient RLVR

Data-Efficient RLVR via Off-Policy Influence Guidance

난이도·불확실성 같은 heuristic 대신 influence function으로 "지금 policy에 가장 도움되는 데이터"를 직접 계산한다. Rollout 없이 off-policy로 influence를 추정하고 sparse random projection으로 gradient를 압축해, 매 phase 데이터 10%만으로 full-data 학습 대비 2.66× step-level 가속을 달성한 CROPI 프레임워크.

📄 arXiv:2510.26491v2 🗓️ 2025-10-30 ✍️ Erle Zhu 외 10명 🏷️ cs.LG 원문 PDF ↗
2.66×
1.5B 모델의 targeted task에서 full-dataset GRPO 대비 step-level 가속
10%
매 phase 전체 pool을 현재 policy로 재채점해 실제 학습에 쓰는 데이터 비율 (α=0.1)
8.91×
rollout 1 step(319.80s)이 forward+backward(35.91s)보다 비싼 배율 — rollout-free 추정이 필요한 이유
13% → 80%
full gradient를 그대로 projection할 때 대비, sparse ratio 0.1에서의 rank 보존(precision@10%)
1SUMMARY

요약 — 이 논문이 한 일

논문 그대로

RLVR(Reinforcement Learning with Verifiable Rewards)의 데이터 선택을 heuristic이 아닌 influence function으로 정식화하고, 이를 LLM 스케일에서 실제로 계산 가능하게 만든 연구다.

  • 정식화: 학습 prompt $s_0$가 validation 질의 $s_0'$의 objective를 얼마나 개선하는지를 first-order influence, 즉 두 policy gradient의 내적 $\langle \nabla_\theta J(\theta;s_0),\, \nabla_\theta J(\theta;s_0') \rangle$로 측정한다 (Pruthi et al., 2020의 RLVR 확장).
  • Rollout Issue → Off-Policy Influence Estimation: on-policy gradient 계산에 필요한 rollout을 없애기 위해, 학습 전에 base policy $\beta=\pi_{\theta_0}$로 수집해 둔 offline trajectories로 현재 policy $\pi_\theta$의 gradient를 근사한다. 온라인 RL objective의 KL 항이 $\pi_\theta$를 $\pi_{\theta_0}$ 근처에 묶어 두므로 이 근사가 유효하다.
  • Gradient-Scale Issue → Sparse Random Projection: full-parameter gradient의 차원 일부를 random dropout한 뒤 저차원 projection한다. 정보를 버렸는데도 유사도 rank 보존이 오히려 좋아진다 (precision@10%: 약 13% → 약 80%).
  • 이 둘을 결합한 실용 추정기가 POPI(Practical Off-Policy Influence)이고, POPI 점수를 phase마다 현재 checkpoint 기준으로 재계산해 상위 10%만 GRPO로 학습하는 multi-stage curriculum이 CROPI다.
  • 1.5B / 7B / 1.5B-R1 모델의 수학 추론 벤치마크에서 검증: 1.5B에서 2.66× step-level 가속, 선택 오버헤드까지 포함한 전체 기준으로도 2.16× 가속.
쉽게 풀면

"지금 이 모델에게 가장 남는 장사인 문제"를 감이 아니라 미분으로 찾아내는 논문이다. 원래 그 계산에는 새 rollout이 필요해 배보다 배꼽이 크지만, 어차피 모든 데이터 선택 기법이 만들어 두는 초기 rollout을 재활용해 비용을 거의 없앴다. 여기에 "gradient를 일부러 듬성듬성 버리면 오히려 순위가 정확해진다"는 반직관적 관찰이 실용성을 완성한다.

2MOTIVATION

왜 이 연구인가 — heuristic의 한계와 두 개의 장벽

논문 그대로

기존 방법의 공백. RLVR 데이터 선택 연구들(Wang et al., 2025; Bae et al., 2025; Li et al., 2025; Zhao et al., 2025; Sun et al., 2025)은 대부분 난이도(difficulty)·불확실성(uncertainty) 같은 heuristic 지표에 의존한다. 이런 지표는 (i) 성능에 대한 이론적 보장이 없고, (ii) 시나리오가 바뀌면 일반화가 잘 안 된다. 반면 influence function(Hampel, 1974; Koh & Liang, 2017)은 objective의 변화를 데이터별 기여로 분해하는 variational analysis에 기반한다:

$$ J(\theta_T) = J(\theta_0) + \sum_{i=1}^{N} \text{Influence}(z_i) $$

Pre-training과 SFT에서는 influence 기반 attribution/selection이 이미 널리 검증됐지만(Grosse et al., 2023; Gu et al., 2024; Xia et al., 2024; Wang et al., 2024), RLVR 적용은 open question이었다. 이유는 두 가지다.

장벽 1 — Rollout Issue. Supervised learning과 달리 RL의 supervision은 policy rollout으로 생성해야 한다. Influence에 필요한 policy gradient

$$ \nabla_\theta J(\theta;s_0)=\mathbb{E}_{\tau\sim\pi_\theta}\big[R(\tau)\,\nabla_\theta\log\pi_\theta(\tau|s_0)\big] $$

는 현재 policy $\pi_\theta$에서의 sampling을 요구한다. 저자들의 1.5B 설정(batch size 128, 최대 응답 길이 8192)에서 rollout 1 step은 평균 319.80s, forward+backward 1 step은 35.91s — rollout이 약 8.91× 비싸다. 이는 하드웨어 특성과도 일치한다: forward+backward는 compute-bound, autoregressive decoding은 memory-bandwidth-bound. 게다가 RL에서는 데이터의 utility가 policy와 함께 변하므로, 학습 전 1회 global selection(Zhao et al., 2025; Wang et al., 2025)으로는 policy의 진화를 따라갈 수 없다.

장벽 2 — Gradient-Scale Issue. LLM의 full-parameter gradient는 차원이 거대해 저장·내적 비용이 크다. LESS(Xia et al., 2024)는 SFT에서 LoRA gradient + random projection(Johnson–Lindenstrauss Lemma)으로 우회했지만, 이 논문은 RLVR의 성능 확보를 위해 full-parameter 학습을 유지한다 — raw gradient가 훨씬 크고 projection 오버헤드도 커진다.

Figure 1. LLM 스케일 RL에서 influence 계산이 부딪히는 두 가지 실무적 장벽. influence 추정에 필요한 on-policy rollout이 학습 step보다 약 8.9× 비싼 Rollout Issue와, full-parameter gradient의 저장·계산이 부담스러운 Gradient-Scale Issue. CROPI는 각각 off-policy gradient 추정과 sparse random projection으로 대응한다.
Q1 · 이론

Heuristic을 넘어설 수 있는가

난이도·불확실성 지표 대신, learning objective에 대한 기여를 직접 근사하는 influence 기반 선택이 RLVR에서 작동하는가.

Q2 · 비용

Rollout 없이 가능한가

새 rollout 없이, 학습 전에 수집한 offline trajectories만으로 현재 policy에 대한 influence를 충분히 정확하게 추정할 수 있는가.

Q3 · 규모

Full gradient를 다룰 수 있는가

full-parameter gradient를 저장·내적 가능한 크기로 압축하면서 유사도 rank를 보존할 수 있는가.

쉽게 풀면

과외 선생님이 학생에게 문제집을 골라줄 때, "이 문제가 어려우니까"라는 감(heuristic)이 아니라 "이 문제를 풀면 시험 점수가 얼마나 오르는가"를 직접 계산하겠다는 것이다. 문제는 그 계산이 모의고사 응시(rollout)를 요구해 너무 비싸고, 채점표(gradient)가 너무 크다는 것 — 이 논문은 그 두 가지를 각각 해결한다.

3CONTRIBUTION

핵심 기여

논문 그대로
  • Off-Policy Influence Estimation — 실시간 sampling 없이 개별 데이터가 현재 online policy에 미치는 influence를 정량화하는, 이론 기반(rollout-free) 추정법. Offline RL(Levine et al., 2020)의 아이디어를 influence 추정에 이식했으며, TRPO(Schulman et al., 2015)에서 유도된다.
  • Sparse Random Projection — projection 전에 gradient 차원 일부를 random dropout하는 압축 기법. 수치 노이즈를 걸러내 inner product 보존을 오히려 개선하면서 계산 효율도 높인다는 것을 실증했다. LoRA gradient를 쓰는 LESS(Xia et al., 2024)와 달리 full-parameter gradient를 직접 다룬다.
  • CROPI — 위 추정기를 multi-stage 데이터 선택에 활용하는 curriculum RL 프레임워크. Full-dataset 학습과 기존 데이터 선택 baseline들(Learnability, Pass Rate, 정적 Influence, DAPO)을 모두 상회한다.
C1 · 추정

Rollout-Free Influence

미리 수집한 offline trajectories로 현재 policy의 gradient를 근사 — RL influence 추정에서 가장 비싼 단계를 제거.

C2 · 압축

Dropout-then-Project

차원을 버리는 것이 오히려 신호를 살린다는 counter-intuitive한 발견 — precision@10% 기준 13% → 약 80%.

C3 · 프레임워크

CROPI

phase마다 "현재 모델 기준" top-10% 데이터를 재선택하는 동적 curriculum — 정적 선택 baseline들이 놓치는 policy 진화를 반영.

쉽게 풀면

세 기여는 한 문장으로 묶인다: "influence라는 올바른 잣대(C1의 이론)를, 감당 가능한 비용으로(C1의 off-policy + C2의 압축), 학습 내내 반복 적용(C3)". 어느 하나만 빠져도 실용적인 시스템이 되지 않는다.

4METHOD

방법 상세 — POPI 추정기와 CROPI 커리큘럼

RLVR에서의 influence 정의

논문 그대로

배경이 되는 GRPO(Shao et al., 2024)의 objective는 (clipping·KL 항 생략 시):

$$ J(\theta)=\mathbb{E}_{s_0\sim q(\cdot),\,\{\tau_k\}_{k=1}^{K}\sim\pi_{\theta_{\text{old}}}}\sum_{k=1}^{K}\frac{1}{|T_k|}\sum_{t=0}^{T_k-1}\rho_{k,t}^{\pi_\theta}\,\widehat{A}_{k,t} $$

여기서 $\rho_{k,t}^{\pi_\theta}=\frac{\pi_\theta(x_{k,t}|s_{k,t})}{\pi_{\theta_{\text{old}}}(x_{k,t}|s_{k,t})}$, $\widehat{A}_{k,t}=\frac{R(\tau_k)-\widehat{\mathbb{E}}_{\pi_{\theta_{\text{old}}}}[R(\tau)]}{\widehat{\sigma}_{\pi_{\theta_{\text{old}}}}[R(\tau)]}$ (group-normalized advantage).

First-order influence 공식(Pruthi et al., 2020)을 RLVR에 적용하면, 학습 prompt $s_0$가 test query $s_0'$에서의 성능에 미치는 영향은 두 policy gradient의 내적이다:

$$ \text{Inf}(\pi_\theta; s_0, s_0') = \big\langle \nabla_\theta J(\theta; s_0),\; \nabla_\theta J(\theta; s_0') \big\rangle $$

직관: 한 step의 파라미터 업데이트 $\Delta\theta \propto \nabla_\theta J(\theta;s_0)$가 $J(\theta;s_0')$를 얼마나 올리는지를 1차 Taylor 전개로 근사한 것이다 (유도는 Appendix A). 문제는 $\nabla_\theta J(\theta;s_0)$가 기대값 $\mathbb{E}_{\tau\sim\pi_\theta}[\cdot]$이라 현재 policy에서의 rollout을 요구한다는 점이다.

쉽게 풀면

"이 문제로 공부하면 저 시험 문제 점수가 오르는가"를, 두 문제가 파라미터를 미는 방향이 얼마나 닮았는지(gradient 내적)로 판정한다. 같은 방향으로 밀면 도움이 되는 문제, 반대 방향이면 오히려 방해가 되는 문제다.

Off-policy gradient — rollout 없이 현재 policy의 gradient 근사

논문 그대로

Offline RL(Levine et al., 2020)의 아이디어를 따라, behavior policy $\beta$가 생성해 둔 offline trajectories $\{\tau_k\}_{k=1}^{K}\sim\beta(\cdot|s_0)$로 현재 policy $\pi_\theta$의 gradient를 근사한다. $\pi_\theta$와 $\beta$가 KL-constrained라면:

$$ \widehat{g}_{\beta}(\theta,s_0) \approx \frac{1}{K}\sum_{k=1}^{K}\frac{1}{|\tau_k|}\sum_{t=0}^{|\tau_k|-1}\nabla_{\theta}\,\rho_{k,t}^{\pi_\theta}\,\widehat{A}^{\beta}_{k,t}, \qquad \rho^{\pi_\theta}_{k,t}=\frac{\pi_\theta(x_{k,t}|s_{k,t})}{\beta(x_{k,t}|s_{k,t})},\quad \widehat{A}^{\beta}_{k,t}=\frac{R(\tau_k)-\widehat{\mathbb{E}}_{\beta}[R(\tau)]}{\widehat{\sigma}_{\beta}[R(\tau)]} $$
  • 유도: TRPO(Schulman et al., 2015)에서 유도되며(Appendix B), GRPO objective에서 clipping을 제거하고 $\pi_{\theta_{\text{old}}}$를 $\beta$로 치환한 gradient와 동치다.
  • $\beta = \pi_{\theta_0}$ 선택의 근거: 온라인 RL objective의 KL 항(Shao et al., 2024; Ouyang et al., 2022)이 $\pi_\theta$를 $\pi_{\theta_0}$ 근처로 constrain하므로, base policy의 trajectories로도 근사가 상대적으로 정확하다.
  • 공짜에 가까운 비용: 학습 시작 전 모든 prompt에 대해 $\pi_{\theta_0}$로 trajectories를 미리 sampling해 $\mathcal{D}=\{s_0^{(i)},\{\tau_k^{(i)}\}_{k=1}^{K}\}_{i=1}^{N}$을 구축한다 — 이는 기존의 모든 RLVR 데이터 선택 방법이 어차피 수행하는 전처리다. 이후 phase마다 필요한 것은 rollout이 아니라 forward+backward뿐이다.
  • 검증: 이 off-policy gradient가 on-policy gradient를 어느 정도 근사함을 cosine similarity 분포로 실증했다 (Appendix G).
쉽게 풀면

학기 초에 한 번 치른 진단평가 답안지를 버리지 않고, 학기 내내 "지금 실력 기준으로 다시 채점"하며 재활용하는 셈이다. importance ratio $\pi_\theta/\beta$가 그 재채점 계수 역할을 하고, KL 항이 학생의 실력이 진단평가 시점에서 너무 멀어지지 않게 잡아 주기에 재활용이 유효하다.

Sparse random projection — 버릴수록 선명해지는 신호

논문 그대로

Full-parameter gradient $g\in\mathbb{R}^d$를 그대로 projection하는 대신, 먼저 랜덤 인덱스 집합 $S\subset\{1,\dots,d\}$를 뽑아 해당 차원만 남기고 projection한다:

$$ \mathcal{P}_{\text{sparse}}[i,j]=\epsilon_{i,j}\,\mathbb{I}_{j\in S},\quad \epsilon_{i,j}\sim\mathcal{N}(0,1) \qquad\Longleftrightarrow\qquad \mathcal{P}_{\text{sparse}}\,g=\mathcal{P}_{\text{sparse}}[:,S]\;g[S] $$

즉 "차원 random dropout → 더 작은 projection"과 동치라서 계산·저장 비용이 sparse ratio $=|S|/d$에 비례해 줄어든다. 놀라운 점은 정확도다. 1.5B 모델에서 학습 prompt 50개의 GRPO gradient로 projection 전후의 pairwise cosine similarity rank 보존도(precision@10%)를 측정한 결과:

sparse ratioprecision@10%해석
1.0 (full projection)약 13%random 수준 — rank가 사실상 파괴됨
0.1약 80%정보를 90% 버렸는데 rank 보존이 최선

저자들의 가설: gradient에 포함된 수치 노이즈(float16 연산)를 random projection이 증폭시키는데, sparsity가 정보 일부를 가리는 대신 노이즈를 대량으로 걸러내 sparse ratio 0.1 부근에서 signal-to-noise ratio가 최적이 된다.

Figure 4. Sparse Random Projection의 rank 보존 실험. sparse ratio 1.0(전체 차원 projection)에서는 precision@10%가 약 13%로 random 수준이지만, 0.1에서는 약 80%까지 오른다. "덜 보는 것이 더 정확한" counter-intuitive한 결과로, float16 수치 노이즈의 증폭이 원인이라는 가설을 뒷받침한다.
쉽게 풀면

잡음 낀 라디오 방송을 전 대역으로 듣는 것보다, 잡음이 덜한 주파수 일부만 골라 듣는 편이 내용 파악에 낫다는 얘기다. Gradient의 90%를 버리는 것이 손실 같지만, 버려지는 것의 대부분이 float16 노이즈라면 남는 10%의 순도가 훨씬 높다.

최종 추정기 — POPI

논문 그대로

응답 길이·pass rate 차이가 만드는 gradient norm 편향을 없애기 위해 feature를 정규화한 뒤 내적한다 — 즉 cosine similarity와 동치다 (Xia et al., 2024를 따름). $\widetilde{g}_{\beta}=\mathcal{P}_{\text{sparse}}\,\widehat{g}_{\beta}$로 두면:

$$ \widetilde{\text{Inf}}_{\beta}(\pi_\theta; s_0, s_0') = \texttt{cossim}\big(\widetilde{g}_{\beta}(\theta,s_0),\; \widetilde{g}_{\beta}(\theta,s_0')\big) $$

이것이 POPI (Practical Off-Policy Influence) 추정기다: off-policy(rollout-free) + sparse projection(압축) + cosine 정규화(편향 제거).

쉽게 풀면

POPI는 세 가지 보정의 합성이다 — 비싼 rollout은 재활용으로, 거대한 gradient는 dropout-projection으로, 길이 편향은 정규화로. 결과물은 "임의의 학습 문제 × 임의의 시험 문제"에 대해 싸게 계산 가능한 유사도 점수 하나다.

CROPI 프레임워크 — phase마다 다시 고르는 커리큘럼

논문 그대로

Validation set 단위의 점수화. Validation set $\mathcal{D}_{\text{val}}$의 gradient feature를 개별 feature의 합 $\widetilde{g}_{\beta}(\theta,\mathcal{D}_{\text{val}})=\sum_{i=1}^{N_{\text{val}}}\widetilde{g}_{\beta}(\theta,s_0'^{(i)})$으로 정의하고, 학습 prompt의 POPI를 $\texttt{cossim}(\widetilde{g}_{\beta}(\theta,s_0),\widetilde{g}_{\beta}(\theta,\mathcal{D}_{\text{val}}))$로 계산한다.

여러 validation set의 융합. $V$개 validation set이 있을 때, 정보 검색에서 널리 쓰이는 Reciprocal Rank Fusion(RRF; Cormack et al., 2009)으로 rank를 융합한다:

$$ U_{\text{POPI-R}}(\pi_\theta; s_0)=\sum_{j=1}^{V}\frac{1}{\mathrm{r}_j(s_0)}, \qquad \mathcal{D}_{\text{sel}}=\underset{\mathcal{S}\subset\mathcal{D},\,|\mathcal{S}|=\lfloor\alpha|\mathcal{D}|\rfloor}{\text{argmax}}\;\sum_{s_0\in\mathcal{S}}U_{\text{POPI-R}}(\pi_\theta; s_0) $$

어느 한 validation set에서라도 rank가 높으면(rank 값이 작으면) 융합 점수가 커진다.

Phase-level curriculum. 장기 계획과 동적 선택의 균형을 위해 batch-level이 아닌 phase-level로 선택한다. 각 phase $m$의 시작에서 현재 policy $\pi_{\theta^{(m)}}$로 전체 학습 pool의 POPI-R 점수를 다시 계산하고, 상위 $\lfloor\alpha|\mathcal{D}_{\text{tr}}|\rfloor$개(실험에서 $\alpha=0.1$)만으로 GRPO를 $E$ steps 학습해 $\pi_{\theta^{(m+1)}}$을 얻는다. 이를 $M$ phases 반복한다.

Figure 2. CROPI 프레임워크의 도식. 학습 전 base policy로 offline trajectories를 수집해 두고, 각 phase 시작 시 현재 checkpoint의 off-policy gradient로 전체 pool의 POPI 점수를 재계산한다. 상위 $\alpha$ 비율만 뽑아 GRPO로 학습하고, 다음 phase에서 같은 과정을 반복하는 동적 curriculum이다.

사전 준비 — offline rollout

학습 시작 전, base policy $\pi_{\theta_0}$로 모든 prompt에 대해 $K$개 trajectories를 수집해 $\mathcal{D}$ 구축. 기존 RLVR 선택 기법들도 공유하는 표준 전처리라 추가 비용이 아니다.

재채점 — POPI-R 계산

phase $m$ 시작 시 현재 checkpoint $\pi_{\theta^{(m)}}$ 기준으로 전체 pool의 off-policy influence 계산. base model이 전부 맞히거나 전부 틀리는 prompt는 group-norm advantage가 0이라 제외된다.

선택 — top-α 추출

RRF로 융합한 $U_{\text{POPI-R}}$ 상위 $\lfloor\alpha|\mathcal{D}_{\text{tr}}|\rfloor$개 선택 (실험에서는 α=0.1, 즉 10%).

학습 — GRPO $E$ steps

선택된 subset만으로 GRPO 학습 → $\pi_{\theta^{(m+1)}}$.

반복 — $M$ phases

phase마다 1~4를 반복. 데이터 utility가 policy와 함께 변한다는 RL의 특성을 선택 주기로 흡수한다.

쉽게 풀면

매 학기 초에 "지금 실력 기준으로 가장 남는 문제 10%"를 새로 골라 그 문제만 푸는 학습법이다. 정적 선택(입학 때 한 번 고른 문제집)과 batch-level 선택(매 수업마다 갈아치우는 문제) 사이의 절충으로, phase라는 주기가 "충분히 자주 갱신하되 계획성은 유지"하는 지점이다.

5RESULTS

실험·결과

Setup

논문 그대로
  • 모델: Qwen2.5-1.5B-Instruct, Qwen2.5-7B-Instruct, DeepSeek-R1-Distill-Qwen-1.5B (이하 1.5B / 7B / 1.5B-R1).
  • 학습 데이터: GSM8K-Train + MATH-Train + DeepScaleR-Preview-Dataset에서 집계한 47K개 고유 문제.
  • 평가: GSM8K, MATH, Gaokao2023EN, OlympiadBench, AMC23, AIME24. 이 중 일부 test set에서 최대 100개를 샘플링해 selection용 validation set으로 사용 — 해당 task는 Targeted, 나머지는 Untargeted로 구분.
  • Baselines (선택 비율 $\alpha=0.1$ 동일): Learnability(Bae et al., 2025), Pass Rate(Yu et al., 2025), 정적 Influence Function(Pruthi et al., 2020) — global-level 선택; DAPO(Yu et al., 2025) — batch-level 선택. 계산 비용 문제로 baseline 비교는 1.5B에서만 수행.
  • 모든 Acc.@step은 window 5의 moving average로 smoothing한 값.
쉽게 풀면

공정성의 핵심은 두 가지다: 모든 선택 기법이 같은 비율(10%)로 데이터를 고르고, 어차피 전부 필요한 초기 rollout을 공유한다는 것. 따라서 차이는 순수하게 "무엇을 고르느냐"에서 나온다.

주요 결과 — 1.5B에서 2.66× step-level 가속

논문 그대로
방법 (1.5B, Acc.%)GSM8KMATHGaokao.AMC23Olympiad.AIME24Targeted(Avg.)Untar.(Avg.)
Qwen2.5-1.5B-Instruct (base)72.9955.4846.4328.1324.274.0064.2425.71
+ Full Dataset (GRPO) @1k79.3059.5444.0931.2526.236.6769.4227.06
+ Full Dataset (DAPO) @1k78.9353.2641.8830.2119.850.066.0922.99
+ Learnability (GRPO) @1k79.1259.0347.1929.1726.962.7869.0726.52
+ Pass Rate (GRPO) @1k80.1958.3346.8629.1727.128.3369.2627.87
+ Influence (GRPO) @1k78.5858.8247.7323.9625.088.3368.7026.28
+ CROPI (Ours) @50080.5558.4348.1226.2526.864.1769.4926.35
+ CROPI (Ours) @1k81.3659.1746.5434.3827.789.7270.2629.60

핵심 관찰:

  • CROPI @500 (69.49) > Full Dataset @1k (69.42): 절반의 step으로 full-data 1k step을 넘어선다. Training curve 기준 step-level 가속은 2.66× (Figure 3).
  • 정적 선택의 한계: Learnability·Pass Rate·정적 Influence는 초기엔 이득을 보이지만 빠르게 plateau — 데이터 utility를 고정된 것으로 추정해 policy의 진화에 적응하지 못하기 때문이라는 것이 저자들의 해석. 같은 influence 이론을 쓰는 "정적 Influence" baseline(@1k 68.70)과 CROPI(@1k 70.26)의 격차는 동적 재선택의 기여를 시사한다.
  • 일반화: validation set에 쓰이지 않은 Untargeted 평균도 27.06(full) → 29.60(CROPI)으로 개선 — 선택된 데이터가 targeted task에의 과적합이 아니라 전반적 추론 능력에 기여함을 시사한다.
  • Appendix E.5의 ablation: influence 선택을 random phase-wise 선택으로 바꾸면 성능이 뚜렷하게 하락 — 이득이 "10%만 쓰는 curriculum 구조"가 아니라 influence 신호 자체에서 나온다는 증거.
방법 (Acc.%)Targeted(Avg.)Untar.(Avg.)
Qwen2.5-7B-Instruct (base)53.9654.76
+ Full Dataset (GRPO) @60057.4456.74
+ CROPI @30057.4662.07
+ CROPI @60058.6359.66
R1-Distill-Qwen-1.5B (base)43.9375.28
+ Full Dataset (GRPO) @30047.1278.05
+ CROPI @15045.2976.76
+ CROPI @30047.9477.92

7B에서도 CROPI @300이 Full @600의 targeted 성능과 대등(57.46 vs 57.44)하고, 1.5B-R1(long-CoT distill 모델)에서도 @300 기준 targeted에서 앞선다(47.94 vs 47.12).

Figure 3. 1.5B 설정의 training curves (moving average, window 5). CROPI(상단 곡선)가 모든 baseline을 상회하며, full-data 학습 대비 2.66×의 step-level 가속을 달성한다 — 매 phase 데이터의 10%만 쓰면서. 정적 선택 baseline들이 중반 이후 plateau하는 것과 대비된다.
쉽게 풀면

표에서 가장 눈여겨볼 비교는 CROPI@500 vs Full@1k다 — 데이터 10%, step 절반으로 full-data를 이긴다. 그리고 "정적 influence도 이긴다"는 점이 이 논문의 진짜 주장을 완성한다: 중요한 건 influence라는 잣대만이 아니라, 그 잣대를 policy가 변할 때마다 다시 들이대는 것이다.

비용까지 계산에 넣으면 — wall-clock 2.16×

논문 그대로
설정Select (phase당)Train (phase당)
1.5B1.2h (19k prompts)5.2h (200 steps)
7B2.6h (18k prompts)9.6h (200 steps)
1.5B-R13.4h (17k prompts)13.7h (100 steps)

8× NVIDIA H100 기준. 괄호는 selection에서 처리하는 prompt 수(gradient 계산·projection·cosine similarity)와 학습 step 수. 전체 pool(완전 정답/완전 오답 제외 후)에 대해 gradient를 계산해야 하므로 selection 비용은 무시할 수 없는 수준이지만, selection으로 인한 slowdown은 약 0.81×에 그쳐 전체적으로 2.16× 가속이 유지된다. 1.5B의 직접적인 wall-clock 분석에서는 targeted accuracy 70% 도달까지 표준 GRPO 대비 2.17× 빨랐다 (Appendix E.4). 저자들은 partial subset 채점, 병렬화 가속, proxy scorer 학습 등으로 selection 비용을 더 줄일 여지가 크다고 지적한다.

쉽게 풀면

"고르는 시간까지 쳐도 남는 장사인가"에 대한 답이다. 재채점에 phase당 1.2~3.4시간을 쓰지만, 학습이 2.66배 빨라지므로 총합으로 2.16배 이득. 게다가 채점은 아직 최적화 여지가 많은 반면 rollout 비용은 구조적이라, 이 격차는 더 벌어질 수 있다.

6ANALYSIS

분석 — CROPI는 어떤 데이터를 고르는가

의미적 근접성: gradient 공간이 semantic 공간을 알고 있다

논문 그대로

1.5B 설정에서 GSM8K·MATH validation set 기준 POPI 상위 100개(top-100)와 하위 100개(bottom-100)를 checkpoint별(step 0, 200, 400, 600, 800)로 분석했다. BGE-large-en-V1.5로 embedding을 계산해 validation set 평균 embedding과의 cosine similarity를 재면, top-100이 random 샘플(baseline)과 bottom-100보다 일관되게 validation set에 의미적으로 가깝다 (Figure 5). POPI는 순수하게 gradient 공간에서 계산되지만, gradient 공간과 semantic 공간 사이의 잠재적 연결을 활용해 validation set과 관련성 높은 학습 데이터를 자동으로 찾아낸다는 해석이 가능하다.

쉽게 풀면

누구도 "비슷한 주제의 문제를 골라라"라고 시키지 않았는데, 미분값의 방향만 보고 고른 문제들이 시험 범위와 주제까지 닮아 있었다는 것이다. gradient가 문제의 내용을 어느 정도 인코딩하고 있다는 간접 증거다.

난이도의 이동: learning frontier를 따라가는 선택

논문 그대로

MATH validation set으로 뽑은 top-100 prompt의 pass rate를 두 기준으로 추적했다 (Figure 6):

  • Offline pass rate (base model 기준, 파란색): 초기 step 이후 하락 추세 — 0.75 → 약 0.53. 학습이 진행될수록 CROPI는 원래 base model에게 점점 더 어려운 문제를 고른다.
  • Online pass rate (현재 checkpoint 기준, 초록색): 뚜렷한 상승 추세 — 0.75 → 0.87. 골라진 문제는 어렵지만 현재 모델의 learning frontier 안에 있어, 모델이 실제로 풀어내며 학습한다.

결과적으로 모델은 online pass rate 0.6~0.9 구간의 데이터로 학습하게 되는데, 이는 성능 개선이 가장 두드러지는 난이도 구간이다. 난이도를 명시적 기준으로 쓰지 않았음에도, influence 최적화가 적정 난이도 curriculum을 창발적으로 만들어 낸 셈이다. Appendix I의 추가 분석(데이터 출처·지식 카테고리·다양성 분해)까지 포함하면, CROPI는 성능뿐 아니라 선택 근거의 해석 가능성도 일정 수준 제공한다.

Figure 6. MATH top-100 prompt의 Offline vs Online pass rate. 파란 막대(base model 기준 pass rate)는 0.75에서 약 0.53으로 하락 — 갈수록 어려운 문제를 고른다. 초록 막대(현재 checkpoint 기준)는 0.75에서 0.87로 상승 — 그 어려운 문제를 현재 모델은 풀 수 있다. "어렵지만 지금 막 풀 수 있게 된 문제"를 자동으로 추적한다는 뜻이다.
쉽게 풀면

교육학의 근접발달영역(ZPD)을 수식이 스스로 발견한 그림이다. "옛날의 나에겐 어려웠지만 지금의 나는 막 풀 수 있는 문제"가 가장 많이 배우는 문제인데, CROPI는 난이도라는 개념을 입력받은 적 없이 gradient 내적만으로 정확히 그 지점을 따라간다. 난이도 heuristic이 "왜" 작동하는지에 대한 원리적 설명이기도 하다.

7LIMITATIONS

한계와 열린 문제

논문 그대로

저자들이 명시한 한계는 네 갈래다:

  • 이론: first-order influence + SGD optimizer 가정에 국한 — 더 넓은 optimizer와 influence 추정 방식으로의 확장은 future work. Off-policy gradient 추정의 error/bias/variance에 대한 이론적 분석도 제공하지 않는다.
  • Offline trajectories: base model의 trajectories만 사용하므로, base model이 전부 맞히거나 전부 틀리는 prompt는 GRPO advantage가 0이 되어 gradient가 없고 선택 대상에서 빠진다. 강한 positive/negative 예시 주입, 작은 모델의 rollout으로 큰 모델 gradient 추정, 학습 중 rollout 재사용(replay buffer)은 미탐구.
  • 실험 범위: single-turn 수학 QA에 한정 (multi-turn, agentic, multi-modal 미검증). 모델은 1.5B·7B, 학습은 1000 steps 미만.
  • 수치 오차: gradient 계산이 float16이라 수치 오차가 무시 불가능하고 random projection이 이를 증폭할 수 있다. Dropout-then-project가 완화책이지만 근본 해결은 아니다.
쉽게 풀면

가장 실질적인 한계는 두 번째다: "지금은 너무 어려운 문제"가 base model 기준 전부 틀리면 점수 자체가 없어서, 학습 후반에 정작 필요해질 문제를 놓칠 수 있다. Offline 재활용의 비용 절감과 신선한 rollout의 정보량 사이 trade-off는 여전히 열린 설계 공간이다.

TAKEAWAY

한 장으로 끝내는 정리

논문 그대로

RLVR 데이터 선택의 잣대를 heuristic에서 influence로 옮기고, 그 잣대를 감당 가능한 비용으로 만들었다.

  • 원리: 데이터의 가치 = 학습 gradient와 validation gradient의 내적 (first-order influence). 난이도·불확실성 heuristic이 근사하던 것을 직접 계산한다.
  • 비용: 학습 전 1회 수집하는 offline trajectories의 재활용(off-policy 추정) + gradient 차원 dropout 후 projection(sparse random projection, 13% → 80% rank 보존)으로 rollout-free 파이프라인 완성.
  • 구조: phase마다 현재 policy 기준으로 전체 pool을 재채점해 top-10%만 학습하는 CROPI — 정적 선택이 놓치는 policy 진화를 흡수한다.
  • 성과: 1.5B에서 step 기준 2.66×, selection 비용 포함 2.16× 가속. Targeted(70.26 vs 69.42)와 Untargeted(29.60 vs 27.06) 모두 full-data를 상회. 7B·1.5B-R1에서도 일관된 이득.
  • 함의: 선택된 데이터가 "base엔 어렵고(offline 0.53) 지금 모델은 푸는(online 0.87)" learning frontier에 정렬된다는 분석은, influence 기반 선택이 곧 원리적 curriculum learning임을 보여준다.
T1 · 이론

Heuristic → Influence

데이터 선택의 근거를 "감"에서 objective 기여의 1차 근사로 교체 — RLVR에서의 첫 실용화.

T2 · 비용

Rollout-Free + 90% Dropout

어차피 만드는 offline rollout의 재활용과 sparse projection으로, 가장 비싼 두 계산을 제거.

T3 · 효과

10% 데이터로 2.66×

full-data 대비 절반 step에 도달(@500 > Full@1k), untargeted까지 개선되는 일반화.

T4 · 통찰

Curriculum의 창발

난이도를 가르쳐 준 적 없는데 learning frontier(online pass rate 0.6~0.9)를 스스로 추적한다.

쉽게 풀면

한 문장 요약: "무엇을 공부할지"를 정하는 문제에서, 감(heuristic)을 미분(influence)으로 바꾸되 그 미분을 공짜로 만든 논문. RLVR의 다음 스케일업에서 데이터 선택이 rollout만큼 중요한 축이 될 수 있음을 보여준다.