RLVR 데이터 선택 · Fresh Gradient Alignment

GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning

모든 후보 프롬프트를 현재 정책의 fresh rollout으로 채점한다 — candidate gradient와 validation gradient의 정렬(cosine)이 선택 점수. 정확도는 높지만 선택 자체의 rollout 비용이 크다.

📄 arXiv:2602.21492 🗓️ COLM 2026 ✍️ Ningyuan Yang 외 2명 🏷️ cs.LG 원문 PDF ↗
COLM 2026
채택 확인
fresh
현재 정책 rollout으로 직접 채점
비용
후보 전수 rollout — full price
oracle
우리 평가의 기준선 역할
1SUMMARY

요약 — 이 논문이 한 일

논문 그대로

모든 후보 프롬프트를 현재 정책의 fresh rollout으로 채점한다 — candidate gradient와 validation gradient의 정렬(cosine)이 선택 점수. 정확도는 높지만 선택 자체의 rollout 비용이 크다.

쉽게 풀면

지금 학생에게 모든 문제를 새로 풀려보고 고르는 정공법 — 정확하지만 제일 비싸다.

2RELATION

우리 논문(#68)과의 관계

위치 · 끝점

비용 스펙트럼의 fresh 끝

우리 실험의 oracle(채점 기준)이 정확히 이 방식

관계 · 보완

우리는 그 사이를 특성화

full price와 공짜(stale) 사이에서 언제 무엇을 사야 하는가

차이 · 질문

정확도가 아니라 비용-신뢰 경계

GradAlign은 '어떻게 정확히', 우리는 '언제 싸게 되는가'

TAKEAWAY

한 장으로 끝내는 정리

논문 그대로

fresh 정공법의 대표 — 우리 논문에서는 채점 기준(oracle)이자 비용 스펙트럼의 반대쪽 끝점이다.