RLVR · 데이터 큐레이션 관행 (경쟁 코드)

DRIVE: Data Curation Best Practices for Reinforcement Learning with Verifiable Reward in Competitive Code Generation

경쟁 프로그래밍 코드 생성 RLVR에서 데이터 큐레이션 관행(SFT→2단계 RL, 난이도 구성 등)을 체계화한다.

📄 arXiv:2511.06307 🗓️ arXiv 2025-11 ✍️ Speed Zhu 외 2명 🏷️ cs.LG 원문 PDF ↗
큐레이션
RLVR 데이터 구성 관행
코드
경쟁 프로그래밍 도메인
실전
파이프라인 레시피
전제
프롬프트 가치 신호를 신뢰
1SUMMARY

요약 — 이 논문이 한 일

논문 그대로

경쟁 프로그래밍 코드 생성 RLVR에서 데이터 큐레이션 관행(SFT→2단계 RL, 난이도 구성 등)을 체계화한다.

쉽게 풀면

어떤 문제집을 어떤 순서로 풀리느냐의 실전 노하우 모음.

2RELATION

우리 논문(#68)과의 관계

관계 · 상류

우리는 그 전제(신호 신뢰)를 검사

스케줄링·큐레이션은 신뢰 가능한 점수를 전제

위치 · related

curricula 문단

difficulty 신호 인용의 짝

주의 · 서지

ICML 표기 오류를 우리 bib에서 교정

현재 arXiv 프리프린트

TAKEAWAY

한 장으로 끝내는 정리

논문 그대로

큐레이션 관행 문헌 — 우리 결과는 그 관행이 딛고 선 '점수 신뢰'의 상류 검사다.