LLM 사전학습 · Online Data Mixing

AC-ODM: Actor-Critic Online Data Mixing for Sample-Efficient LLM Pretraining

actor-critic으로 사전학습 데이터 혼합비를 온라인 조정해 샘플 효율을 높인다 — 도메인은 사전학습이지만 '어떤 데이터를 얼마나'의 온라인 결정이라는 축이 같다.

📄 arXiv:2505.23878 🗓️ ICML 2026 (Poster) ✍️ Jing Ma 외 2명 🏷️ cs.LG 원문 PDF ↗
ICML 2026
Poster 채택
online mixing
혼합비 실시간 조정
actor-critic
배분 정책 학습
전제
가치 신호의 신뢰
1SUMMARY

요약 — 이 논문이 한 일

논문 그대로

actor-critic으로 사전학습 데이터 혼합비를 온라인 조정해 샘플 효율을 높인다 — 도메인은 사전학습이지만 '어떤 데이터를 얼마나'의 온라인 결정이라는 축이 같다.

쉽게 풀면

교과서 과목 비중을 학기 중에 실시간으로 조절하는 담임 — 대상이 사전학습일 뿐.

2RELATION

우리 논문(#68)과의 관계

관계 · 상류

데이터 가치 신호를 전제로 하는 계열

우리 결과는 그 신호의 신뢰성 검사

위치 · related

curricula/스케줄링 문단

venue-accepted 흐름의 예

차이 · 단계

pretraining vs RLVR post-training

설정이 다름

TAKEAWAY

한 장으로 끝내는 정리

논문 그대로

온라인 데이터 결정 계열의 채택작 — '가치 신호를 믿을 수 있는가'라는 우리 질문의 하류 소비자.