8.3 과도한 학습과 최적 학습
“최적”은 목적에 따라 달라집니다. 연산 최적 실행은 고정된 학습 예산에서 가장 낮은 검증 손실을 찾습니다. 배포 중심 실행은 반복 서비스 비용을 줄이기 위해 더 작은 모델에 더 많은 학습 토큰을 쓸 수 있습니다. 사후 학습 팀은 SFT와 선호도 최적화에 안정적으로 적응하는 체크포인트를 더 중요하게 볼 수 있습니다. 이 목적들은 서로 다른 파라미터·토큰 예산을 선택할 수 있습니다.
Chinchilla 연구는 해당 모델, 데이터, 옵티마이저, 스케줄에서 연산 최적 관계를 추정했습니다 [1]. 널리 인용되는 파라미터당 토큰 수는 보편 상수가 아닙니다. 아키텍처, 데이터 품질, 컨텍스트 길이, 옵티마이저 조정, 학습과 추론 비용의 가중치가 결정에 영향을 줍니다.
1. 연산 최적점을 넘어 학습하는 이유
학습 비용은 실행마다 한 번 지불하지만 추론 비용은 서비스 토큰마다 지불합니다. 따라서 학습 FLOPs를 최소화하지 않는 실행이라도 더 많은 데이터로 학습한 작은 모델이 경제적일 수 있습니다. 요구 품질에서 전체 수명 주기 비용을 비교합니다.
여기서 는 예상 서비스 토큰이고, 는 평가, 장애, 스토리지, 엔지니어링 오버헤드를 포함합니다. 실측 처리량, 활용률, 지연, 가격 가정을 사용합니다. 오픈 가중치 모델, 내부 배치 모델, 지연에 민감한 API는 서로 다른 최적점을 가질 수 있습니다.
통제된 설정에서 과도한 학습이 일부 사전 학습·다운스트림 지표를 개선할 수 있습니다 [2]. 그러나 작은 모델이 훨씬 큰 모델을 항상 따라잡거나 모든 과업이 개선되거나 체크포인트가 계속 쉽게 적응한다는 보장은 아닙니다.
2. 미세 조정 가능성은 실험 문제다
2025년 연구는 더 뒤의, 더 오래 학습한 언어 모델 체크포인트가 미세 조정하기 어려워진 일부 설정을 보고합니다 [3]. 중요한 신흥 증거이지만 추가 사전 학습이 “적응성을 파괴한다”는 확정 법칙은 아닙니다. 결과는 베이스 모델, 데이터 스트림, 체크포인트, 다운스트림 과업, 미세 조정 레시피, 학습률, 평가에 따라 달라질 수 있습니다.
점진적 민감도, 더 날카로운 국소 기하, 증가한 특징 간섭 같은 메커니즘은 검증할 가설입니다. 사전 학습 손실이 낮고 SFT 결과가 나쁘다는 사실만으로 한 메커니즘이 증명되지는 않습니다. 반대로 한 SFT 레시피의 성공도 모든 과업에서 가소성이 유지됐음을 증명하지 않습니다.
학습 역학: 손실 vs 부서짐성
차트 위에 마우스를 올려 사전 학습 손실과 다운스트림 효용성 간의 트레이드오프를 확인하세요.
이 시각화는 가능한 품질–적응성 트레이드오프를 보여줍니다. 영역은 보편적인 파라미터당 토큰 임계값이 아닙니다.
3. 단일 Fisher 대각합이 중단 신호가 아닌 이유
한 배치의 제곱 그래디언트 합은 손실 reduction, 토큰 수, 파라미터화, 모델 크기, 배치 구성, 레이블 품질, 정밀도에 민감합니다. 이를 경험적 Fisher 대각합이라고 부른다고 체크포인트 간 수치가 비교 가능해지는 것은 아닙니다. 무작위 레이블은 다운스트림 적응을 더욱 대표하지 못합니다.
민감도 지표를 조사한다면 고정 홀드아웃 말뭉치, 동일한 causal 레이블·마스크, 정규화된 토큰 수, 같은 파라미터 부분집합, 여러 배치·시드, 신뢰 구간을 사용합니다. 그래디언트/업데이트 노름과 손실 곡률 proxy는 진단 지표로 추적하며 자동 중단 규칙으로 사용하지 않습니다. 실제 다운스트림 프로브로 경고를 확인합니다.
4. 체크포인트 선택 프로토콜
적응 전선을 비교할 수 있을 만큼 자주 체크포인트를 저장합니다. 실행 전에 다음 프로토콜을 고정합니다.
| 증거 | 필요한 통제 |
|---|---|
| 사전 학습 진행 | 언어·도메인별 고정 홀드아웃 손실/퍼플렉서티, 동일 토크나이저·패킹 |
| 베이스 능력 | 고정 zero/few-shot, 안전, 보정, 장문 컨텍스트 슬라이스 |
| 적응성 | 같은 데이터, 채팅 템플릿, 토큰 예산, LR 스윕, 시드, 조기 중단 규칙의 표준화된 SFT 프로브 |
| SFT 후 유지 | 모든 프로브에서 베이스 능력·안전 모음 재실행 |
| 경제성 | 실측 학습 FLOPs, 재시작, 체크포인트/평가 오버헤드, 서비스 p50/p95 지연, 메모리, 처리량, 예상 볼륨 |
| 통계 | 가능한 대응 표본, 중요 슬라이스 최소 크기, 부트스트랩 또는 정당화된 신뢰 구간 |
SFT 프로브는 선택한 사전 학습 체크포인트마다 실행할 만큼 저렴하면서 목표 사후 학습을 예측할 만큼 현실적이어야 합니다. 최소한 도메인 과업 하나, 관련된다면 형식/도구 과업 하나, 일반 능력 유지, 안전을 포함합니다. 체크포인트마다 작은 학습률 범위를 조정합니다. 부적절한 학습률 하나가 체크포인트를 거짓으로 “취약하다”고 표시할 수 있습니다.
프로브 학습 예제를 최종 비공개 릴리스 평가에 사용하지 않습니다. 관련 대화, 문서, 엔터티, 합성 형제 샘플을 분할 전에 묶고 릴리스 세트를 격리합니다.
5. 결정과 중단 게이트
최소 사전 학습 손실 하나가 아니라 파레토 표면에서 체크포인트를 선택합니다.
- 중요한 안전·개인정보·능력 유지 슬라이스에 실패한 체크포인트는 거부합니다.
- 도메인·표준화 SFT 개선이 점 추정뿐 아니라 불확실성 구간을 넘어야 합니다.
- 추가 학습 비용과 현실적인 트래픽에서 실측한 서비스 절감을 비교합니다.
- 비유한 상태, 재현 가능한 손상, 사전 정의한 회귀 한계에서 중단하며 보정되지 않은 민감도 수치만으로 중단하지 않습니다.
- 마지막 정상 체크포인트와 완전한 옵티마이저/스케줄러/RNG/데이터 커서 상태를 유지하여 재개·분기 실험을 가능하게 합니다.
뒤의 체크포인트가 베이스 모델 추론에는 최선이고 앞의 체크포인트가 인스트럭션 제품에는 최선일 수 있습니다. 둘 다 보존하는 선택도 합리적입니다. 선택한 아티팩트, 다운스트림 레시피, 수명 주기 가정을 함께 보고합니다. “더 많은 토큰으로 학습했다”는 제품 품질 인증이 아닙니다.
6. 대규모 실행 전 파일럿 설계
여러 모델 크기·토큰 예산과 가능한 여러 시드로 요인 파일럿을 구성합니다. 토크나이저, 데이터 스냅샷, 평가, 품질 게이트를 고정하고 규모별로 옵티마이저를 조정합니다. 가장 큰 파일럿을 예측 홀드아웃으로 남기고 불확실성을 추정하며 중간 체크포인트에 여러 다운스트림 SFT 프로브를 실행합니다.
전역 토큰, 실제 혼합, 슬라이스별 학습/검증 손실, 그래디언트/업데이트/활성화 노름, 비유한 이벤트, 처리량, MFU, 데이터 대기, 체크포인트 오버헤드, 재구성 가능한 배치 ID를 기록합니다. 유용한 실행 계획은 어떤 체크포인트 비교가 최종 토큰 예산을 바꿀 수 있고 누가 승인하는지 미리 정합니다.
엔지니어링 교훈은 “과도하게 학습하지 말라”가 아닙니다. 측정한 적응성·유지 능력과 함께 수명 주기 효용을 최적화하고, 선택을 되돌릴 수 있도록 충분한 체크포인트와 상태를 보존하는 것입니다.
Quizzes
Quiz 1: 배포 중심 토큰 예산이 연산 최적 예산을 넘을 수 있는 이유는 무엇인가요?
추가 일회성 학습으로 작은 모델이 좋아지면 반복되는 서비스 메모리, 지연, 비용을 줄일 수 있습니다. 보편 비율이 아니라 실측 수명 주기 비용과 품질로 결정합니다.
Quiz 2: 뒤의 체크포인트가 사전 학습 홀드아웃 손실은 낮지만 한 SFT 학습률에서 결과가 나쁩니다. 가소성 상실이 증명됐나요?
아닙니다. 관찰은 중요하지만 SFT 하이퍼파라미터, 시드, 과업, 평가에 의존할 수 있습니다. 고정 LR 스윕과 여러 시드, 신뢰 구간, 유지 평가를 실행하고 메커니즘 주장은 별도로 검증해야 합니다.
Quiz 3: 무작위 레이블 배치의 제곱 그래디언트 합을 자동 중단 지표로 쓰면 위험한 이유는 무엇인가요?
레이블, 배치/토큰 수, 손실 reduction, 파라미터화, 정밀도에 따라 규모가 달라지며 체크포인트 간 보정도 없고 다운스트림 적응성을 직접 측정하지도 않습니다. 고정 데이터와 실제 SFT 프로브가 필요합니다.
Quiz 4: 표준화된 SFT 프로브에서 무엇을 동일하게 유지해야 하나요?
데이터·분할, 토크나이저·채팅 템플릿, 토큰 예산, 평가, 시드 정책, LR 탐색 범위, 조기 중단 규칙, 유지 평가 모음을 통제하여 체크포인트 식별자가 의도한 변수가 되게 해야 합니다.
Quiz 5: 앞·뒤 사전 학습 체크포인트를 모두 보존할 수 있는 이유는 무엇인가요?
뒤의 아티팩트는 베이스 품질이나 서비스 경제성이 더 좋고, 앞의 아티팩트는 목표 사후 학습에서 적응·유지가 더 좋을 수 있습니다. 제품 목적마다 다른 파레토 지점을 선택할 수 있습니다.
References
- Hoffmann, J., et al. (2022). Training Compute-Optimal Large Language Models. arXiv:2203.15556.
- Gadre, S. Y., et al. (2024). Language Models Scale Reliably With Over-Training and on Downstream Tasks. arXiv:2403.08540.
- Springer, J. M., et al. (2025). Overtrained Language Models Are Harder to Fine-Tune. arXiv:2503.19206.