8.4 전이 학습과 일반화
사전 학습은 초기화를 만들고, 제품 가치는 새로운 과업·분포·감독으로 무엇이 전이되는지에 달려 있습니다. 전이는 경험적이고 조건부입니다. 모델 크기, 원천/목표 유사성, 토크나이저, 적응 방법, 데이터 양, 정규화, 평가가 모두 결과에 영향을 줍니다.
1. 유효 데이터 전이
전이를 정량화하는 한 방법은 개의 예제로 미세 조정한 사전 학습 모델과 같은 아키텍처를 처음부터 학습한 모델을 비교하는 것입니다. 처음부터 학습한 모델이 같은 측정 손실에 도달하는 데 개의 예제가 필요하다면 유효 전이 데이터는 다음과 같습니다.
Hernandez 등은 연구한 비전·언어 설정에서 유효 전이, 모델 크기, 미세 조정 데이터 사이의 멱법칙 관계를 관찰했습니다 [1].
이는 지수 증가가 아니라 멱법칙 증가입니다. 피팅한 지수와 의 유용성 자체가 아키텍처, 데이터셋, 지표, 범위에 의존합니다. 모델이 열 배 크면 레이블이 고정 비율로 줄어든다고 약속해서는 안 됩니다. 목표 시스템의 다운스트림 학습 곡선을 다시 피팅하거나 직접 측정합니다.
2. 그로킹은 적용 범위가 제한된 현상이다
그로킹은 일부 작고 구조화된 과업에서 관찰된 지연 일반화를 설명합니다. 학습 성능이 거의 완벽해진 뒤에도 검증 성능은 훨씬 늦게 개선됩니다 [2].
출처: AI 생성 이미지. 이 곡선은 선택된 범위에서 관찰된 현상을 나타내며 보편적인 언어 모델 스케줄이 아닙니다.
이론 연구는 일부 그로킹 설정을 최적화, 가중치 감쇠, 표현, 노름 동역학으로 설명하지만, 하나의 메커니즘이 임의의 과적합 파운데이션 모델 실행이 나중에 일반화한다고 보장하지는 않습니다. “곧 그로킹할 수 있다”는 이유로 비싼 실행을 계속하는 것은 안전하지 않습니다.
Interactive: Grokking Phase Transition
훈련 손실(Training Loss)이 0에 도달한 후에도 검증 손실(Validation Loss)이 높게 유지되다가, 가중치 노름(Weight Norm)이 충분히 수축하면서 "그로킹(Grokking)" 상전이가 발생하는 과정을 관찰해 보세요.
통제된 조건에서 학습 동역학을 이해하는 데 그로킹 실험을 사용합니다. 프로덕션 체크포인트 결정에는 고정 홀드아웃 세트의 개선, 가능한 여러 시드 또는 반복 프로브, 사전 정의한 예산을 요구합니다. 선언한 인내 구간 동안 검증·다운스트림 프로브가 그대로이거나 나빠지면 무기한 기다리지 말고 중단하거나 실행을 분기합니다.
3. 약한 감독에서 강한 일반화로
약한-강한 일반화 실험은 약한 감독자의 레이블로 학습한 강한 학생이 강한 감독과의 격차 일부를 복구할 수 있는지 묻습니다 [3]. 보고된 결과는 과업과 방법에 따라 다릅니다. 일부 설정에서 강한 모델이 약한 감독자 성능을 넘지만 격차를 항상 닫지는 못하고 실패 모드도 남아 있습니다.
이 연구는 어려운 감독 문제를 위한 비유이지, 유능한 모델이 인간 의도를 자동으로 추론한다는 증거가 아닙니다. 약한 레이블을 구조적 오류가 있는 잡음 관측으로 취급합니다. 강한 레이블 또는 사람이 레이블한 감사 세트를 유지하고, 불일치 슬라이스별 성능과 오류가 약한 감독자와 상관되는지 측정합니다.
엔트로피 최소화는 “강한 모델의 잠재 지식을 믿으라”는 일반 지침이 아닙니다. 옳은 예측을 날카롭게 할 수 있지만, 자신 있게 틀린 예측과 분포 이동도 증폭할 수 있습니다. 보조 자신감 목표는 없는 기준선과 비교하여 보정·선택적 위험 평가를 통과해야 합니다.
4. 적용 범위와 중단 기준
체크포인트를 적응시키기 전에 전이 실험을 정의합니다.
| 계약 | 필요한 결정 |
|---|---|
| 원천 아티팩트 | 모델/토크나이저/템플릿 해시와 사전 학습 체크포인트 |
| 목표 데이터 | 출처, 클러스터 분할, 레이블/주석자 품질, 평가 격리 |
| 적응 | 전체/어댑터 파라미터, 옵티마이저, LR/워밍업, 유효 토큰, 절단·마스크 |
| 대조군 | 처음부터 학습 또는 작은 체크포인트, 무적응 기준선, 관련 RAG/프롬프트 기준선 |
| 지표 | 고정 홀드아웃 목표 과업, OOD 슬라이스, 보정, 안전, 기본 능력 유지, 비용 |
| 통계 | 대응 표본, 가능한 여러 시드, 신뢰 구간, 중요 슬라이스 최소 표본 수 |
체크포인트 전체에 고정 홀드아웃 말뭉치를 사용하고 비공개 릴리스 세트에서 튜닝하지 않습니다. 최대 토큰/스텝 예산과 평가 주기를 미리 선언합니다. 목표를 달성하거나 중요한 유지·안전 게이트가 실패하거나 선언한 인내 구간 동안 개선이 불확실성 구간 안에 머물면 중단합니다. 완전한 체크포인트를 저장하여 마지막 스텝만이 아니라 가장 좋은 파레토 지점에서 후속 단계를 분기할 수 있게 합니다.
5. 실무 전이 매트릭스
| 관찰된 요구 | 첫 기준선 | 가중치 적응을 정당화하는 조건 |
|---|---|---|
| 최신성·출처가 필요한 사실 | RAG | 검색된 도메인 문서를 모델이 해석하지 못함 |
| 출력 형식 또는 도구 정책 | 프롬프트/SFT | 홀드아웃 프롬프트에서 반복 행동 오류 |
| 넓은 도메인 언어 분포 | 지속 사전 학습 | RAG/SFT가 표현·유창성 격차를 닫지 못함 |
| 적은 레이블 예제 | 프롬프팅/어댑터 | 유지 능력을 지키며 기준선을 안정적으로 개선 |
| 잡음이 있는 약한 감독 | 레이블 필터·보정 | 체계적 오류를 복제하지 않고 감사 슬라이스 개선 |
이 표는 출발점이지 고정 파이프라인이 아닙니다. 가장 저렴하고 되돌리기 쉬운 기준선을 먼저 실행하고 홀드아웃 증거가 있을 때만 가중치 변경을 승격합니다.
6. 파운데이션 모델 학습 파이프라인
출처: AI 생성 이미지.
흔한 순서는 다음과 같습니다.
- 데이터·토크나이저 계약을 고정하고 스케일링 파일럿을 실행합니다.
- 복구 가능한 분산 체크포인트로 베이스 모델을 사전 학습합니다.
- 측정된 분포 격차가 있으면 지속 사전 학습을 선택적으로 사용합니다.
- 목표 상호 작용·과업 행동을 위해 SFT를 적용합니다.
- 선호도 데이터와 평가가 정당화할 때만 선호도 최적화를 사용합니다.
- 도메인, 유지, 안전, 지연, 비용, 롤백 게이트에서 릴리스 아티팩트를 선택합니다.
각 화살표는 평가 게이트입니다. 뒤 단계가 한 표면을 개선하면서 다른 표면을 악화할 수 있으므로 “더 많은 학습”은 단조로운 진행 지표가 아닙니다.
Quizzes
Quiz 1: 유효 전이 데이터의 멱법칙이 모델 크기에 따른 지수적 이득을 뜻하지 않는 이유는 무엇인가요?
같은 관계는 멱법칙이고 지수는 특정 범위에서 추정됐습니다. 외삽하려면 같은 아키텍처·데이터 가정이 필요하거나 새로운 다운스트림 측정이 필요합니다.
Quiz 2: 대형 언어 모델 실행에서 학습 손실은 평평하고 검증 손실은 높습니다. 그로킹을 기대하며 계속 학습해야 하나요?
그 이유만으로는 안 됩니다. 그로킹은 선택된 범위에서 관찰됐습니다. 사전 정의한 홀드아웃 프로브, 불확실성, 인내 구간, 예산, 안전·유지 게이트를 따르고 개선이 없으면 중단하거나 분기합니다.
Quiz 3: 강한 학생이 약한 감독자를 능가했습니다. 약한-강한 정렬이 성공한 것인가요?
부분적인 증거일 뿐입니다. 강한/인간 감독과 비교하고 불일치·OOD 슬라이스, 보정, 안전, 물려받은 체계적 오류를 검사해야 합니다. 약한 기준선을 넘었다고 감독 격차가 닫힌 것은 아닙니다.
Quiz 4: 엔트로피 최소화가 약한-강한 학습을 해칠 수 있는 이유는 무엇인가요?
정확성이 아니라 자신감을 보상하기 때문입니다. 감독자 오류나 분포 이동에서 틀린 예측을 더 날카롭게 할 수 있으므로 엔트로피 목표가 없는 기준선과 보정·선택적 위험을 비교해야 합니다.
Quiz 5: 사전 학습 손실이 계속 낮아지는데도 중간 체크포인트를 저장해야 하는 이유는 무엇인가요?
가장 좋은 다운스트림 적응, 유지, 안전, 수명 주기 비용 지점이 최소 사전 학습 손실보다 앞에 있을 수 있습니다. 완전한 중간 체크포인트가 측정한 파레토 최적점에서 후속 단계를 시작하게 합니다.
References
- Hernandez, D., et al. (2021). Scaling Laws for Transfer. arXiv:2102.01293.
- Power, A., et al. (2022). Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets. arXiv:2201.02177.
- Burns, C., et al. (2023). Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision. arXiv:2312.09390.