파운데이션 모델 엔지니어링

17.1 Academic Benchmarks

Benchmark는 item set, prompt/template, harness, tool, decoding budget, answer extractor, grader, statistic으로 구성된 측정 protocol입니다. 이 protocol이 없는 score는 비교 가능한 evidence가 아닙니다. Academic benchmark는 유용한 standardized probe지만 production decision에는 private task와 operational metric이 필요합니다.


프론티어 벤치마크 지도

하나의 general-intelligence score를 선언하지 말고 benchmark family로 서로 다른 capability를 sampling합니다.

FamilyExamplesPrimary capabilityCommon confound
Knowledge/reasoningMMLU, GPQAclosed-form knowledge와 reasoningcontamination, prompt format
MathGSM8K, MATHnumerical·symbolic reasoninganswer extraction, tool access
CodeHumanEval, MBPP, SWE-benchgeneration 또는 repository issue 해결hidden test, scaffold, compute
Long contextretrieval·synthesis suitedistant evidence 사용position, truncation, retrieval setup
Agents/toolsWebArena, OS/task suitemulti-step environment successscaffold, credential, stochastic state
Safetypolicy-specific red-team suitecompliance/refusal calibrationrubric, threat model

Task version/split, contamination 상태, system prompt, few-shot example, tool/retrieval access, context/reasoning budget, sampling count, judge, report date를 기록합니다. Agentic result는 model-plus-scaffold system의 결과입니다.


멀티모달 평가

멀티모달 평가(Multimodal Evaluation) 에는 input rendering과 perception dependency가 추가됩니다. Image resolution과 tiling, video frame sampling과 audio 포함 여부, OCR preprocessing, crop order, media compression, grounded coordinate 또는 temporal evidence 요구를 기록합니다.

Text-only variant는 language prior를 드러내고 counterfactual media와 shuffled frame은 grounding을 검사합니다. Accessibility·language slice를 평가하고 perception failure와 reasoning·answer-format failure를 구분합니다. Proprietary media에는 license·retention constraint도 있을 수 있습니다.


Metric을 엄밀하게 설계하기

Multiple Choice와 Short Answer

Accuracy는 normalization, option order, scoring mode, abstention을 정의한 뒤에만 의미가 있습니다. Direct generation과 log-probability scoring을 신중히 비교합니다. Chat template과 option-token length가 결과를 바꿀 수 있습니다. Option order를 randomize해 position bias를 진단하고 confidence가 중요하면 calibration 또는 selective accuracy를 보고합니다.

Generated Answer

Extractor도 metric의 일부입니다. Normalization, unit, alias, numeric tolerance, citation requirement, invalid-output 처리를 versioning합니다. Exact, rule-based, LLM grader가 불일치한 사례를 stratified sample로 검사합니다.

Code와 Agent

nn개 생성 code sample 중 hidden test를 통과한 것이 cc개일 때 unbiased estimator는

pass@k=1(nck)(nk),nk.\operatorname{pass@}k = 1-\frac{\binom{n-c}{k}}{\binom{n}{k}}, \qquad n\ge k.

Pass@k Calculator

Evaluate the probability of generating at least one correct solution.

100
10
5
0.0%
If you generate 100 samples and the model naturally gets 10 of them right, picking 5 samples at random gives you a 0.0% chance of passing the benchmark.

nn, kk, temperature, token/compute budget, timeout, sandbox, dependency, test version, retry policy를 보고합니다. Agent는 side-effect correctness와 budget까지 성공 조건에 포함해야 하며 말로 성공했다고 주장하는 것은 completion이 아닙니다.


통계적 비교

고정 evaluation harness(fixed evaluation harness) 와 paired case로 champion과 candidate를 비교합니다. Binary paired outcome은 difference와 paired bootstrap 신뢰구간(confidence interval) 또는 paired test를 보고합니다. Continuous/judge score도 pairing을 보존하고 repeated variant는 cluster로 묶습니다. Tie 처리, minimum effect, confidence interval, sample size/power 근거, multiple-comparison policy를 사전에 정합니다.

0.5 point average gain은 noise일 수도 있고 critical regression을 숨길 수도 있습니다. Domain/safety/language/tool slice별 sample count와 lower bound를 보고합니다. Sampling variance가 system 일부이면 여러 decoding seed를 사용하고 한 prompt의 반복 sample을 독립 task처럼 취급하지 않습니다.


Contamination과 Dynamic Test

Prompt, answer, rubric, solution, semantic neighbor, teacher-generated variant를 evaluation registry에서 보호합니다. 최종 rendered/tokenized training corpus를 검사합니다. Public benchmark는 longitudinal anchor로 유용하지만 uncontaminated generalization을 단독으로 입증하지 못합니다.

Fresh·dynamic test는 direct memorization risk를 줄이지만 template, judge, log, synthetic teacher를 통한 leakage를 제거하지 않습니다. Timestamped private case를 사용하고 exposed item을 rotate하면서 stable anchor set을 유지합니다. 운영 계약은 Contamination Issues를 참고합니다.


실무용 벤치마크 설계 체크리스트

Score를 공개하거나 의사결정에 쓰기 전에 확인합니다.

  • 정확한 artifact bundle과 harness commit이 고정되었습니다.
  • task version, split, prompt/template, tool, budget이 문서화되었습니다.
  • missing/invalid output을 조용히 0으로 바꾸지 않고 보존합니다.
  • answer extractor, judge, test, environment가 versioning되었습니다.
  • paired uncertainty, sample count, slice minimum이 보고됩니다.
  • contamination registry와 final-corpus scan이 기록됩니다.
  • raw output과 adjudicated disagreement가 보존됩니다.
  • 배포 결정에는 cost, latency, error, reproducibility가 포함됩니다.

최종 권고는 universal best model을 지목하는 대신 quality/cost/latency/context/openness/safety Pareto surface를 설명하고 private evaluation을 요구해야 합니다.


Quizzes

Quiz 1: Benchmark score를 harness와 분리할 수 없는 이유는 무엇인가요? Prompt, template, tool, budget, extraction, grading이 결과를 바꿉니다. 평가 대상은 complete protocol 안의 model입니다.

Quiz 2: pass@k는 무엇을 추정하나요? n개 sample 중 c개가 correct일 때 benchmark의 sampling·test setup 아래 k개 중 하나 이상이 correct일 확률을 추정합니다.

Quiz 3: Paired confidence interval을 사용하는 이유는 무엇인가요? Champion과 candidate가 같은 case에 답합니다. Pairing은 item difficulty를 통제하고 unrelated average가 아니라 per-case difference 분포를 추정합니다.

Quiz 4: Dynamic benchmark도 contamination될 수 있는 이유는 무엇인가요? Template, rubric, judge, 이전 prompt가 노출될 수 있고 log가 미래 training data가 될 수 있습니다. Fresh timestamp는 한 경로를 줄이지만 lineage isolation을 증명하지 않습니다.


References

  1. Hendrycks, D., et al. (2021). Measuring Massive Multitask Language Understanding. ICLR.
  2. Chen, M., et al. (2021). Evaluating Large Language Models Trained on Code. arXiv:2107.03374.
  3. Liang, P., et al. (2022). Holistic Evaluation of Language Models. arXiv:2211.09110.
  4. Jimenez, C. E., et al. (2024). SWE-bench: Can Language Models Resolve Real-World GitHub Issues? ICLR.