무슨 일이 있었나
언어 모델이 확장됨에 따라 더 많은 훈련 데이터가 필요하지만, 저자원 언어나 전문 분야와 같은 일부 가치 있는 소스는 제한된 양으로만 존재합니다.
Apple Machine Learning의 연구자들은 일반적인 해결 방법을 조사했습니다: 희소하면서도 가치가 높은 목표 데이터를 풍부한 일반 데이터와 혼합하는 것입니다.
이 연구는 2,000회 이상의 언어 모델 훈련 실행을 통해 모델을 목표 도메인에 덜 노출시키는 것과 동일한 목표 예제를 너무 자주 반복하는 것 사이의 균형을 분석했습니다.
연구 결과에 따르면 목표 데이터가 너무 적으면 목표 도메인 성능이 약해지고, 너무 많으면 수익 체감과 결국 과적합이 발생합니다.
왜 중요한가
이 작업은 사전학습의 핵심 긴장을 강조합니다: 데이터 부족은 항상 데이터를 더 추가한다고 해결되는 것이 아니므로, 혼합 설계가 중요한 제어 수단이 됩니다.
전문적이거나 충분히 서비스되지 않는 도메인을 겨냥한 모델 개발자에게는 일반화를 희생하지 않으면서 제한된 목표 데이터의 가중치를 얼마나 적극적으로 둘지 선택하는 데 있어 이 트레이드오프를 이해하는 것이 필수적입니다.
제한된 데이터 소스를 고려한 스케일링 법칙은 모델 크기가 커짐에 따라 데이터셋 구성에 대해 더 원칙적인 결정을 내리는 데 도움이 될 수 있습니다.
주요 사실
언어 모델 확장은 데이터 요구 사항을 증가시키지만, 일부 목표 데이터 소스는 본질적으로 크기가 제한되어 있습니다.
일반적인 전략은 희소한 목표 데이터를 풍부한 일반 데이터와 혼합하는 것입니다.
이 연구는 2,000회 이상의 언어 모델 훈련 실행에서 이러한 트레이드오프를 검토했습니다.
다음에 주목할 점
추가 작업은 이러한 결과를 데이터 제약 도메인을 위한 최적 혼합 비율에 대한 실용적인 지침으로 변환할 수 있습니다.
향후 스케일링 법칙 연구는 모델 성능을 예측할 때 데이터 반복과 과적합 효과를 명시적으로 포함할 것으로 기대됩니다.
