何が起きたか
言語モデルがスケールするにつれて、より多くのトレーニングデータが必要になりますが、低リソース言語や専門分野などの貴重なデータソースは限られた量しか存在しません。
Apple Machine Learningの研究者らは、一般的な回避策を調査しました。それは、希少で価値の高いターゲットデータを豊富な一般的なデータと混ぜるというものです。
2,000回以上の言語モデルトレーニング実行を用いて、研究はモデルをターゲットドメインに十分に露出させないことと、同じターゲット例を繰り返し過ぎることのバランスを分析しました。
調査結果は、ターゲットデータが少なすぎるとターゲットドメインのパフォーマンスが低下し、多すぎると収穫逓減と最終的な過学習につながることを示しています。
なぜ重要か
この研究は、事前学習における中心的な緊張関係を浮き彫りにしています。データ不足は常にデータを追加することで解決できるわけではなく、混合設計が重要な制御手段となるのです。
専門分野や十分にサービスが行き届いていない分野を対象としたモデルの開発者にとって、一般化を犠牲にせずに限られたターゲットデータをどの程度積極的に重み付けするかを選択するには、このトレードオフを理解することが不可欠です。
制約のあるデータソースを考慮したスケーリング法則は、モデルサイズが大きくなるにつれて、データセット構成に関するより原理的な決定につながる可能性があります。
重要な事実
言語モデルのスケーリングはデータ要件を増大させますが、一部のターゲットデータソースは本質的にサイズが限られています。
一般的な戦略は、希少なターゲットデータを豊富な一般的なデータと混ぜることです。
研究では、2,000回以上の言語モデルトレーニング実行にわたってこのトレードオフを調査しました。
今後の注目点
今後の研究では、データに制約のあるドメイン向けの最適な混合比率に関する実用的なガイダンスにこれらの発見を変換する可能性があります。
将来のスケーリング法則研究では、モデルのパフォーマンスを予測する際に、データの反復と過学習の影響を明示的に組み込むことが期待されます。
