Qué pasó
A medida que los modelos de lenguaje escalan, demandan cada vez más datos de entrenamiento, pero algunas fuentes valiosas —como idiomas con pocos recursos o dominios especializados— existen solo en cantidades limitadas.
Investigadores de Apple Machine Learning estudiaron una solución habitual: mezclar esos datos objetivo, escasos pero valiosos, con datos genéricos abundantes.
Con más de 2,000 ejecuciones de entrenamiento de modelos de lenguaje, el estudio analizó el equilibrio entre exponer poco al modelo al dominio objetivo y repetir demasiado los mismos ejemplos objetivo.
Los resultados muestran que muy pocos datos objetivo debilitan el rendimiento en ese dominio, mientras que demasiados llevan a rendimientos decrecientes y, finalmente, a sobreajuste.
Por qué importa
Este trabajo pone de relieve una tensión central en el preentrenamiento: la escasez de datos no siempre se resuelve añadiendo más datos, por lo que el diseño de la mezcla se convierte en una palanca de control crítica.
Para quienes construyen modelos orientados a dominios especializados o poco atendidos, entender este equilibrio es esencial para decidir con qué intensidad ponderar los datos objetivo limitados sin sacrificar la generalización.
Las leyes de escalado que tengan en cuenta fuentes de datos restringidas podrían llevar a decisiones más fundamentadas sobre la composición de los conjuntos de datos a medida que crece el tamaño de los modelos.
Datos clave
El escalado de los modelos de lenguaje aumenta las necesidades de datos, pero algunas fuentes de datos objetivo son, por naturaleza, limitadas en tamaño.
Una estrategia habitual es mezclar datos objetivo escasos con datos genéricos abundantes.
El estudio examinó este equilibrio a lo largo de más de 2,000 ejecuciones de entrenamiento de modelos de lenguaje.
Qué observar a continuación
Trabajos futuros podrían traducir estos hallazgos en pautas prácticas sobre las proporciones de mezcla óptimas para dominios con datos limitados.
Se espera que la futura investigación sobre leyes de escalado incorpore explícitamente los efectos de la repetición de datos y el sobreajuste al predecir el rendimiento de los modelos.
