Qué ocurrió
AWS Machine Learning publicó la segunda entrada de una serie de dos partes sobre la preparación de datos para el ajuste fino supervisado.
La publicación explora enfoques avanzados: usar curvas de aprendizaje para evaluar si los datos están listos, elegir subconjuntos de datos de alto valor, aumentar los datos con ejemplos sintéticos y destilados, y combinar fuentes de datos para contrarrestar el olvido catastrófico.
Por qué importa
Las decisiones sobre la preparación de datos pueden influir considerablemente en el rendimiento de un modelo ajustado, lo que hace que estas estrategias avanzadas sean útiles para los equipos que perfeccionan sus flujos de entrenamiento.
Los datos sintéticos y la combinación de datos ofrecen formas prácticas de superar las limitaciones de los datos etiquetados y de reducir el riesgo de que un modelo pierda capacidades aprendidas previamente.
Datos clave
Esta es la segunda parte de una serie de dos entregas sobre la preparación de datos para el ajuste fino supervisado.
La publicación aborda la evaluación de la preparación de los datos mediante curvas de aprendizaje.
También cubre la selección de subconjuntos de datos de alto valor, el aumento de datos con ejemplos sintéticos y destilados, y la combinación de fuentes de datos para evitar el olvido catastrófico.
Qué observar a continuación
Es posible que los lectores busquen orientación sobre cómo aplicar las curvas de aprendizaje para decidir cuándo los datos de entrenamiento son suficientes.
El uso de fuentes de datos sintéticas, destiladas y combinadas podría convertirse en una parte más habitual de los flujos de trabajo de ajuste fino.
