Caso de estudio: Validación de modelos de Machine Learning en minería
Validación de modelos predictivos en minería
En este artículo abordamos la validación de modelos predictivos en minería. En un artículo anterior, revisamos la optimización de hiperparámetros, proceso que permite obtener modelos con buen desempeño sobre datos no vistos. Sin embargo, la optimización es solo una parte del proceso: permite seleccionar un modelo candidato, pero luego es necesario validarlo para determinar si es apto para su uso en la operación. Para mostrar cómo se realiza esta validación con sentido operacional, seguiremos un caso concreto: un modelo que predice la recuperación de planta.
Reconstrucción del material procesado
En este tipo de proyecto, la validación comienza reconstruyendo el material procesado. Para ello se trabaja con cuatro fuentes principales:
- Registros de movimiento de mineral: indican el origen y el tonelaje del material alimentado en cada período.
- Polígonos de extracción: permiten identificar las zonas, fases y bancos desde donde proviene el mineral.
- Modelo de bloques: aporta las características geológicas y geometalúrgicas del material extraído.
- Información de stocks: describe el material almacenado que posteriormente se incorpora a la alimentación de planta.
Al integrar estas cuatro fuentes es posible reconstruir el material procesado, aplicar el modelo y comparar su recuperación predicha con la registrada por la planta. A partir de esta reconstrucción, la validación avanza en dos niveles: primero se evalúa la capacidad predictiva del modelo sobre datos reservados y, segundo, se comprueba si el modelo representa adecuadamente la mezcla que llega a planta.
Nota: para proteger la confidencialidad, las figuras de este artículo utilizan datos artificiales construidos a partir de patrones operacionales reescalados, desplazados y perturbados; no conservan fechas, valores ni resultados de ninguna operación específica.
Primer nivel: capacidad predictiva sobre datos reservados
El primer nivel evalúa el modelo sobre un conjunto de prueba que no participó ni en el entrenamiento ni en la optimización. Cada punto representa una observación reservada para esta evaluación. En lugar de apoyarnos en una sola métrica, utilizamos un panel con varias vistas complementarias.

Cada componente entrega información distinta:
- Dispersión de valor real versus predicho, con densidad: ubica cada observación según su recuperación real y predicha sobre la línea de identidad 1:1. La densidad muestra dónde se concentra la mayor parte de los datos. En el mismo panel se reportan R², RMSE y MAE para resumir el ajuste y la magnitud de los errores.
- Boxplot comparativo: compara la distribución de la recuperación real con la predicha. Medianas, dispersiones y rangos similares indican que el modelo reproduce la distribución general del objetivo y no solo observaciones puntuales.
- Boxplot del error absoluto: resume la magnitud de las diferencias entre valores reales y predichos. Interesan una mediana baja y una cantidad acotada de errores extremos.
- Gráfico de probabilidad acumulada: compara ambas distribuciones en todo su rango. La cercanía entre las curvas permite detectar diferencias que pueden no aparecer en las métricas globales.
Este panel cubre el primer nivel de la validación: la capacidad predictiva sobre datos reservados. Sin embargo, para completar la evaluación del caso es necesario comprobar si ese desempeño se mantiene al representar el material que efectivamente llega a planta.
Segundo nivel: el cambio de escala hacia planta
Aquí aparece el principal cambio de escala del problema. El modelo predice a la escala de una muestra, un bloque o una unidad caracterizada. La planta, en cambio, procesa una mezcla proveniente de distintas fases, bancos y stocks. Un modelo puede predecir bien esas unidades por separado y aun así no reproducir la recuperación de planta si la mezcla real no se reconstruye correctamente.
La reconciliación aborda precisamente ese cambio de escala: el mismo modelo evaluado sobre los datos de prueba se aplica ahora al material caracterizado del modelo de bloques y de los stocks, y sus predicciones se cruzan con los registros de movimiento y el tonelaje alimentado. La recuperación de cada período se calcula ponderando los aportes por tonelaje y ley de cabeza, es decir, por su contenido de metal, lo que representa el balance metalúrgico de forma más fiel que un promedio simple.
La cobertura de información también forma parte del cálculo: para cada período se determina qué proporción del tonelaje alimentado pudo caracterizarse con información de mina o stock. Solo se interpretan los períodos que superan un umbral mínimo de cobertura, ya que una reconciliación basada en una fracción pequeña de la alimentación puede entregar resultados engañosos.
Una vez reconstruida la mezcla procesada, se define la escala temporal de comparación. Aunque la recuperación de planta se registra diariamente, esos valores también reflejan detenciones, tiempos de residencia, cambios de alimentación y variabilidad de medición que el modelo geometalúrgico no busca explicar directamente. Por esta razón, la reconciliación se realiza a escala semanal: la agregación reduce parte del ruido diario y permite observar con mayor claridad la señal asociada al material procesado.

La lectura de la reconciliación no se limita a la cercanía entre las curvas: también se revisan los cambios de nivel, el sesgo sostenido, la cobertura y la magnitud de las diferencias. Una separación puntual puede estar asociada a una condición operacional no representada por las características del mineral, pero esta hipótesis debe verificarse con los registros de proceso antes de atribuirle una causa.
Para complementar esta lectura temporal, la misma comparación puede expresarse como una razón mediante el factor F0, calculado como la recuperación de planta dividida por la recuperación predicha. Un valor igual a 1 representa coincidencia; valores superiores o inferiores indican la desviación relativa respecto de la predicción. A diferencia de la serie temporal, F0 permite identificar directamente los períodos que quedan fuera de la tolerancia definida para la reconciliación.

Tres vistas, un mismo proceso
Las tres vistas presentadas se conectan dentro de un mismo proceso: el panel de prueba mide el desempeño estadístico, la reconciliación comprueba cómo se comporta el modelo al representar la mezcla procesada, y el factor F0 resume la desviación relativa entre la recuperación real y la predicha. En conjunto, permiten seguir el modelo desde su evaluación predictiva hasta su aplicación en planta.
Este recorrido responde al objetivo específico de predecir recuperación y no constituye una metodología universal. Cada tipo de proyecto necesita su propio proceso de validación, adaptado a la variable que predice, la escala en que se utilizará el modelo y las condiciones de la operación. En recuperación de planta tiene sentido reconciliar por tonelaje y contenido de metal; en cambio, para estimar recuperación Rougher, mineralogías o variables de conminución se requieren otras escalas, métricas y criterios de aceptación.
Un trabajo multidisciplinario
Diseñar un proceso de validación adaptado requiere el trabajo conjunto de distintas disciplinas: el científico de datos diseña la evaluación y cuantifica el error, mientras que los geólogos aportan el conocimiento necesario para representar el material y juzgar si las comparaciones tienen sentido geológico. La validación del modelo surge, precisamente, de la integración de estas disciplinas.
Esta mirada conjunta permite distinguir entre seleccionar un buen modelo y demostrar que puede utilizarse en operación. La optimización de hiperparámetros permite seleccionar un modelo candidato; la validación determina si ese modelo puede utilizarse en un contexto operacional específico. El caso de recuperación de planta ilustra la idea central: un modelo no se considera confiable solo por obtener una buena métrica sobre datos de prueba, sino cuando supera un proceso de validación diseñado expresamente para el problema y las condiciones particulares de cada proyecto.