Configuración de un experimento de clasificación o regresión

AutoAI Ofrece configuraciones de experimentos que puede utilizar para configurar y personalizar sus experimentos de clasificación o regresión.

Resumen de la configuración del experimento

Después de cargar los datos del experimento y seleccionar el tipo de experimento y qué predecir, AutoAI establece las configuraciones y métricas predeterminadas para su experimento. Puede aceptar estos valores predeterminados y continuar con el experimento, o hacer clic en Configuración del experimento para personalizar las configuraciones. Al personalizar las configuraciones, puede controlar con precisión cómo el experimento construye los modelos candidatos.

Utilice las siguientes tablas como guía para configurar los experimentos de clasificación y regresión. Para obtener más información sobre cómo configurar un experimento de series temporales, consulte Creación de un experimento de series temporales.

Configuración de predicciones

La mayoría de los ajustes de predicción se encuentran en la página principal General. Revise o actualice los siguientes ajustes.

Valor Descripción
Tipo de predicción Puede cambiar o anular el tipo de predicción. Por ejemplo, si AutoAI solo detecta dos clases de datos y configura un experimento de clasificación binaria, pero usted sabe que hay tres clases de datos, puede cambiar el tipo a multiclase.
Clase positiva Para los experimentos de clasificación binaria optimizados para precisión, precisión media, recuperación o F1, se requiere una clase positiva. Confirme que la clase positiva es correcta o el experimento podría generar resultados inexactos.
Métrica optimizada Cambiar la métrica para optimizar y clasificar los posibles modelos.
Tiempo de ejecución optimizado Seleccione cómo AutoAI debe optimizar el tiempo de ejecución de su experimento. Si no optimizas para el tiempo de ejecución, AutoAI se centra en lograr la mayor precisión posible, pero tu experimento tardará más en completarse. Si eliges optimizar, AutoAI se centra más en un tiempo de ejecución más corto y menos en la precisión. Puede aplicar este enfoque durante la selección del algoritmo, durante el ajuste de hiperparámetros o en ambas fases para obtener resultados más rápidos.
Algoritmos que se deben incluir Seleccione cuál de los algoritmos disponibles evaluar cuando se ejecute el experimento. La lista de algoritmos depende del tipo de predicción seleccionado.
Algoritmos que se deben utilizar AutoAI prueba los algoritmos especificados y utiliza los que mejor rendimiento ofrecen para crear canalizaciones de modelos. Elija cuántos de los mejores algoritmos desea aplicar. Cada algoritmo genera entre 4 y 5 canalizaciones, lo que significa que si selecciona 3 algoritmos para utilizar, los resultados de su experimento incluirán entre 12 y 15 canalizaciones clasificadas. Más algoritmos aumentan el tiempo de ejecución del experimento.

Configuración de equidad de datos

Haga clic en la pestaña «Equidad» para evaluar la equidad de su experimento en cuanto a los resultados previstos. Para obtener más información sobre cómo configurar la detección de imparcialidad, consulte Aplicación de pruebas de imparcialidad a AutoAI los experimentos.

Configuración de la fuente de datos

La pestaña General de la configuración de la fuente de datos ofrece opciones para configurar cómo el experimento consume y procesa los datos para entrenar y evaluar el experimento.

Valor Descripción
Datos ordenados Indica si tus datos de entrenamiento están ordenados secuencialmente, según un índice de filas. Cuando los datos de entrada son secuenciales, el rendimiento del modelo se evalúa en los registros más recientes en lugar de en una muestra aleatoria, y los datos de validación utilizan los últimos n registros del conjunto en lugar de n registros aleatorios. Los datos secuenciales son necesarios para los experimentos de series temporales, pero opcionales para los experimentos de clasificación y regresión.
Filas duplicadas Para acelerar el entrenamiento, puede optar por omitir las filas duplicadas en sus datos de entrenamiento.
Método de submuestreo para la selección de tuberías Si se trata de un conjunto de datos extenso, utiliza un subconjunto de datos para entrenar el experimento. Esta opción acelera los resultados, pero puede afectar a la precisión.
Refinamiento de características Especifique cómo gestionar las características que no tienen impacto en el modelo. Las opciones son eliminar siempre la característica, eliminarla cuando mejore la calidad del modelo o no eliminarla. Para obtener más información sobre cómo se calcula la importancia de las características, consulte los AutoAI detalles de implementación.
Imputación de datos Interpola los valores que faltan en tu fuente de datos. Para obtener más información sobre la gestión de la imputación de datos, consulte Imputación de datos en AutoAI experimentos.
Procesamiento de fecha y hora Habilitado de forma predeterminada para detectar la columna de fecha y añadir nuevas columnas para diferentes tipos de agregaciones de formato de fecha/hora. Desactive esta opción cuando desee utilizar una columna de fecha/hora como ID en lugar de como valor de fecha/hora.
Ingeniería de características de texto Cuando está habilitado, las columnas que se detectan como texto se transforman en vectores para analizar mejor la similitud semántica entre cadenas. Habilitar esta configuración puede aumentar el tiempo de ejecución. Para obtener más información, consulta «Creación de un experimento de análisis de texto ».
Conjunto de datos de entrenamiento final Selecciona los datos que se utilizarán para entrenar los procesos finales. Si decide incluir solo datos de entrenamiento, los cuadernos generados incluirán una celda para recuperar los datos de validación que se utilizan para evaluar cada canalización.
Tratamiento de los valores atípicos Elija si AutoAI excluye los valores atípicos de la columna de destino para mejorar la precisión del entrenamiento. Si está habilitado, AutoAI utiliza el método del rango intercuartílico (IQR) para detectar y excluir valores atípicos de los datos de entrenamiento finales, ya sean solo datos de entrenamiento o datos de entrenamiento más datos de validación.
Método de entrenamiento y validación Los datos de formación se utilizan para formar el modelo y los datos de retención se retiran de la formación del modelo y se utilizan para medir el rendimiento del modelo. Para los modelos de clasificación y regresión, puede dividir una única fuente de datos en datos de entrenamiento y datos de prueba (retención), o puede utilizar un segundo archivo de datos específico para los datos de prueba. Si divide los datos de entrenamiento, especifique los porcentajes que se utilizarán para los datos de entrenamiento y los datos de validación. Los datos de validación no deben superar un tercio de los datos de entrenamiento. También puede especificar el número de pliegues, desde los tres pliegues predeterminados hasta un máximo de 10. La validación cruzada divide los datos de entrenamiento en pliegues, o grupos, para evaluar el rendimiento del modelo.
Selecciona las funciones que deseas incluir Seleccione las columnas de su fuente de datos que contengan datos que respalden la columna de predicción. Excluir columnas superfluas puede mejorar el tiempo de ejecución.

Valores de ejecución

Revise la configuración del experimento o cambie los recursos informáticos asignados para ejecutar el experimento.

Próximos pasos

Configurar un experimento de análisis de texto