Visão geral do AutoAI
A ferramenta gráfica AutoAI analisa seus dados e usa algoritmos de dados, transformações e configurações de parâmetro para criar o melhor modelo preditivo.. AutoAI exibe vários modelos em potencial como pipelines de candidato de modelo e os classifica em uma tabela de classificação para você escolher.
- Formato de dados Tabular:
- CSV ou arquivos Parquet, com delimitador de vírgula (,) para todos os tipos de experimentos do AutoAI.
- Dados conectados do Networking File System (NFS).
- Dados de conexões de dados suportadas. Para obter detalhes, consulte AutoAI data use..
Tamanho de dados Limites em arquivos de dados correspondem ao tamanho do cálculo que você escolhe para um experimento. Consulte a seguinte lista de conexões de dados suportadas para obter mais detalhes.
AutoAI uso de dados
Dados de treinamento e dados de entrada do modelo estão em um formato tabular. Os nomes de colunas na tabela devem ser exclusivos Nomes de colunas duplicados resultarão em erro.
Conexões de dados suportadas para treinamento de modelos AutoAI :
- Amazon S3
- DataStax Enterprise
- Db2
- Dremio
- Exasol
- genérico jdbc
- generics3
- Google BigQuery
- Microsoft SQL Server
- MySQL
- PostgreSQL
- Netezza Performance Server
- Presto
- SingleStoreDB
- Snowflake
- Teradata
- Arquivos em uma infraestrutur IBM Cloud Object Storage
- Arquivos em uma Conexão Volume de Armazenamento
- Arquivos em IBM Cloud Object Storage ( S3 ), incluindo Parquet e Microsoft Excel
Notas para acessar folhas do Microsoft Excel:
- Se você incluir dados da conexão Cloud Object Storage , poderá selecionar o arquivo ou a planilha diretamente.
- Se você adicionar dados conectados, certise-se de que os dados conectados apontam para a folha de Excel que você deseja usar.
Notas para integração com projetos Git :
- É possível treinar experiencias e salvar os modelos resultantes em projetos baseados em Git
- Os modelos salvos podem ser compartilhados com os colaboradores do projeto, mas os ativos de treinamento e metadados associados não são salvos.
- Para incluir um modelo AutoAI de um projeto baseado em Gitem um espaço de implementação, crie um arquivo ZIP de exportação para o projeto que contém o modelo Em seguida, siga as etapas em Importando ativos de espaço e de projeto para espaços de implementação no Watson Machine Learning para importar o arquivo ZIP para um espaço
Escolhendo uma configuração de cálculo
Ao configurar o seu experimento, você pode escolher uma configuração de cálculo que forneça os recursos de computação para o seu experimento. A configuração que você escolhe governa os limites de dados.
| Configuração de cálculo | Recursos | Limites de dados. |
|---|---|---|
| Pequeno | 2vCPUs e 8 GB de RAM | Se você usar um arquivo de dados, conexão de dados ou um ativo de dados conectado (ex: tabela de banco de dados) que exceda 100 MB, uma amostra aleatória de 100 MB será usada. Nota: o aprendizado incremental não está disponível com esta configuração. |
| Médio | 4 CPU e 16 GB | Se você usar um arquivo de dados, conexão de dados ou um ativo de dados conectado (ex: tabela de banco de dados) que exceda 100 MB, uma amostra aleatória de 100 MB será usada. |
| Grande | 8 CPU e 32 GB | Se você usar um arquivo de dados, uma conexão de dados ou um ativo de dados conectado que exceda 1 GB, uma amostra aleatória de 0.7 será usada. |
| Muito grande | 16 CPU e 64 GB | Se você usar um arquivo de dados, conexão de dados ou um ativo de dados conectado que exceda 1 GB, uma amostra aleatória de 1 GB será usada. |
Notas:
- Você pode alterar como os seus dados de treinamento são amostrados a partir das Configurações de Experiência.
- Se você estiver usando uma origem de dados maior (até 100 GB), o experimento AutoAI poderá treinar com todos os dados usando combinação e aprendizado incremental.
- Se você estiver se conectando a um banco de dados como sua fonte de dados, a configuração do banco de dados afeta o desempenho do acesso aos dados. Por padrão, o AutoAI abre 4 conexões paralelas para um banco de dados para acelerar o download de dados No entanto, se a configuração do banco de dados não permitir 4 conexões, AutoAI retrocederá para o download usando 1 conexão por vez. A configuração do banco de dados para aceitar mais conexões melhora o desempenho de acesso aos dados.
- O número máximo de colunas de recurso para um experimento de classificação ou de regressão é 5000
Processo do AutoAI
Usando o AutoAI, é possível construir e implementar um modelo de aprendizado de máquina com recursos de treinamento sofisticados e sem codificação. A ferramenta faz a maior parte do trabalho para você.
Para visualizar o código que criou um experimento específico, ou interagir com o experimento programaticamente, é possível salvar um experimento como um bloco de notas
O AutoAI executa automaticamente as tarefas a seguir para construir e avaliar os pipelines de modelo candidato:
- Pré-processamento de dados
- Seleção de modelo automatizado
- Engenharia de recursos automatizados
- Otimização de hiperparâmetro
- Ensembling e aprendizagem incremental
Entendendo o processo AutoAI
Para obter detalhes adicionais sobre cada uma dessas fases, incluindo links para documentos de pesquisa associados e descrições dos algoritmos aplicados para criar os pipelines de modelo, consulte AutoAI
Pré-processamento de dados
A maioria dos conjuntos de dados contém diferentes formatos de dados e valores omissos, mas os algoritmos de aprendizado de máquina padrão funcionam apenas com números e sem valores omissos Portanto, AutoAI aplica vários algoritmos ou estimadores para analisar, limpar e preparar seus dados brutos para aprendizado de máquina. Essa técnica detecta e categoriza automaticamente os valores com base em recursos, como tipo de dados: categórico ou numérico. Dependendo da categorização, o AutoAI usa otimização de hiperparâmetro para determinar a melhor combinação de estratégias para imputação de valor omisso, codificação de recurso e ajuste de escala de recurso para seus dados.
Seleção de modelo automatizado
AutoAI usa seleção de modelo automatizado para identificar o melhor modelo para seus dados. Esta nova abordagem testa modelos potenciais contra pequenos subconjuntos dos dados e os classifica com base na precisão. Em seguida, AutoAI seleciona os modelos mais promissores e aumenta o tamanho do subconjunto de dados até identificar a melhor correspondência. Esta abordagem economiza tempo e melhora o desempenho, reduzindo gradualmente os modelos potenciais com base na precisão.
Para obter informações sobre como manipular pipelines gerados automaticamente para selecionar o melhor modelo, consulte Selecionando um modelo do AutoAI
Engenharia de recursos automatizados
A engenharia de recursos identifica o modelo mais preciso transformando dados brutos em uma combinação de recursos que melhor representam o problema. Essa abordagem exclusiva explora várias opções de construção de recursos de maneira estruturada e não exaustiva, ao mesmo tempo que maximiza progressivamente a precisão do modelo usando o aprendizado por reforço. Essa técnica resulta em uma sequência otimizada de conversões para os dados que melhor correspondem aos algoritmos da etapa de seleção de modelo
Otimização de hiperparâmetro
A otimização de hiperparâmetro refina os modelos de melhor desempenho AutoAI usa um novo algoritmo de otimização de hiperparâmetro para determinadas avaliações de função, como treinamento de modelo e pontuação, que são típicas no aprendizado de máquina. Essa abordagem identifica rapidamente o melhor modelo, apesar dos longos tempos de avaliação em cada iteração..
Ensembling e aprendizagem incremental
O processo de construção BatchedTreeEnsemble de pipelines sobre os pipelines classificados. Os pipelines de combinação fornecem recursos de aprendizado incrementais e podem ser usados para continuar o treinamento usando os dados restantes em uma origem subamostrada, dividindo os dados restantes em lotes, se necessário,. Cada lote de dados de treinamento é pontuado independentemente usando a métrica otimizada, para que seja possível revisar o desempenho de cada lote ao explorar os resultados. Para obter detalhes, consulte Incremental learning.
Próximas etapas
Tente o tutorial Iniciação rápida: construir e implementar um modelo de aprendizado de máquina com AutoAI .