Como o SQL pushback funciona?
Os principais alvos da geração de SQL são as partes iniciais de um fluxo que vêm após os nós de importação de dados. Quando SPSS Modeler encontra um nó que não pode ser compilado para SQL, SPSS Modeler extrai os dados do banco de dados e os processa.
Durante a preparação e a execução do fluxo, o processo de geração de SQL ocorre da seguinte forma:
- SPSS Modeler reordena os fluxos para mover os nós downstream para a "zona SQL" onde for comprovadamente seguro fazê-lo.
- SPSS Modeler trabalha a partir dos nós de importação em direção aos nós terminais, construindo expressões SQL de forma incremental.
- Essa fase é interrompida quando SPSS Modeler chega a um nó que não pode ser convertido em SQL ou o nó terminal em um fluxo é convertido em SQL (por exemplo, um nó de tabela ou um nó de gráfico).
- Para otimizar o desempenho, os nós podem ser excluídos do processo de geração de SQL se a saída desse nó não for usada em nós posteriores. Por exemplo, se um nó Derive criar uma nova coluna que não seja usada em um nó Matrix downstream, o nó Derive será excluído da geração de SQL. Um ícone de SQL não aparece ao lado do nó Derive no final da geração de SQL.
Figura 1. Geração de SQL excluindo nós 
- No término dessa fase, cada nó será rotulado com uma instrução SQL se o nó e seus predecessores tiverem uma SQL equivalente.
- A validade do SQL é verificada. SPSS Modeler funciona dos nós que têm os equivalentes SQL mais complicados para os nós de importação. A SQL que for validada com sucesso é escolhida para execução.
- Os nós para os quais todas as operações geraram SQL são destacados com um ícone de SQL ao lado do nó na tela de fluxo. Com base nos resultados, talvez você queira reorganizar ainda mais o fluxo, onde for apropriado, para aproveitar ao máximo a execução do banco de dados.
Onde ocorrem as melhorias?
O pushback de SQL melhora o desempenho de várias operações de dados:
- Uniões (mesclagem por chave)
- As operações de junção podem aumentar a otimização dentro dos bancos de dados.
- Agregação
- Os nós Agregado, Distribuição e da Web utilizam agregação para produzir seus resultados. Os dados sumarizados usam consideravelmente menos largura da banda do que os dados originais.
- Seleção
- A escolha de registros com base em determinados critérios reduz a quantidade de registros.
- Classificação
- A ordenação de registros é uma atividade que exige recurso intensivo e é executada de modo mais eficiente em um banco de dados.
- Derivação de campo
- Novos campos são gerados com mais eficiência em um banco de dados.
- Projeção de campo
- O software extrai apenas os campos necessários para o processamento subsequente do banco de dados, o que minimiza os requisitos de largura de banda e memória. O mesmo também é verdade para campos supérfluos em arquivos simples: embora o software deva ler os campos supérfluos, ele não aloca nenhum armazenamento para eles.
- Pontuação
- A SQL pode ser gerada a partir de modelos de árvores de decisão, de conjuntos de regras, de regressão linear e gerados por fator.