Detalhes de entrada da implementação em lote para modelos SPSS

Siga estas regras quando estiver especificando detalhes de entrada para implantações em lote de modelos SPSS.

Tabela de resumo do tipo de dados:

Tipos de dados e formatos de arquivos aceitos
Dados Descrição
Tipo Referências de dados, em linha
Formatos de arquivos CSV

Origens de dados

Referências de dados de entrada ou saída:

Notas:

  • Para conexões de armazenamento em nuvem, como Cloud Object Storage, você deve configurar a chave de acesso e a chave secreta, também conhecidas como credenciais HMAC.
  • Para implementações do SPSS , essas origens de dados não são compatíveis com o Federal Information Processing Standard (FIPS):
    • Cloud Object Storage
    • Cloud Object Storage (infrastructure)
    • volumes de Armazenamento
  • Os nomes de tabelas que são fornecidos nas referências de dados de entrada e saída são ignorados. Os nomes de tabelas mencionados no modelo SPSS são usados durante a implantação em lote.
  • Use SQL PushBack para gerar instruções SQL para operações IBM SPSS Modeler que podem ser "enviadas por push" ou executadas no banco de dados para melhorar o desempenho. SQL Pushback é suportado apenas por:
    • Db2
    • SQL Server
    • Netezza Performance Server

Uso de dados conectados para uma implantação em lote

Um fluxo do SPSS Modeler pode ter vários nós de importação e exportação de dados. Se os nós usarem conexões de banco de dados, eles deverão ser configurados com os nomes das tabelas nas fontes de dados e nos destinos. Esses nomes de tabela são usados posteriormente para trabalhos em lote. Use os nós de Data Asset para importar dados e os nós de Data Asset Export para exportar dados. Quando estiver configurando os nós, escolha o nome da tabela em Connections; não escolha um ativo de dados em seu projeto. Defina os nomes dos nós e das tabelas antes de salvar e implantar o modelo no watsonx.ai Runtime.

Quando você implantar o modelo em um espaço de implantação, verifique se os nós se conectam a um banco de dados compatível no espaço de implantação. Em uma implantação em lote do modelo, os detalhes da conexão são selecionados a partir das referências de dados de entrada e saída, mas os nomes das tabelas de entrada e saída são selecionados a partir do modelo SPSS Modeler. Os nomes das tabelas de entrada e saída fornecidos nas referências de dados conectados são ignorados.

Para a implantação em lote de um modelo SPSS que usa uma conexão Cloud Object Storage, certifique-se de que o modelo SPSS tenha um único nó de ativo de dados de entrada e saída.

Combinações suportadas de origens de entrada e saída

Você deve especificar fontes de dados e destinos compatíveis para a entrada e a saída do trabalho em lote. Se você especificar fontes de dados e destinos incompatíveis, receberá um erro ao tentar executar o trabalho em lote.

Essas combinações são suportadas para tarefas em lote:

Combinações suportadas para trabalhos em lote
SPSS entrada/saída do modelo Entrada da tarefa de implementação em lote  Saída de tarefa de implementação em lote
Arquivo Ativo de dados local, gerenciado ou referenciado ou ativo de conexão (arquivo) Ativo de dados remotos ou ativo de conexão (arquivo) ou nome
Banco de dados Ativo de dados remotos ou ativo de conexão (banco de dados) Ativo de dados remotos ou ativo de conexão (banco de dados)

Especificando diversas entradas

Se estiver especificando várias entradas para uma implantação de modelo SPSS sem esquema, especifique uma ID para cada elemento em input_data_references.

Para obter mais informações, consulte Usando várias fontes de dados para uma tarefa do SPSS

Neste exemplo, ao criar a tarefa, forneça três entradas de entrada com IDs: sample_db2_conn, sample_teradata_conne sample_googlequery_conn e selecione os dados conectados necessários para cada entrada.

{
"deployment": {
    "href": "/v4/deployments/<deploymentID>"
  },
  "scoring": {
  	  "input_data_references": [{
               "id": "sample_db2_conn",
               "name": "DB2 connection",
               "type": "data_asset",
               "connection": {},
               "location": {
                     "href": "/v2/assets/<asset_id>?space_id=<space_id>"
               },
           },
           {
               "id": "sample_teradata_conn",
               "name": "Teradata connection",
               "type": "data_asset",
               "connection": {},
               "location": {
                     "href": "/v2/assets/<asset_id>?space_id=<space_id>"
               },
           },
           {
               "id": "sample_googlequery_conn",
               "name": "Google bigquery connection",
               "type": "data_asset",
               "connection": {},
               "location": {
                     "href": "/v2/assets/<asset_id>?space_id=<space_id>"
               },
           }],
  	  "output_data_references": {
  	  	        "id": "sample_db2_conn",
                "type": "data_asset",
                "connection": {},
                "location": {
                    "href": "/v2/assets/<asset_id>?space_id=<space_id>"
                },
          }
}
Nota: O parâmetro de variáveis de ambiente de tarefas de implementação não é aplicável..

Especificação de referências de dados de forma programática

Se você estiver especificando referências de dados de entrada e saída de forma programática:

  • A referência de origem de dados type depende do tipo de ativo. Consulte a seção Tipos de referência de origem de dados em Incluindo ativos de dados em um espaço de implementação.
  • As tarefas do SPSS suportam diversas entradas de origem de dados e uma única saída. Se o esquema não estiver nos metadados do modelo quando você o salvou, será necessário inserir id manualmente e selecionar um ativo de dados para cada conexão. Se o esquema for fornecido nos metadados do modelo, os nomes id serão preenchidos automaticamente usando os metadados. Você seleciona o ativo de dados para os ' ids correspondentes no watsonx.ai Studio. Para obter mais informações, consulte Usando várias fontes de dados para uma tarefa do SPSS
  • Para criar um ativo local ou gerenciado como uma referência de dados de saída, o campo name deve ser especificado para output_data_reference , para que um ativo de dados seja criado com o nome especificado Você não pode especificar um href que se refira a um ativo de dados local existente.
Nota:

Os ativos de dados conectados que se referem a bancos de dados suportados podem ser criados no output_data_references somente quando o input_data_references também se refere a uma destas origens

  • Se estiver criando um trabalho usando o cliente Python, você deverá fornecer o nome da conexão que é referido nos nós de dados do modelo SPSS no campo id e o href do ativo de dados em location.href para referências de dados de entrada/saída da carga útil dos trabalhos de implantação. Por exemplo, é possível construir a carga útil da tarefa como esta:

    job_payload_ref = {
        client.deployments.ScoringMetaNames.INPUT_DATA_REFERENCES: [{
            "id": "DB2Connection",
            "name": "drug_ref_input1",
            "type": "data_asset",
            "connection": {},
            "location": {
                "href": <input_asset_href1>
            }
        },{
            "id": "Db2 WarehouseConn",
            "name": "drug_ref_input2",
            "type": "data_asset",
            "connection": {},
            "location": {
                "href": <input_asset_href2>
            }
        }],
        client.deployments.ScoringMetaNames.OUTPUT_DATA_REFERENCE: {
                "type": "data_asset",
                "connection": {},
                "location": {
                    "href": <output_asset_href>
                }
            }
        }