Dettagli di input per la Python distribuzione in batch degli script

Seguire queste regole quando si specificano i dettagli di input per le distribuzioni batch degli Python script.

Tabella riassuntiva dei tipi di dati:

Tipi di dati e formati di file accettati
Dati Descrizione
Tipo Riferimenti ai dati
Formati di file Qualsiasi

origini dati

Riferimenti ai dati di input o output:

  • Risorse locali o gestite dallo spazio
  • Risorse connesse (remote) nell'archiviazione cloud e nei volumi di archiviazione

Note:

  • Per le connessioni di archiviazione cloud come Cloud Object Storage, è necessario configurare la chiave di accesso e la chiave segreta, note anche come credenziali HMAC.

Se si specificano i riferimenti ai dati di input/output a livello di programmazione:

  • Il riferimento alla type fonte dei dati dipende dal tipo di risorsa. Per ulteriori informazioni, consultare la sezione Tipi di riferimento delle origini dati in Aggiunta di risorse dati a uno spazio di distribuzione.
  • È possibile specificare le variabili di ambiente necessarie per l'esecuzione dello Python script come 'key': 'value' coppie in scoring.environment_variables. Il key deve essere il nome di una variabile d'ambiente e il value deve essere il valore corrispondente della variabile d'ambiente.
  • Il payload del processo di distribuzione viene salvato come file JSON nel contenitore di distribuzione in cui viene eseguito lo Python script. Lo Python script può accedere al nome completo del percorso del file JSON che utilizza la variabile JOBS_PAYLOAD_FILE di ambiente.
  • Se i dati di input sono referenziati come risorsa dati locale o gestita, il servizio di distribuzione scarica i dati di input e li colloca nel contenitore di distribuzione in cui viene eseguito lo Python script. È possibile accedere alla posizione (percorso) dei dati di input scaricati tramite la variabile BATCH_INPUT_DIR di ambiente.
  • Per i riferimenti ai dati di input (risorsa dati o risorsa connessione), il download dei dati deve essere gestito dallo Python script. Se nel payload dei processi di distribuzione è presente una risorsa dati connessa o una risorsa di connessione, è possibile accedervi utilizzando la variabile JOBS_PAYLOAD_FILE di ambiente che contiene il percorso completo del payload del processo di distribuzione salvato come file JSON.
  • Se i dati di output devono essere conservati come risorsa dati locale o gestita in uno spazio, è possibile specificare il nome della risorsa da creare in scoring.output_data_reference.location.name. Come parte di uno Python script, i dati di output possono essere inseriti nel percorso specificato dalla variabile BATCH_OUTPUT_DIR di ambiente. Il servizio di distribuzione comprime i dati in un formato di file compresso e li carica nella posizione specificata in BATCH_OUTPUT_DIR.
  • Queste variabili d'ambiente sono impostate internamente. Se provi a impostarli manualmente, i tuoi valori vengono sovrascritti:
    • BATCH_INPUT_DIR
    • BATCH_OUTPUT_DIR
    • JOBS_PAYLOAD_FILE
  • Se i dati di output devono essere salvati in un archivio dati remoto, è necessario specificare il riferimento dei dati di output (ad esempio, una risorsa dati o una risorsa dati collegata) in output_data_reference.location. Lo Python script deve occuparsi di caricare i dati di output nella fonte dati remota. Se nel payload dei processi di distribuzione è presente un asset dati connesso o un riferimento a un asset di connessione, è possibile accedervi utilizzando la variabile JOBS_PAYLOAD_FILE di ambiente, che contiene il percorso completo del payload del processo di distribuzione salvato come file JSON.
  • Se lo Python script non richiede che nel payload del processo di distribuzione siano specificati riferimenti a dati di input o output, non fornire gli scoring.input_data_references oggetti scoring.output_data_references e nel payload.

Ulteriori informazioni

Distribuzione di script in Watson Machine Learning.