Dettagli di input per la Python distribuzione in batch degli script
Seguire queste regole quando si specificano i dettagli di input per le distribuzioni batch degli Python script.
Tabella riassuntiva dei tipi di dati:
| Dati | Descrizione |
|---|---|
| Tipo | Riferimenti ai dati |
| Formati di file | Qualsiasi |
origini dati
Riferimenti ai dati di input o output:
- Risorse locali o gestite dallo spazio
- Risorse connesse (remote) nell'archiviazione cloud e nei volumi di archiviazione
Note:
- Per le connessioni di archiviazione cloud come Cloud Object Storage, è necessario configurare la chiave di accesso e la chiave segreta, note anche come credenziali HMAC.
Se si specificano i riferimenti ai dati di input/output a livello di programmazione:
- Il riferimento alla
typefonte dei dati dipende dal tipo di risorsa. Per ulteriori informazioni, consultare la sezione Tipi di riferimento delle origini dati in Aggiunta di risorse dati a uno spazio di distribuzione. - È possibile specificare le variabili di ambiente necessarie per l'esecuzione dello Python script come
'key': 'value'coppie inscoring.environment_variables. Ilkeydeve essere il nome di una variabile d'ambiente e ilvaluedeve essere il valore corrispondente della variabile d'ambiente. - Il payload del processo di distribuzione viene salvato come file JSON nel contenitore di distribuzione in cui viene eseguito lo Python script. Lo Python script può accedere al nome completo del percorso del file JSON che utilizza la variabile
JOBS_PAYLOAD_FILEdi ambiente. - Se i dati di input sono referenziati come risorsa dati locale o gestita, il servizio di distribuzione scarica i dati di input e li colloca nel contenitore di distribuzione in cui viene eseguito lo Python script. È possibile accedere alla posizione (percorso) dei dati di input scaricati tramite la variabile
BATCH_INPUT_DIRdi ambiente. - Per i riferimenti ai dati di input (risorsa dati o risorsa connessione), il download dei dati deve essere gestito dallo Python script. Se nel payload dei processi di distribuzione è presente una risorsa dati connessa o una risorsa di connessione, è possibile accedervi utilizzando la variabile
JOBS_PAYLOAD_FILEdi ambiente che contiene il percorso completo del payload del processo di distribuzione salvato come file JSON. - Se i dati di output devono essere conservati come risorsa dati locale o gestita in uno spazio, è possibile specificare il nome della risorsa da creare in
scoring.output_data_reference.location.name. Come parte di uno Python script, i dati di output possono essere inseriti nel percorso specificato dalla variabileBATCH_OUTPUT_DIRdi ambiente. Il servizio di distribuzione comprime i dati in un formato di file compresso e li carica nella posizione specificata inBATCH_OUTPUT_DIR. - Queste variabili d'ambiente sono impostate internamente. Se provi a impostarli manualmente, i tuoi valori vengono sovrascritti:
BATCH_INPUT_DIRBATCH_OUTPUT_DIRJOBS_PAYLOAD_FILE
- Se i dati di output devono essere salvati in un archivio dati remoto, è necessario specificare il riferimento dei dati di output (ad esempio, una risorsa dati o una risorsa dati collegata) in
output_data_reference.location. Lo Python script deve occuparsi di caricare i dati di output nella fonte dati remota. Se nel payload dei processi di distribuzione è presente un asset dati connesso o un riferimento a un asset di connessione, è possibile accedervi utilizzando la variabileJOBS_PAYLOAD_FILEdi ambiente, che contiene il percorso completo del payload del processo di distribuzione salvato come file JSON. - Se lo Python script non richiede che nel payload del processo di distribuzione siano specificati riferimenti a dati di input o output, non fornire gli
scoring.input_data_referencesoggettiscoring.output_data_referencese nel payload.