Conceitos de amostragem aleatória

Em geral, os tipos de amostragem aleatória, em linha e em bloco são compatíveis com o site IBM watsonx.data intelligence. Várias condições definem como a amostra é composta.

Para ativos de dados conectados, é verificado se o conector suporta pushdown de amostragem para a fonte de dados. Se o tipo de amostragem for compatível, a amostragem ocorrerá na fonte de dados.

Se o conector não suportar nenhum desses tipos de amostragem, 80% dos registros em cada lote de 10.000 registros lidos serão selecionados para a amostra até que o tamanho de amostra necessário seja atingido.

Por exemplo, se você tiver uma tabela com 10.000.000 de registros e for necessária uma amostra aleatória de 50.000 registros, 80% dos registros serão buscados em cada lote de 10.000 registros, o que resulta em 8.000 registros por lote neste caso. Portanto, para obter uma amostra de 50.000 registros, são lidos cerca de 7 lotes de 10.000 registros.