Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
Usage
microsoftml.rx_featurize(data: typing.Union[revoscalepy.datasource.RxDataSource.RxDataSource,
pandas.core.frame.DataFrame],
output_data: typing.Union[revoscalepy.datasource.RxDataSource.RxDataSource,
str] = None, overwrite: bool = False,
data_threads: int = None, random_seed: int = None,
max_slots: int = 5000, ml_transforms: list = None,
ml_transform_vars: list = None, row_selection: str = None,
transforms: dict = None, transform_objects: dict = None,
transform_function: str = None,
transform_variables: list = None,
transform_packages: list = None,
transform_environment: dict = None, blocks_per_read: int = None,
report_progress: int = None, verbose: int = 1,
compute_context: revoscalepy.computecontext.RxComputeContext.RxComputeContext = None)
Description
Transforma dados de um conjunto de dados de entrada para um conjunto de dados de saída.
Arguments
dados
Um objeto fonte de dados revoscalepy , um quadro de dados ou o caminho para um .xdf ficheiro.
output_data
Texto de saída ou nome de ficheiro xdf ou um RxDataSource com capacidades de escrita para armazenar dados transformados. Se não houver, é devolvida uma trama de dados. O valor predefinido é None.
substituir
Se True, um existente output_data for sobrescrito; se False um existente output_data não for sobrescrito. O valor predefinido é False.
data_threads
Um inteiro que especifica o grau desejado de paralelismo no pipeline de dados. Se não for nenhum, o número de threads usados é determinado internamente. O valor predefinido é None.
random_seed
Especifica a semente aleatória. O valor predefinido é None.
max_slots
Slots máximos para devolver para colunas de valor vetorial (<=0 para devolver tudo).
ml_transforms
Especifica uma lista de transformações MicrosoftML a realizar nos dados antes do treino ou Nenhuma se não forem realizadas transformações. Veja featurize_text, categorical, e categorical_hash, para transformações que são suportadas.
Estas transformações são realizadas após quaisquer transformações em Python especificadas.
O valor predefinido é None.
ml_transform_vars
Especifica um vetor de caracteres com nomes de variáveis a serem usados em ml_transforms ou Nenhum se não for necessário usar nenhum.
O valor predefinido é None.
row_selection
NÃO SUPORTADO. Especifica as linhas (observações) do conjunto de dados que serão usadas pelo modelo com o nome de uma variável lógica do conjunto de dados (entre aspas) ou com uma expressão lógica usando variáveis do conjunto de dados. Por exemplo:
row_selection = "old"só usará observações em que o valor da variáveloldéTrue.row_selection = (age > 20) & (age < 65) & (log(income) > 10)só utiliza observações em que o valor daagevariável está entre 20 e 65 e o valorlogdaincomevariável é superior a 10.
A seleção de linhas é realizada após o processamento de quaisquer transformações de dados (ver os argumentos transforms ou transform_function). Como em todas as expressões, row_selection pode ser definido fora da chamada de função usando a expression função.
transforma
NÃO SUPORTADO. Uma expressão da forma que representa a primeira ronda de transformações de variáveis. Como em todas as expressões, transforms (ou row_selection) pode ser definido fora da chamada de função usando a expression função.
O valor predefinido é None.
transform_objects
NÃO SUPORTADO. Uma lista nomeada que contém objetos que podem ser referenciados por transforms, transform_function, e row_selection. O valor predefinido é None.
transform_function
A função de transformação de variáveis. O valor predefinido é None.
transform_variables
Um vetor de caracteres das variáveis do conjunto de dados de entrada necessárias para a função de transformação. O valor predefinido é None.
transform_packages
NÃO SUPORTADO. Um vetor de caracteres que especifica pacotes Python adicionais (para além dos especificados em RxOptions.get_option("transform_packages")) a serem disponibilizados e pré-carregados para uso em funções de transformação de variáveis.
Por exemplo, aquelas definidas explicitamente em funções revoscalepy através dos argumentos e transformstransform_function ou aquelas definidas implicitamente através dos argumentos ou formularow_selection . O transform_packages argumento pode também ser Nenhum, indicando que nenhum pacote externo RxOptions.get_option("transform_packages") está pré-carregado.
transform_environment
NÃO SUPORTADO. Um ambiente definido pelo utilizador para servir como pai de todos os ambientes desenvolvidos internamente e usados para transformação de dados variáveis.
Se transform_environment = None, um novo ambiente "hash" com o pai revoscalepy.baseenv for usado em vez disso. O valor padrão é Nenhum.
blocks_per_read
Especifica o número de blocos a ler para cada bloco de dados lido da fonte de dados.
report_progress
Um valor inteiro que especifica o nível de reporte sobre o progresso do processamento da linha:
0: Não há progresso reportado.1: o número de linhas processadas é impresso e atualizado.2: as linhas processadas e os tempos são reportados.3: linhas processadas e todos os tempos são reportados.
O valor predefinido é 1.
verbose
Um valor inteiro que especifica a quantidade de saída desejada.
Se 0, não é impressa nenhuma saída detalhada durante os cálculos. Valores inteiros de 1 para 4 fornecer quantidades crescentes de informação.
O valor predefinido é 1.
compute_context
Define o contexto em que os cálculos são executados, especificado com uma revoscalpy válida. RxComputeContext. Atualmente local e revoscalepy. São suportados contextos de computação RxInSqlServer .
Devoluções
Uma trama de dados ou uma revoscalpy. O objeto RxDataSource representa os dados de saída criados.
Example
'''
Example with rx_featurize.
'''
import numpy
import pandas
from microsoftml import rx_featurize, categorical
# rx_featurize basically allows you to access data from the MicrosoftML transforms
# In this example we'll look at getting the output of the categorical transform
# Create the data
categorical_data = pandas.DataFrame(data=dict(places_visited=[
"London", "Brunei", "London", "Paris", "Seria"]),
dtype="category")
print(categorical_data)
# Invoke the categorical transform
categorized = rx_featurize(data=categorical_data,
ml_transforms=[categorical(cols=dict(xdatacat="places_visited"))])
# Now let's look at the data
print(categorized)
Saída:
places_visited
0 London
1 Brunei
2 London
3 Paris
4 Seria
Beginning processing data.
Rows Read: 5, Read Time: 0, Transform Time: 0
Beginning processing data.
Beginning processing data.
Rows Read: 5, Read Time: 0, Transform Time: 0
Beginning processing data.
Elapsed time: 00:00:00.0521300
Finished writing 5 rows.
Writing completed.
places_visited xdatacat.London xdatacat.Brunei xdatacat.Paris \
0 London 1.0 0.0 0.0
1 Brunei 0.0 1.0 0.0
2 London 1.0 0.0 0.0
3 Paris 0.0 0.0 1.0
4 Seria 0.0 0.0 0.0
xdatacat.Seria
0 0.0
1 0.0
2 0.0
3 0.0
4 1.0