Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Usage
microsoftml.rx_featurize(data: typing.Union[revoscalepy.datasource.RxDataSource.RxDataSource,
pandas.core.frame.DataFrame],
output_data: typing.Union[revoscalepy.datasource.RxDataSource.RxDataSource,
str] = None, overwrite: bool = False,
data_threads: int = None, random_seed: int = None,
max_slots: int = 5000, ml_transforms: list = None,
ml_transform_vars: list = None, row_selection: str = None,
transforms: dict = None, transform_objects: dict = None,
transform_function: str = None,
transform_variables: list = None,
transform_packages: list = None,
transform_environment: dict = None, blocks_per_read: int = None,
report_progress: int = None, verbose: int = 1,
compute_context: revoscalepy.computecontext.RxComputeContext.RxComputeContext = None)
Description
Omvandlar data från en indatamängd till en utdatamängd.
Arguments
data
Ett revoscalepy datakällobjekt, en dataram eller vägen till en .xdf fil.
output_data
Skriv ut text eller xdf-filnamn eller har RxDataSource skrivmöjligheter för att lagra transformerad data. Om ingen är returneras en dataram. Standardvärdet är Ingen.
skriv över
Om True, skrivs en existens output_data över; om False en existerande output_data inte skrivs över. Standardvärdet är False.
data_threads
Ett heltal som specificerar önskad grad av parallellism i datapipelinen. Om ingen är det, bestäms antalet använda trådar internt. Standardvärdet är Ingen.
random_seed
Anger det slumpmässiga fröet. Standardvärdet är Ingen.
max_slots
Maxplatser för att returnera för vektorvärda kolumner (<=0 för att returnera alla).
ml_transforms
Anger en lista över MicrosoftML-transformeringar som ska utföras på data före träning eller Ingen om inga transformeringar ska utföras. Se featurize_text, categoricaloch categorical_hash, för transformeringar som stöds.
Dessa transformeringar utförs efter alla angivna Python-transformeringar.
Standardvärdet är Ingen.
ml_transform_vars
Anger en teckenvektor med variabelnamn som ska användas i ml_transforms eller Ingen om ingen ska användas.
Standardvärdet är Ingen.
row_selection
STÖDS INTE. Anger raderna (observationer) från datauppsättningen som ska användas av modellen med namnet på en logisk variabel från datauppsättningen (inom citattecken) eller med ett logiskt uttryck med variabler i datauppsättningen. Ett exempel:
row_selection = "old"använder endast observationer där värdet för variabelnoldärTrue.row_selection = (age > 20) & (age < 65) & (log(income) > 10)använder endast observationer där variabelnsagevärde är mellan 20 och 65 och värdet för variabelnlogincomeär större än 10.
Radmarkeringen utförs efter bearbetning av datatransformeringar (se argumenten transforms eller transform_function). Som med alla uttryck kan definieras utanför funktionsanropet row_selection med hjälp av expression funktionen.
Förvandlar
STÖDS INTE. Ett uttryck för formuläret som representerar den första omgången av variabeltransformeringar. Precis som med alla uttryck kan (eller transforms) definieras utanför funktionsanropet row_selection med hjälp expression av funktionen.
Standardvärdet är Ingen.
transform_objects
STÖDS INTE. En namngiven lista som innehåller objekt som kan refereras till av transforms, transform_functionoch row_selection. Standardvärdet är Ingen.
transform_function
Funktionen för variabeltransformeringen. Standardvärdet är Ingen.
transform_variables
En teckenvektor för indatauppsättningsvariabler som behövs för transformeringsfunktionen. Standardvärdet är Ingen.
transform_packages
STÖDS INTE. En teckenvektor som anger ytterligare Python-paket (utanför de som anges i RxOptions.get_option("transform_packages")) som ska göras tillgängliga och förinlästa för användning i variabeltransformeringsfunktioner.
Till exempel de som uttryckligen definieras i revoscalepy-funktioner via deras transforms argument och transform_function argument eller de som definieras implicit via deras formula eller row_selection argument. Argumentet transform_packages kan också vara Ingen, vilket indikerar att inga paket utanför RxOptions.get_option("transform_packages") är förinstallerade.
transform_environment
STÖDS INTE. En användardefinierad miljö som fungerar som överordnad till alla miljöer som utvecklats internt och används för variabel datatransformering.
Om transform_environment = None, används istället en ny "hash"-miljö med föräldramiljön revoscalepy.baseenv. Standardvärdet är Ingen.
blocks_per_read
Anger antalet block som ska läsas för varje segment av data som läss från datakällan.
report_progress
Ett heltalsvärde som anger rapporteringsnivån för radbearbetningsförloppet:
0: Inga förlopp rapporteras.1: Antalet bearbetade rader skrivs ut och uppdateras.2: Rader som bearbetas och tidsinställningar rapporteras.3: bearbetade rader och alla tidsinställningar rapporteras.
Standardvärdet är 1.
omständig
Ett heltalsvärde som anger önskad mängd utdata.
Om 0skrivs inga utförliga utdata ut under beräkningar. Heltalsvärden från 1 för att 4 ge ökande mängder information.
Standardvärdet är 1.
compute_context
Anger kontexten där beräkningar körs, som anges med en giltig revoscalepy. RxComputeContext. För närvarande lokal och revoscalepy. RxInSqlServer-beräkningskontexter stöds.
Retur
En dataram eller en revoskalering. RxDataSource-objektet representerar den skapade utdatan.
Example
'''
Example with rx_featurize.
'''
import numpy
import pandas
from microsoftml import rx_featurize, categorical
# rx_featurize basically allows you to access data from the MicrosoftML transforms
# In this example we'll look at getting the output of the categorical transform
# Create the data
categorical_data = pandas.DataFrame(data=dict(places_visited=[
"London", "Brunei", "London", "Paris", "Seria"]),
dtype="category")
print(categorical_data)
# Invoke the categorical transform
categorized = rx_featurize(data=categorical_data,
ml_transforms=[categorical(cols=dict(xdatacat="places_visited"))])
# Now let's look at the data
print(categorized)
Resultat:
places_visited
0 London
1 Brunei
2 London
3 Paris
4 Seria
Beginning processing data.
Rows Read: 5, Read Time: 0, Transform Time: 0
Beginning processing data.
Beginning processing data.
Rows Read: 5, Read Time: 0, Transform Time: 0
Beginning processing data.
Elapsed time: 00:00:00.0521300
Finished writing 5 rows.
Writing completed.
places_visited xdatacat.London xdatacat.Brunei xdatacat.Paris \
0 London 1.0 0.0 0.0
1 Brunei 0.0 1.0 0.0
2 London 1.0 0.0 0.0
3 Paris 0.0 0.0 1.0
4 Seria 0.0 0.0 0.0
xdatacat.Seria
0 0.0
1 0.0
2 0.0
3 0.0
4 1.0