Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Usage
microsoftml.rx_predict(model,
data: typing.Union[revoscalepy.datasource.RxDataSource.RxDataSource,
pandas.core.frame.DataFrame],
output_data: typing.Union[revoscalepy.datasource.RxDataSource.RxDataSource,
str] = None, write_model_vars: bool = False,
extra_vars_to_write: list = None, suffix: str = None,
overwrite: bool = False, data_threads: int = None,
blocks_per_read: int = None, report_progress: int = None,
verbose: int = 1,
compute_context: revoscalepy.computecontext.RxComputeContext.RxComputeContext = None,
**kargs)
Description
Rapporterar poängsättning per instans resulterar i en dataram eller revoscalepy datakälla med hjälp av en tränad Microsoft ML strojové učenie-modell med arevoscalepydata-källa.
Detaljer
Följande objekt rapporteras som standard i utdatan: poängsättning på tre variabler för de binära klassificerarna: PredictedLabel, Score och Probability; Score för oneClassSvm och regressionsklassificerare; PredictedLabel för multiklassklassificerare, plus en variabel för varje kategori som föregår av Score.
Arguments
model
Ett modellinformationsobjekt returnerat från en microsoftml-modell.
Till exempel returnerade ett objekt från rx_fast_trees eller rx_logistic_regression.
data
Ett revoscalepy datakällobjekt, en dataram eller vägen till en .xdf fil.
output_data
Skriv ut text eller xdf-filnamn eller har RxDataSource skrivmöjligheter för att lagra transformerad data. Om ingen är returneras en dataram. Standardvärdet är Ingen.
write_model_vars
Om True, skrivs variabler i modellen till utdatamängden utöver poängvariablerna.
Om variabler från indatamängden transformeras i modellen inkluderas även de transformerade variablerna. Standardvärdet är False.
extra_vars_to_write
None eller teckenvektor av ytterligare variabler namn från indatan att inkludera i output_data. Om write_model_vars är True, inkluderas även modellvariabler. Standardvärdet är None.
suffix
En teckensträng som specificerar suffixet att lägga till den skapade poängvariabeln/variablerna, eller None i finns inget suffix. Standardvärdet är None.
skriv över
Om True, skrivs en existens output_data över; om False en existerande output_data inte skrivs över. Standardvärdet är False.
data_threads
Ett heltal som specificerar önskad grad av parallellism i datapipelinen. Om ingen är det, bestäms antalet använda trådar internt. Standardvärdet är Ingen.
blocks_per_read
Anger antalet block som ska läsas för varje segment av data som läss från datakällan.
report_progress
Ett heltalsvärde som anger rapporteringsnivån för radbearbetningsförloppet:
0: Inga förlopp rapporteras.1: Antalet bearbetade rader skrivs ut och uppdateras.2: Rader som bearbetas och tidsinställningar rapporteras.3: bearbetade rader och alla tidsinställningar rapporteras.
Standardvärdet är 1.
omständig
Ett heltalsvärde som anger önskad mängd utdata.
Om 0skrivs inga utförliga utdata ut under beräkningar. Heltalsvärden från 1 för att 4 ge ökande mängder information.
Standardvärdet är 1.
compute_context
Anger kontexten där beräkningar körs, som anges med en giltig revoscalepy. RxComputeContext. För närvarande lokal och revoscalepy. RxInSqlServer-beräkningskontexter stöds.
kargs
Ytterligare argument som skickas till beräkningsmotorn.
Retur
En dataram eller en revoskalering. RxDataSource-objektet representerar den skapade utdatan. Som standard inkluderar utdata från poänggivande binära klassificerare tre variabler: PredictedLabel, Score, och Probability; rx_oneclass_svm och regression inkluderar en variabel: Score; och multiklassklassificerare inkluderar PredictedLabel plus en variabel för varje kategori som föregås av Score. Om en suffix tillhandahålls läggs den till i slutet av dessa utdatavariabelnamn.
Exempel på binär klassificering
'''
Binary Classification.
'''
import numpy
import pandas
from microsoftml import rx_fast_linear, rx_predict
from revoscalepy.etl.RxDataStep import rx_data_step
from microsoftml.datasets.datasets import get_dataset
infert = get_dataset("infert")
import sklearn
if sklearn.__version__ < "0.18":
from sklearn.cross_validation import train_test_split
else:
from sklearn.model_selection import train_test_split
infertdf = infert.as_df()
infertdf["isCase"] = infertdf.case == 1
data_train, data_test, y_train, y_test = train_test_split(infertdf, infertdf.isCase)
forest_model = rx_fast_linear(
formula=" isCase ~ age + parity + education + spontaneous + induced ",
data=data_train)
# RuntimeError: The type (RxTextData) for file is not supported.
score_ds = rx_predict(forest_model, data=data_test,
extra_vars_to_write=["isCase", "Score"])
# Print the first five rows
print(rx_data_step(score_ds, number_rows_read=5))
Resultat:
Automatically adding a MinMax normalization transform, use 'norm=Warn' or 'norm=No' to turn this behavior off.
Beginning processing data.
Rows Read: 186, Read Time: 0, Transform Time: 0
Beginning processing data.
Beginning processing data.
Rows Read: 186, Read Time: 0.001, Transform Time: 0
Beginning processing data.
Beginning processing data.
Rows Read: 186, Read Time: 0.001, Transform Time: 0
Beginning processing data.
Using 2 threads to train.
Automatically choosing a check frequency of 2.
Auto-tuning parameters: maxIterations = 8064.
Auto-tuning parameters: L2 = 2.666837E-05.
Auto-tuning parameters: L1Threshold (L1/L2) = 0.
Using best model from iteration 590.
Not training a calibrator because it is not needed.
Elapsed time: 00:00:00.6058289
Elapsed time: 00:00:00.0084728
Beginning processing data.
Rows Read: 62, Read Time: 0, Transform Time: 0
Beginning processing data.
Elapsed time: 00:00:00.0302359
Finished writing 62 rows.
Writing completed.
Rows Read: 5, Total Rows Processed: 5, Total Chunk Time: 0.001 seconds
isCase PredictedLabel Score Probability
0 False True 0.576775 0.640325
1 False False -2.929549 0.050712
2 True False -2.370090 0.085482
3 False False -1.700105 0.154452
4 False False -0.110981 0.472283
Regressionsexempel
'''
Regression.
'''
import numpy
import pandas
from microsoftml import rx_fast_trees, rx_predict
from revoscalepy.etl.RxDataStep import rx_data_step
from microsoftml.datasets.datasets import get_dataset
airquality = get_dataset("airquality")
import sklearn
if sklearn.__version__ < "0.18":
from sklearn.cross_validation import train_test_split
else:
from sklearn.model_selection import train_test_split
airquality = airquality.as_df()
######################################################################
# Estimate a regression fast forest
# Use the built-in data set 'airquality' to create test and train data
df = airquality[airquality.Ozone.notnull()]
df["Ozone"] = df.Ozone.astype(float)
data_train, data_test, y_train, y_test = train_test_split(df, df.Ozone)
airFormula = " Ozone ~ Solar_R + Wind + Temp "
# Regression Fast Forest for train data
ff_reg = rx_fast_trees(airFormula, method="regression", data=data_train)
# Put score and model variables in data frame
score_df = rx_predict(ff_reg, data=data_test, write_model_vars=True)
print(score_df.head())
# Plot actual versus predicted values with smoothed line
# Supported in the next version.
# rx_line_plot(" Score ~ Ozone ", type=["p", "smooth"], data=score_df)
Resultat:
'unbalanced_sets' ignored for method 'regression'
Not adding a normalizer.
Making per-feature arrays
Changing data from row-wise to column-wise
Beginning processing data.
Rows Read: 87, Read Time: 0.001, Transform Time: 0
Beginning processing data.
Warning: Skipped 4 instances with missing features during training
Processed 83 instances
Binning and forming Feature objects
Reserved memory for tree learner: 22620 bytes
Starting to train ...
Not training a calibrator because it is not needed.
Elapsed time: 00:00:00.0390764
Elapsed time: 00:00:00.0080750
Beginning processing data.
Rows Read: 29, Read Time: 0.001, Transform Time: 0
Beginning processing data.
Elapsed time: 00:00:00.0221875
Finished writing 29 rows.
Writing completed.
Solar_R Wind Temp Score
0 290.0 9.2 66.0 33.195541
1 259.0 15.5 77.0 20.906796
2 276.0 5.1 88.0 76.594643
3 139.0 10.3 81.0 31.668842
4 236.0 14.9 81.0 43.590839