TextFeaturizingEstimator 類別
定義
重要
部分資訊涉及發行前產品,在發行之前可能會有大幅修改。 Microsoft 對此處提供的資訊,不做任何明確或隱含的瑕疵擔保。
一種將一組文字文件轉換為數值特徵向量的估計器。 特徵向量是根據提供的選項,正規化的字數和/或字元n-gram數。
public sealed class TextFeaturizingEstimator : Microsoft.ML.IEstimator<Microsoft.ML.ITransformer>
type TextFeaturizingEstimator = class
interface IEstimator<ITransformer>
Public NotInheritable Class TextFeaturizingEstimator
Implements IEstimator(Of ITransformer)
- 繼承
-
TextFeaturizingEstimator
- 實作
備註
估算器特性
| 這個估計器需要查看資料來訓練參數嗎? | Yes. |
| 輸入欄位資料型別 | text |
| 輸出欄位資料型態 | Single 向量 |
| 可匯出至 ONNX | No |
此估計器為使用者提供一站式解決方案:
- 語言偵測
- Tokenization
- 文字正規化
- 預設與自訂的塞字移除
- 基於 Word 或基於字元的 Ngram 擷取,以及 SkipGram 擷取(透過進階選項)
- TF、IDF 或 TF-IDF
- L-p 向量正規化
預設特徵由(單字/字元)n-gram/跳過克組成,特徵數量等於分析資料後發現的詞彙量大小。 若要輸出包含所產生標記的額外欄位,請使用 OutputTokensColumnName。 特徵數量也可透過選擇最大n-gram數以保持在 中 TextFeaturizingEstimator.Options,進一步調整估計量來指定。
請參考「參見」區塊,裡面有使用範例的連結。
方法
| 名稱 | Description |
|---|---|
| Fit(IDataView) |
訓練並返回 ITransformer。 |
| GetOutputSchema(SchemaShape) |
回傳 SchemaShape 由變壓器產生的結構結構。 用於結構傳播與管線驗證。 |
擴充方法
| 名稱 | Description |
|---|---|
| AppendCacheCheckpoint<TTrans>(IEstimator<TTrans>, IHostEnvironment) |
在估計鏈中附加一個「快取檢查點」。 這將確保下游估計器能針對快取資料進行訓練。 在訓練師接受多次資料通行前設置快取檢查點會很有幫助。 |
| WithOnFitDelegate<TTransformer>(IEstimator<TTransformer>, Action<TTransformer>) |
給定一個估計器,回傳一個包裹物件,該物件會呼叫一次 Fit(IDataView) 代理。 估計器通常回傳擬合的資訊很重要,因此該 Fit(IDataView) 方法回傳一個特定型別的物件,而非一般 ITransformer的 。 然而,同時, IEstimator<TTransformer> 通常會被組成包含許多物件的管線,因此我們可能需要建立一條估計鏈,將 EstimatorChain<TLastTransformer> 我們想要取得變壓器的估計器埋藏在這條鏈的某處。 在這種情況下,我們可以透過此方法附加一個代理,當 fit 被呼叫時會被呼叫。 |