BertTokenizer 類別
定義
重要
部分資訊涉及發行前產品,在發行之前可能會有大幅修改。 Microsoft 對此處提供的資訊,不做任何明確或隱含的瑕疵擔保。
Bert 模型的分詞器。
public sealed class BertTokenizer : Microsoft.ML.Tokenizers.WordPieceTokenizer
type BertTokenizer = class
inherit WordPieceTokenizer
Public NotInheritable Class BertTokenizer
Inherits WordPieceTokenizer
- 繼承
備註
BertTokenizer 是基於 WordPieceTokenizer,用於為 Bert 模型進行文字分詞。 BertTokenizer 的實作基於 Hugging Face Transformers 函式庫中的原始 Bert 實作。 https://huggingface.co/transformers/v3.0.2/model_doc/bert.html?highlight=berttokenizerfast#berttokenizer
屬性
| 名稱 | Description |
|---|---|
| ApplyBasicTokenization |
會得到一個值,指示分詞器是否應該進行基本分詞。 像是乾淨的文字、正規化、縮小大寫等等。 |
| ClassificationToken |
取得分類器標記,用於序列分類(整個序列分類,而非逐標記分類)。 當用特殊標記堆疊時,它是序列中的第一個標記。 |
| ClassificationTokenId |
取得分類器標記 Id |
| ContinuingSubwordPrefix |
取得用於非詞首部分的子詞的前綴。 (繼承來源 WordPieceTokenizer) |
| IndividuallyTokenizeCjk |
會得到一個值,指示分詞器是否應該將日韓漢字拆分成符號。 |
| LowerCaseBeforeTokenization |
會得到一個值,指示分詞器是否應該將輸入文字縮小。 |
| MaskingToken |
取得用於遮罩值的遮罩標記。 這是用遮罩語言建模訓練模型時所使用的標記。 這就是模型會嘗試預測的標記。 |
| MaskingTokenId |
取得面具令牌 ID |
| MaxInputCharsPerWord |
在一個字中獲得最多可授權字元數。 (繼承來源 WordPieceTokenizer) |
| Normalizer |
讓 Tokenizer 使用正規化器。 (繼承來源 WordPieceTokenizer) |
| PaddingToken |
取得用於填充的標記,例如批次處理不同長度序列時 |
| PaddingTokenId |
取得填充標記 ID |
| PreTokenizer |
取得分幣器使用的預分組器。 (繼承來源 WordPieceTokenizer) |
| RemoveNonSpacingMarks |
會有一個值指示是否要移除非間距標記。 |
| SeparatorToken |
取得分隔符標記,用於從多個序列組成序列,例如兩個序列用於序列分類,或文本與問題用於問答。 它也被用作一個由特殊標記組成序列的最後一個標記。 |
| SeparatorTokenId |
取得分隔符 Id |
| SpecialTokens |
取得特殊代幣及其對應的ID。 (繼承來源 WordPieceTokenizer) |
| SplitOnSpecialTokens |
會獲得一個值,指示分詞器是否應該對特殊標記進行拆分,或將特殊標記視為一般文字。 |
| UnknownToken |
拿到未知標記。 詞彙表中不存在的標記無法轉換成 ID,並被設定為該標記。 (繼承來源 WordPieceTokenizer) |
| UnknownTokenId |
取得未知的令牌 ID。 詞彙表中不存在的標記無法轉換成 ID,並被設定為該標記。 (繼承來源 WordPieceTokenizer) |